Αποτελεσματική, μακροπρόθεσμη, βραχυπρόθεσμη ανάλυση συναισθήματος των κριτικών ηλεκτρονικού εμπορίου Μέρος 2
Jan 18, 2024
Ο Muhammad et al. [20] παρουσίασε ένα μοντέλο για συναισθηματική ανάλυση χρησιμοποιώντας word2vec και LSTM για κριτικές ξενοδοχείων.
Ο Μωάμεθ είναι ο προφήτης και ιδρυτής του Ισλάμ. Είναι γνωστός ως σοφός, σοφός και σοφός άνθρωπος. Η μνήμη του είναι πολύ ισχυρή, γεγονός που τον κάνει πολύ αποτελεσματικό στην επεξεργασία πληροφοριών και στην έκφραση των σκέψεών του.
Η μνήμη του Μωάμεθ έχει να κάνει πολύ με την εκπαίδευση και την εμπειρία του. Σύμφωνα με αρχεία, ήταν συχνά βυθισμένος στη σκέψη και τον προβληματισμό στα νιάτα του. Αυτή η περιέργεια και η δίψα για γνώση τον βοήθησαν να χτίσει μια ισχυρή βάση γνώσεων και ικανότητα μνήμης.
Επιπλέον, η ευφυΐα του Μωάμεθ έπαιξε επίσης μεγάλο ρόλο στις μνημονικές του ικανότητες. Είναι έξυπνος, πνευματώδης, διορατικός και έχει ικανότητα λογικής σκέψης, η οποία είναι πολύ συμφέρουσα όταν ασχολείται με σύνθετες πληροφορίες. Αυτό το πλεονέκτημα τον βοήθησε να διαχειρίζεται και να ελέγχει καλύτερα τη διαδικασία της μνήμης, βελτιώνοντας έτσι τη μνήμη του.
Ωστόσο, η μνήμη του Μωάμεθ δεν ήταν έμφυτη αλλά βελτιώθηκε με σκληρή δουλειά και εξάσκηση. Συχνά πραγματοποιεί εκπαίδευση μνήμης, όπως επαναλαμβανόμενη ανάγνωση, υπαγόρευση και ομιλία, για να τον βοηθήσει να κατανοήσει και να κατακτήσει τη γνώση βαθύτερα.
Η μνήμη του Μωάμεθ δεν ήταν απλώς ένα φυσικό ταλέντο, αλλά βελτιώθηκε με σκληρή δουλειά και εξάσκηση. Αυτό δείχνει ότι ο καθένας από εμάς μπορεί να βελτιώσει τη μνήμη του και να βελτιώσει τη μάθηση και την αποτελεσματικότητα της εργασίας του μέσω της μάθησης και της πρακτικής. Ας εργαζόμαστε, όπως ο Μωάμεθ, ενεργά σκληρά για να βελτιώνουμε συνεχώς τις μνημονικές μας δεξιότητες, για να πετύχουμε μεγαλύτερη επιτυχία στη ζωή και την εργασία! Μπορεί να φανεί ότι πρέπει να βελτιώσουμε τη μνήμη και το Cistanche deserticola μπορεί να βελτιώσει σημαντικά τη μνήμη, επειδή το Cistanche deserticola μπορεί επίσης να ρυθμίσει την ισορροπία των νευροδιαβιβαστών, όπως η αύξηση των επιπέδων ακετυλοχολίνης και αυξητικών παραγόντων. Αυτές οι ουσίες είναι πολύ σημαντικές για τη μνήμη και τη μάθηση. Επιπλέον, το κρέας μπορεί επίσης να βελτιώσει τη ροή του αίματος και να προωθήσει την παροχή οξυγόνου, η οποία μπορεί να εξασφαλίσει ότι ο εγκέφαλος λαμβάνει επαρκή θρεπτικά συστατικά και ενέργεια, βελτιώνοντας έτσι τη ζωτικότητα και την αντοχή του εγκεφάλου.

Κάντε κλικ στο Γνωρίζω για να βελτιώσετε τη βραχυπρόθεσμη μνήμη
Για αυτήν τη μελέτη, τα δεδομένα συλλέχθηκαν με ανίχνευση του ταξιδιωτικού ιστότοπου χρησιμοποιώντας σελήνιο και σκραπ. +e Ο κύριος σκοπός αυτού του πειράματος ήταν να αναλύσει την ακρίβεια αλλάζοντας τις παραμέτρους του word2vec και του LSTM. Τα αποτελέσματα +e έδειξαν ότι η μέση ακρίβεια 85,96 μπορούσε να επιτευχθεί χρησιμοποιώντας τις παραμέτρους, οι οποίες έδειξαν πολλά υποσχόμενα αποτελέσματα.
Οι Zhao et al. [21] εισήγαγε μια νέα τεχνική για την ανάλυση των συναισθημάτων των πελατών από κριτικές σε ιστότοπους ηλεκτρονικού εμπορίου. +e προτεινόμενη βελτιστοποιημένη τεχνική "the LocalSearch Improvised Bat Algorithm based Elman NeuralNetwork (LSIBA-ENN)" περιλαμβάνει τέσσερα βήματα και ανιχνεύει την πολικότητα και ταξινομεί τα συναισθήματα των κριτικών. Τα δεδομένα +e για αυτήν την έρευνα συγκεντρώθηκαν χρησιμοποιώντας το εργαλείο απόσυρσης ιστού σε ιστότοπους ηλεκτρονικού εμπορίου για την εξαγωγή κριτικών πελατών.
Εκτός από την προεπεξεργασία των δεδομένων, αυτή η μελέτη χρησιμοποιεί "Τροποποιημένη Συχνότητα Αντίστροφης Κατηγορίας βάσει LogTerm Frequency (LTF-MICF) και Υβριδικό Αλγόριθμο Θερμού της Γης (HMEWA)" για στάθμιση όρων και επιλογή χαρακτηριστικών. +e η προτεινόμενη μεθοδολογία ξεπέρασε τις άλλες βασικές τεχνικές όσον αφορά την ακρίβεια της πρόβλεψης.
Ο Jiang [22] πρότεινε ένα μοντέλο για την ταξινόμηση των συναισθημάτων των ανασκοπήσεων που ελήφθησαν από την πλατφόρμα ηλεκτρονικού εμπορίου Taobao.+e μελέτη χρησιμοποιεί τον αλγόριθμο μηχανικής μάθησης καθώς επίσης υποστηρίζει διανυσματική μηχανή για ταξινόμηση και βελτιστοποιημένη βελτιστοποίηση σμήνος σωματιδίων (IPSO) για τη βελτιστοποίηση των παραμέτρων. Τα δεδομένα +e για τη μελέτη συγκεντρώθηκαν με ανίχνευση των σχολίων από τον ιστότοπο. Τα πειραματικά αποτελέσματα έδειξαν ότι η συνδυασμένη προσέγγιση SVM και IPSO είχε μεγαλύτερη ακρίβεια. Ωστόσο, η πλειονότητα των υπαρχόντων μοντέλων υποφέρει από υπερπροσαρμογή [23-25], κακή ταχύτητα σύγκλισης [26-28] και προβλήματα κλίσης που εξαφανίζονται [29-31].
3. Πειραματική Μελέτη
Η ενότητα +is παρέχει μια σαφή επισκόπηση της μεθοδολογίας που χρησιμοποιείται στο έργο για την ταξινόμηση του συναισθήματος. Η τεχνική +e που έχει χρησιμοποιηθεί είναι ένα δίκτυο Μακροπρόθεσμης Μνήμης, το οποίο χρησιμοποιείται για την ταξινόμηση μεγάλου αριθμού κριτικών βάσης δεδομένων Amazon. Το +e ενσωμάτωση που χρησιμοποιείται είναι το word2vec, το οποίο έχει εκπαιδευτεί προσαρμοσμένα σύμφωνα με τη βάση δεδομένων.
Ο συντονισμός του word2vec σύμφωνα με το σύνολο δεδομένων βελτιώνει τη συνολική απόδοση του μοντέλου. Το πλεονέκτημα της χρήσης LSTM είναι ότι δίνει καλύτερα αποτελέσματα ακόμη και για τα μη δομημένα δεδομένα ανασκόπησης. Είναι σε θέση να αποκτήσει χρήσιμη λειτουργικότητα για πόρους που περιέχουν μακροπρόθεσμες εξαρτήσεις.
Τα δεδομένα +e συλλέγονται από το σύνολο δεδομένων αναθεώρησης του Amazon, το οποίο στη συνέχεια υποβάλλεται σε προεπεξεργασία. Οι ενσωματώσεις Word2vec αποτελούν ένα σημαντικό βήμα στην προεπεξεργασία των δεδομένων. Δημιουργήθηκαν δεδομένα τρένου και δοκιμών. Τα δεδομένα εκπαίδευσης +e χωρίζονται σε σύνολα δεδομένων αμαξοστοιχίας και επικύρωσης. +e προσαρμοσμένο μοντέλο word2vec είναι trainedper βάση δεδομένων. Λαμβάνεται το διάνυσμα χαρακτηριστικών +e, το οποίο στη συνέχεια χρησιμοποιείται ως το στρώμα ενσωμάτωσης για το μοντέλο LSTM.
Το Keras χρησιμοποιείται για την κατασκευή του διαδοχικού μοντέλου LSTM με μέγιστα χαρακτηριστικά ίσα με 50,000 και μέγεθος ενσωμάτωσης ίσο με 16. Το +emodel στη συνέχεια εκπαιδεύεται για 10 εποχές. Το μοντέλο +e ελέγχεται με βάση μετρήσεις απόδοσης sklearn. Η διαδικασία +e απόκτησης χαρακτηριστικών απεικονίζεται στο Σχήμα 2.
3.1. Σύνολο δεδομένων. Για να δημιουργηθούν ακριβή αποτελέσματα, το σύνολο δεδομένων που χρησιμοποιείται θα πρέπει να είναι μεγάλο και εμπλουτισμένο. Το σύνολο δεδομένων +e έχει συλλεχθεί από την ηλεκτρονική ενότητα κινητών τηλεφώνων και αξεσουάρ του συνόλου δεδομένων Amazon Reviews (2018). Το σύνολο δεδομένων +e αποτελείται από συνολικά 938.261 κριτικές, μεταξύ των οποίων οι 47.901 είναι μοναδικών προϊόντων και οι 153124 είναι μοναδικές κριτικές χρηστών. Το σύνολο δεδομένων +e αποτελείται αρχικά από 7 στήλες, δηλαδή, μια βαθμολογία που κυμαίνεται από 1 έως 5, χρόνο αναθεώρησης, αναγνωριστικό αναθεωρητή, αναγνωριστικό προϊόντος και σύνοψη κειμένου κριτικής.
Μετά την απόρριψη των διπλότυπων, το σύνολο δεδομένων αποτελείται από 938254 εγγραφές και ο Πίνακας 2 δείχνει ένα απόσπασμα των αρχικών εγγραφών δεδομένων.
3.2. Μεθοδολογία. Έχουμε εξατομικεύσει το word2vecmodel μας ώστε να χρησιμοποιείται με το μοντέλο LSTM για ταξινόμηση. Το Word2vec είναι μια ενσωμάτωση λέξης που χρησιμοποιείται για να αναπαραστήσει μια λέξη από μια συλλογή πολλών όρων ενός διανύσματος. Είναι μακριά από την αντιστοίχιση μιας λέξης σε ένα διανυσματικό χώρο. Το σύνολο δεδομένων +e φορτώνεται σε ένα πλαίσιο δεδομένων pandas. Για την ανάπτυξη ενός μοντέλου customword2vec, το πρώτο βήμα είναι η προεπεξεργασία δεδομένων.
Βλέπουμε μόνο τη βαθμολογία και το κείμενο της κριτικής και αφήνουμε τα υπόλοιπα. Το κείμενο +e καθαρίζεται αφαιρώντας τα σημεία στίξης. Το υποδείγμα του κειμένου δημιουργείται από σχεδόν 200,000 κριτικές και εφαρμόζεται η μέθοδος καθαρού κειμένου για τη μετατροπή κάθε κριτικής σε λίστα λέξεων. Το +is λίστα λέξεων λειτουργεί πλέον ως είσοδος στο μοντέλο του genism word2vec.
Έχουμε δημιουργήσει ένα προσαρμοσμένο εκπαιδευμένο skip-gram word2vecmodel και δημιουργήσαμε το μοντέλο με διαστάσεις: το μέγεθος των διανυσμάτων λέξεων είναι 100, το μέγεθος του παραθύρου ίσο με 15, το min_μετράει 2 για λέξεις που εμφανίζονται λιγότερο από 2 φορές στο σώμα μας, αρνητικό ίσο με 5 και ρυθμός δειγματοληψίας ίσο με 1e−5. Έχουμε χρησιμοποιήσει όλες αυτές τις διαστάσεις για να δημιουργήσουμε ένα λεξιλόγιο από τις προτάσεις κριτικής μας.

Εκπαιδεύουμε το μοντέλο word2vec για 1000 εποχές. +en υπολογίζουμε την απώλεια σε κάθε εποχή. Η απώλεια +e είναι υψηλή στην αρχή και μειώνεται προς την τελευταία εποχή. Το +e loss atepoch 0 είναι 2239394.0 και η απώλεια στην εποχή 1000 είναι 11504.0.+e το αποθηκευμένο μοντέλο φορτώνεται ξανά και εκτελούνται λειτουργίες σε αυτό.
Για παράδειγμα, αν θέλουμε να βρούμε λέξεις παρόμοιες με το θόρυβο στο σύνολο δεδομένων μας, λαμβάνουμε ακύρωση και ακουστικά.
Ομοίως, μπορούμε επίσης να βρούμε την ομοιότητα μεταξύ συγκεκριμένων λέξεων, όπως ακουστικά και ακουστικά, η οποία είναι {{0}}.48756, και η ομοιότητα μεταξύ των λέξεων φορτιστής και φορτιστής είναι 0,89264.
Για να μειώσουμε τις διαστάσεις των δεδομένων μας, χρησιμοποιήσαμε την οπτικοποίηση TSNE για να σχεδιάσουμε τα δεδομένα σε δύο διαστάσεις. Τώρα, αυτά τα διανύσματα λέξεων μπορούν να χρησιμοποιηθούν για περαιτέρω ταξινόμηση. Οι ενσωματώσεις +ese χρησιμοποιούνται στη συνέχεια ως λειτουργίες για περαιτέρω ροή.
3.2.1. Προετοιμασία Δεδομένων για LSTM. Το σύνολο δεδομένων μας αποτελείται από 938254 εγγραφές με τις περισσότερες από τις αξιολογήσεις να έχουν κατανομή βαθμολογίας μεγαλύτερη από 3. Έχουμε υπολογίσει πρώτα τον αριθμό των λέξεων για κάθε κριτική. Ο μέσος όρος +e χρησιμοποιείται ως στατιστικά στοιχεία για την εύρεση της μέσης διάρκειας των κριτικών. +e το μέσο μήκος της αναθεώρησης είναι 44,59 και το μέγιστο μήκος είναι 4303.
Έχουμε δημιουργήσει ένα σύνολο δεδομένων που αποτελείται από κριτικές με 100 λέξεις ή λιγότερες. Οι κριτικές των οποίων η διάρκεια είναι μεγαλύτερη από 20 αλλά λιγότερο από 100 κατηγοριοποιούνται σε σύντομες κριτικές και η επανεκκίνηση κατηγοριοποιείται σε μεγάλες κριτικές. Ο αριθμός +e των σύντομων ανασκοπήσεων είναι 411313 και οι εκτενείς αξιολογήσεις είναι 100239. Οι υπερπαράμετροι που χρησιμοποιούνται στο μοντέλο περιγράφονται στον Πίνακα 3.
Στη συνέχεια, ορίσαμε τη βαθμολογία συναισθήματος ως θετική εάν η βαθμολογία είναι μεγαλύτερη ή ίση με 3. Διαφορετικά, η βαθμολογία είναι αρνητική. Λάβαμε υπόψη το κείμενο ανασκόπησης και το συναίσθημα για τη δημιουργία του συνόλου δεδομένων αμαξοστοιχίας. Τα δεδομένα δοκιμής +e αποτελούνται από προϊόντα με τουλάχιστον περισσότερες από 10 κριτικές.
Μετά τη διανομή, το σύνολο δεδομένων εκπαίδευσης αποτελούνταν από συνολικά 203891 εγγραφές, μεταξύ των οποίων 175910 ανήκαν στη θετική τάξη και 27981 στην αρνητική τάξη. Το σύνολο δεδομένων δοκιμής +e αποτελούνταν από συνολικά 686345 εγγραφές, μεταξύ των οποίων 592118 ανήκαν στη θετική και 94227 στην αρνητική κατηγορία.
Σε αυτήν τη μελέτη, χρησιμοποιήσαμε το Keras για να δημιουργήσουμε το μοντέλο μας LSTM, το οποίο παίρνει το πολύ 50000 χαρακτηριστικά ως είσοδο στο επίπεδο ενσωμάτωσης. Η μακροπρόθεσμη βραχυπρόθεσμη μνήμη (LSTM) είναι ένας τύπος επαναλαμβανόμενου νευρωνικού δικτύου που χρησιμοποιεί έναν εσωτερικό μηχανισμό που ρυθμίζει τη ροή πληροφοριών.+είναι ο εσωτερικός μηχανισμός που αποτελείται από πύλες που πρέπει να εκπαιδευτούν έτσι ώστε να μπορούν να φιλτράρουν με ακρίβεια άσχετες πληροφορίες και να διατηρούν χρήσιμες πληροφορίες.

Το Σχήμα 3 δείχνει τη βασική αρχιτεκτονική του μοντέλου LSTM στην προτεινόμενη μεθοδολογία μας.
Τα Ht−1 και Xt είναι οι είσοδοι στη μονάδα LSTM· το Ht−1, που συνήθως αναφέρεται ως βραχυπρόθεσμη μνήμη, παίρνει την έξοδο από τις προηγούμενες καταστάσεις ως είσοδο. Το +e memorycell ή η μακροπρόθεσμη μνήμη, Ct-1, βοηθά στη μεταφορά σχετικών πληροφοριών σε όλη τη διαδικασία μιας ακολουθίας. Η αρχιτεκτονική +eLSTM συνδυάζει τρεις πύλες: την πύλη ξεχνάς, την πύλη εισόδου και την πύλη εξόδου. Στη μονάδα LSTM, οι συναρτήσεις tanh και σιγμοειδούς χρησιμοποιούνται για τη λήψη αυτών των πυλών.
Τα δεδομένα αμαξοστοιχίας +e στη συνέχεια χωρίστηκαν σε δεδομένα αμαξοστοιχίας και επικύρωσης ίσου μήκους. Το μήκος +e των δεδομένων υπολογίστηκε στο 101945 και η κατανομή κλάσης ήταν {1: 87955, 0:13990}. Για να δημιουργήσουμε τα σύνολα δεδομένων δοκιμής και επικύρωσης αμαξοστοιχίας TensorFlow, πρέπει να μετατρέψουμε τα δεδομένα τρένου μας σε ακολουθίες. Τα έχουμε συμπληρώσει σε μέγιστο μήκος 100, έτσι ώστε όλες οι ακολουθίες να έχουν το ίδιο μήκος. +e ετικέτες τρένου και δοκιμής

For more information:1950477648nn@gmail.com






