AttentionMNIST: Ένα σύνολο δεδομένων παρακολούθησης προσοχής με κλικ για χειρόγραφη αναγνώριση αριθμών και αλφαβήτου

Feb 22, 2024

Πολλαπλά μοντέλα βασισμένα στην προσοχή που αναγνωρίζουν αντικείμενα μέσω μιας ακολουθίας ματιών έχουν αναφέρει αποτελέσματα στη χειρόγραφη αναγνώριση αριθμών. Ωστόσο, δεν υπάρχουν διαθέσιμα δεδομένα παρακολούθησης προσοχής για χειρόγραφη αναγνώριση αριθμών ή αλφαβήτου. Η διαθεσιμότητα τέτοιων δεδομένων θα επέτρεπε την αξιολόγηση μοντέλων που βασίζονται στην προσοχή σε σύγκριση με την ανθρώπινη απόδοση. Συλλέγουμε δεδομένα παρακολούθησης της προσοχής με κλικ του ποντικιού από 382 συμμετέχοντες που προσπαθούν να αναγνωρίσουν χειρόγραφους αριθμούς και αλφάβητα (κεφαλαία και πεζά) από εικόνες μέσω διαδοχικής δειγματοληψίας. Εικόνες από σύνολα δεδομένων αναφοράς παρουσιάζονται ως ερεθίσματα. Το συλλεγμένο σύνολο δεδομένων, που ονομάζεται AttentionMNIST, αποτελείται από μια ακολουθία δειγμάτων (κλικ) τοποθεσιών, prπροβλεπόμενες ετικέτες τάξης σε κάθε δειγματοληψία και τη διάρκεια κάθε δειγματοληψίας. Κατά μέσο όρο, οι συμμετέχοντες παρατηρούν μόνο το 12,8% μιας εικόνας για αναγνώριση. Προτείνουμε ένα βασικό μοντέλο για να προβλέψουμε την τοποθεσία και τις τάξεις που θα επιλέξει ένας συμμετέχων στην επόμενη δειγματοληψία. Όταν εκτίθεται στα ίδια ερεθίσματα και πειραματικές συνθήκες με τους συμμετέχοντες μας, ένα μοντέλο ενίσχυσης που βασίζεται στην προσοχή με μεγάλη αναφορά υπολείπεται της ανθρώπινης αποτελεσματικότητας.

Chinese herb cistanche

Κινεζικό κιστανάκιβότανο- Προϊόντα πρόληψης της νόσου Αλτσχάιμερ

Τα μοντέλα μηχανικής μάθησης (ML) που αναγνωρίζουν αντικείμενα μέσω μιας σειράς ματιών έχουν κερδίσει το ενδιαφέρον τα τελευταία χρόνια λόγω της επεκτασιμότητας και της αποτελεσματικότητάς τους. Πολλά από αυτά τα μοντέλα, όπως το 1-7, έχουν αναφέρει πειραματικά αποτελέσματα στο συγκριτικό σύνολο δεδομένων MNIST για χειρόγραφη αναγνώριση αριθμών. Δυστυχώς, δεν υπάρχουν διαθέσιμα δεδομένα παρακολούθησης της προσοχής για το MNIST. Αυτό αποτρέπει την αξιολόγηση μοντέλων που βασίζονται στην προσοχή σε σύγκριση με την ανθρώπινη απόδοση. Πέσαμε σε αυτό το κενό συλλέγοντας ένα σύνολο δεδομένων από ενήλικες συμμετέχοντες που προσπαθούσαν να αναγνωρίσουν χειρόγραφους αριθμούς και αλφάβητα από εικόνες μέσω διαδοχικής δειγματοληψίας. Σε αντίθεση με την παρακολούθηση της προσοχής με κίνηση των ματιών (emAT), ένας συμμετέχων κάνει κλικ στην τοποθεσία στην εικόνα που θέλει να δει (μια μορφή παρακολούθησης προσοχής με κλικ του ποντικιού (mcAT)). Αμέσως μετά, επιλέγει τις κλάσεις στις οποίες προβλέπει ότι το αντικείμενο μπορεί να ανήκει με βάση τις μέχρι τώρα παρατηρήσεις του. Έτσι, σε κάθε επεισόδιο δειγματοληψίας, τα δεδομένα μας αποτελούνται από την επιλεγμένη τοποθεσία της εικόνας, τις προβλεπόμενες ετικέτες τάξης και τον χρόνο που χρειάστηκε από το τελευταίο επεισόδιο από τον συμμετέχοντα. Μετά από κάθε εικόνα, ο συμμετέχων λαμβάνει μια ανταμοιβή με βάση την απόδοσή του (ακρίβεια και αποτελεσματικότητα).

Anti Alzheimer's disease

Οφέλη από τη σωληναριακή σωληνίσκο-Αντί της νόσου του Αλτσχάιμερ

Πλεονεκτήματα του mcAT έναντι του emAT για χειρόγραφη αναγνώριση αριθμών/αλφαβήτου.

(1) το κρέας περιέχει σημαντική ενδο- και διαπροσωπική διακύμανση στη θέση στερέωσης, ειδικά για στατικά ερεθίσματα (εικόνες)8,9. Χρειάζεται λοιπόν ένας μεγάλος όγκος δεδομένων στερέωσης ματιών για να καταλήξουμε σε στατιστικά σημαντικά συμπεράσματα. Το mcAT δεν είναι ευαίσθητο σε ορισμένες από τις πηγές τεχνικού θορύβου που είναι κοινές στα δεδομένα παρακολούθησης ματιών10. (2) Οι κινήσεις των ματιών μπορεί να προκύψουν τόσο από εκούσιους όσο και από ακούσιους μηχανισμούς11. Για να διευκολύνουμε τη λήψη αποφάσεων που εξαρτώνται από την εργασία, παρουσιάζουμε στους συμμετέχοντες επαρκή χρόνο, πλαίσιο και σήματα ενίσχυσης, τα οποία μπορούν επίσης να παρουσιαστούν σε ένα μοντέλο ML. (3) Η ακρίβεια και η ακρίβεια των δεδομένων emAT εξαρτώνται από το eye-tracker ενώ τα ίδια του mcAT είναι ανεξάρτητα από οποιαδήποτε συσκευή. (4) Είναι πρόκληση να συγχρονίζει κανείς τις κινήσεις των ματιών του με την επιλογή της τάξης του. Για να ξεπεραστεί αυτό, στην περίπτωσή μας, η τοποθεσία δειγματοληψίας και οι κλάσεις επιλέγονται στο ίδιο επεισόδιο. (5) Τέλος, η μέθοδός μας επιτρέπει τη συλλογή δεδομένων χρησιμοποιώντας το Amazon Mechanical Turk (MTurk), όπως στο 12, 13, το οποίο είναι οικονομικά και χρονικά αποδοτικό και είναι εύκολα αναπαραγόμενο.

Συνεισφορές.

Συλλέγουμε ένα σύνολο δεδομένων mcAT, που ονομάζεται AttentionMNIST, χρησιμοποιώντας MTurk από 382 συμμετέχοντες, που ανταμείβεται για την ακριβή και αποτελεσματική αναγνώριση χειρόγραφων αριθμών και αλφαβήτων (κεφαλαία και πεζά) από εικόνες μέσω διαδοχικής δειγματοληψίας. Εικόνες από σύνολα δεδομένων αναφοράς (MNIST, EMNIST) παρουσιάζονται ως ερεθίσματα. Κατά μέσο όρο, καταγράφονται 169,1 απαντήσεις ανά τάξη αριθμών/αλφαβήτου. Χρησιμοποιώντας αυτό το σύνολο δεδομένων, δείχνουμε τα εξής: • Κατά μέσο όρο, οι συμμετέχοντες απαιτούν 4,2, 4,7 και 4,9 δείγματα για να αναγνωρίσουν ένα αριθμητικό, κεφαλαίο και πεζό αλφάβητο, τα οποία αντιστοιχούν μόνο στο 11,3%, 13,4% και 13,7% της περιοχής της εικόνας αντίστοιχα . Η ακρίβεια ταξινόμησης αυξάνεται με πολλά δείγματα. • Ένα μοντέλο, που παρουσιάζεται ως γραμμή βάσης, μπορεί να προβλέψει τις τάξεις και την τοποθεσία που θα επιλέξει ένας συμμετέχων στο επόμενο επεισόδιο δειγματοληψίας με ακρίβεια 74,4% και 67,7% αντίστοιχα, με μέσο όρο για όλες τις δειγματοληψίες και τα σύνολα δεδομένων. Η ακρίβεια πρόβλεψης κλάσης αυξάνεται και η ακρίβεια πρόβλεψης τοποθεσίας μειώνεται με την αύξηση των δειγμάτων. • Όταν εκτίθεται στα ίδια ερεθίσματα και συνθήκες με τους συμμετέχοντες μας, ένα μοντέλο επαναλαμβανόμενης προσοχής (RAM)3 που βασίζεται σε υψηλές αναφορές απαιτεί 3,7, 8,5 και 7,6 δείγματα για να αναγνωρίσουν ένα αριθμητικό, κεφαλαίο και πεζό αλφάβητο, τα οποία αντιστοιχούν στο 8,9% , 21.0%, 18,7% της περιοχής εικόνας αντίστοιχα. Άλλα μοντέλα ενίσχυσης που βασίζονται στην προσοχή (π.χ., 1,2,4,5,7,14) μπορούν να αξιολογηθούν παρόμοια σε σύγκριση με την ανθρώπινη απόδοση.

Cistanche supplement near me-Improve memory2

Συμπλήρωμα Cistanche κοντά μου-Βελτίωση της μνήμης

Κάντε κλικ εδώ για να δείτε τα προϊόντα Cistanche που βελτιώνει τη μνήμη και την πρόληψη της νόσου του Αλτσχάιμερ

【Ζητήστε περισσότερα】 Email:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Σχετική δουλειά

Η χρονική ακολουθία των κλικ του ποντικιού στο mcAT είναι ανάλογη με τη διαδρομή σάρωσης της κίνησης των ματιών10. Το mcAT μπορεί να υποκαταστήσει αποτελεσματικά το emAT καθώς συσχετίζονται σημαντικά10,12,13,15-17. Διαφορετικά είδη ερεθισμάτων έχουν χρησιμοποιηθεί σε μελέτες mcAT, όπως εικόνες έμψυχων και άψυχων αντικειμένων10, εικόνες φυσικών σκηνών12,13, στατικές ιστοσελίδες13, διατάξεις σελίδων αναζήτησης16 και δύο λίστες αλφαριθμητικών συμβολοσειρών για οπτική σύγκριση17. Ωστόσο, το mcAT δεν έχει χρησιμοποιηθεί για χειρόγραφες εργασίες ταξινόμησης αριθμών/αλφαβήτου ή για αξιολόγηση μοντέλων ταξινόμησης που βασίζονται στην προσοχή. Οι μελέτες mcAT έχουν χρησιμοποιήσει χαρακτηριστικά όπως ο χρόνος επαφής, η σχετική συχνότητα καθήλωσης σε περιοχές ενδιαφέροντος (AOI), η σχετική αναλογία των ατόμων που έκαναν κλικ τουλάχιστον μία φορά σε ένα AOI10, ο αριθμός των σταθεροποιήσεων ανά δοκιμή, η επιδιόρθωση εντός δοκιμών, οι χρόνοι παραμονής και οι διαδρομές σάρωσης17 , χάρτες σταθεροποίησης12,13, AOI και μοτίβο ροής πληροφοριών16. Η αλληλουχία των τοποθεσιών κλικ με χρονική σήμανση και οι προβλεπόμενες ετικέτες κλάσεων αποτελούν τα ακατέργαστα δεδομένα που είναι απαραίτητα για την αξιολόγηση της αποτελεσματικότητας και της ακρίβειας μοντέλων ή ανθρώπων που βασίζονται στην προσοχή στις εργασίες ταξινόμησης. Από αυτά τα δεδομένα μπορούν να προκύψουν διαφορετικά χαρακτηριστικά. Το σύνολο δεδομένων mcAT, με πολλαπλά οφέλη σε σχέση με τα δεδομένα παρακολούθησης ματιών, καλύπτει ένα κρίσιμο κενό στην έρευνα μοντέλων που βασίζεται στην προσοχή σε τεχνητή νοημοσύνη, ML και άλλους τομείς. Το σύνολο δεδομένων μας θα επιτρέψει την αξιολόγηση μοντέλων που βασίζονται στην προσοχή σε σύγκριση με την ανθρώπινη απόδοση. Μεταξύ άλλων, αυτό θα διευκολύνει την ανάπτυξη αποτελεσματικών συστημάτων οπτικής αναγνώρισης χαρακτήρων σε πραγματικό χρόνο που έχουν ευρεία χρήση στην πράξη (βλ. για παράδειγμα 18–20). Οι αρχές που καθοδηγούν τις οπτικές σταθεροποιήσεις μπορούν να υποβληθούν και να ελεγχθούν χρησιμοποιώντας το σύνολο δεδομένων μας. Οι επιτυχημένες αρχές μπορούν να μεταφερθούν για την ανάπτυξη συστημάτων για εργασίες οπτικής αναγνώρισης πραγματικού κόσμου όπου η αποτελεσματικότητα αποτελεί βασικό μέλημα, όπως στην αυτόνομη οδήγηση.

Δεδομένα

Τα δεδομένα μας αποτελούνται από μια ακολουθία Τ επεισοδίων για κάθε συμμετέχοντα. Τα δεδομένα από κάθε επεισόδιο αποτελούνται από (1) τη θέση στην εικόνα στην οποία έκανε κλικ ο συμμετέχων (ένα κλικ στην εικόνα ανά επεισόδιο), (2) την τάξη(ες) που επιλέχτηκε από τον συμμετέχοντα και (3) τον χρόνο που χρειάστηκε ο συμμετέχων συμμετέχοντα να καταχωρήσει το τρέχον δείγμα (δηλαδή τον χρόνο που μεσολάβησε μεταξύ του τελευταίου και του τρέχοντος κλικ στην εικόνα). Αυτή η ενότητα θα εξηγήσει τη διαδικασία συλλογής δεδομένων μας, συμπεριλαμβανομένης της επιλογής ερεθισμάτων, των συμμετεχόντων, των οπτικών εργασιών, της βαθμολογίας απόδοσης και του φιλτραρίσματος δεδομένων.

Επιλογή ερεθισμάτων. Τα ερεθίσματα επιλέγονται από εικόνες σε δύο σύνολα δεδομένων αναφοράς: (1)

Το σύνολο δεδομένων MNIST21 αποτελείται από 70,000 ετικέτες (28×28 pixel) με 10 χειρόγραφους αριθμούς {0, 1, ..., 9}. (2)

Το σύνολο δεδομένων EMNIST22 αποτελείται από 145.600 εικόνες (28×28 pixel) χειρόγραφων αγγλικών αλφαβήτων με κεφαλαία και πεζά, σχηματίζοντας μια ισορροπημένη κατηγορία. Όλες οι εικόνες επισημαίνονται με μία από τις 26 κατηγορίες {a, b, ..., z}. Ωστόσο, η ετικέτα κεφαλαίων ή πεζών δεν συσχετίζεται με καμία εικόνα. Από κάθε κατηγορία, επιλέγουμε 15 καλοσχηματισμένους αριθμούς από το MNIST και 15 καλοσχηματισμένα αλφάβητα το καθένα από κεφαλαία και πεζά γράμματα του EMNIST. Ένας καλοσχηματισμένος αριθμός ή αλφάβητο μοιάζει με τον κανόνα της κατηγορίας του. Έτσι, παρουσιάζουμε ερεθίσματα από ένα σύνολο 15(10 + 26 + 26)=930 μοναδικών εικόνων, με 15 εικόνες που ανήκουν σε καθεμία από τις 62 κατηγορίες. Οι καλοσχηματισμένες εικόνες 930 επιλέγονται ως εξής:

Βήμα 1: Κανονικοποιήστε κάθε εικόνα χρησιμοποιώντας το min-max για να κλιμακώσετε την ένταση μεταξύ 0 και 1.

Βήμα 2: Επισημάνετε τις καλοσχηματισμένες εικόνες EMNIST με κεφαλαία ή πεζά. Για κάθε κατηγορία αλφαβήτου, επιλέγεται χειροκίνητα και επισημαίνεται ένα καλά διαμορφωμένο αλφάβητο από κεφαλαία και πεζά γράμματα. Υπολογίζεται η ομοιότητα συνημίτονος όλων των εικόνων που ανήκουν σε αυτήν την κλάση με τις δύο επισημασμένες εικόνες. Στις εικόνες που βρίσκονται πάνω από το όριο ομοιότητας συνημιτόνου (εμπειρικά επιλεγμένο ως 0.8) αποδίδεται η ετικέτα με κεφαλαία ή πεζά.

Βήμα 3: Υπολογίστε το μέσο όρο των εικόνων που ανήκουν σε κάθε τάξη. Η μέση εικόνα μιας τάξης αποτελεί τον κανόνα της. Μια εικόνα είναι κατάλληλη για ερέθισμα εάν η ομοιότητα του συνημιτόνου της με τη μέση εικόνα της κατηγορίας της είναι μεγαλύτερη από ένα εμπειρικά καθορισμένο όριο (0.7 για το MNIST, 0.75 για το EMNIST).

Βήμα 4: Μεταξύ των κατάλληλων εικόνων, 15 εικόνες από κάθε τάξη επιλέγονται χειροκίνητα με βάση το πόσο καλοσχηματισμένες είναι. Κάθε εικόνα, αρχικά 28×28 εικονοστοιχεία, μειώνεται σε 27×25 αφαιρώντας τα εικονοστοιχεία κοντά στα όρια, καθώς δεν έχουν καμία διακύμανση στην ένταση. Ο μέσος όρος αυτών των 15 εικόνων υπολογίζεται για καθεμία από τις 62 κατηγορίες. Σημειώνουμε αυτές τις μέσες εικόνες ως I1, I2, ..., In για n κλάσεις σε κάθε σύνολο δεδομένων.

Συμμετέχοντες.

Συνολικά 382 διαφορετικά ενήλικα άτομα συμμετείχαν στη μελέτη μας. Δεν χρησιμοποιήθηκαν κριτήρια επιλογής. Ένας συμμετέχων θα μπορούσε να απαντήσει σε πολλές εικόνες. Για καθεμία από τις 62 τάξεις, καταγράφηκαν κατά μέσο όρο 169,1 απαντήσεις.

man-5989553_960_720

Οφέλη της σωληναριακής σαλπιγγικής σωληνίσκου-Κατά της νόσου Αλτσχάιμερ

Οπτική εργασία.

Η διεπαφή MTurk για την οπτική μας εργασία φαίνεται στην Εικ. 1. Ένας καμβάς μεγέθους 270×250 εμφανίζει μια εικόνα φόντου χαμηλής έντασης ανά πάσα στιγμή. Οι εικόνες φόντου και ερεθίσματος αναδεικνύονται δέκα φορές σε 270×250. Το κέντρο του καμβά είναι ευθυγραμμισμένο με το κέντρο των εικόνων. Ιστορικό Αρχικά, το φόντο είναι ο μέσος όρος όλων των εικόνων στο σύνολο δεδομένων από το οποίο αντλείται το ερέθισμα. Μετά το πρώτο επεισόδιο, το φόντο είναι ο μέσος όρος όλων των εικόνων από το σύνολο των τάξεων που επιλέχθηκαν από τον συμμετέχοντα στο τελευταίο επεισόδιο. Στον πραγματικό κόσμο, το πλαίσιο για τη θέση, το μέγεθος και τον προσανατολισμό ενός αριθμού ή αλφαβήτου προκύπτει από τη γραφή στη γειτονιά του, η οποία λείπει εδώ. Όταν τα πειράματά μας διεξήχθησαν με κενό φόντο, οι συμμετέχοντες συχνά δειγμάτιζαν τοποθεσίες της εικόνας που δεν περιείχαν κανένα μέρος του αντικειμένου. Αυτή η συμπεριφορά περιορίστηκε παρουσιάζοντας τη μέση εικόνα των επιλεγμένων κλάσεων σε φόντο χαμηλής έντασης και μειώνοντας το μέγεθος όλων των εικόνων MNIST και EMNIST από 28×28 pixel σε 27×25. Κάθε φορά που ο συμμετέχων επιλέγει μια τοποθεσία στον καμβά κάνοντας κλικ σε αυτήν, αποκαλύπτεται ένα έμπλαστρο 50×50 pixel με κέντρο σε αυτή τη θέση από την εικόνα του ερεθίσματος. Ένα patch μόλις αποκαλυφθεί συνεχίζει να εμφανίζεται μέχρι το τελευταίο επεισόδιο. Η εργασία ενός συμμετέχοντα αποτελείται από τρία βήματα σε κάθε επεισόδιο t (t=1, ..., T):

Βήμα 1: Κάντε κλικ οπουδήποτε στον καμβά 270×250 για να αποκαλύψετε το έμπλαστρο που θέλει να δοκιμάσει. Μόνο το πρώτο κλικ γίνεται αποδεκτό.

Βήμα 2: Αναγνωρίστε τον αριθμό/αλφάβητο από όλα τα δείγματα που έχουν παρατηρηθεί μέχρι τώρα. Ο συμμετέχων μπορεί να επιλέξει πολλές τάξεις και θα πρέπει να επιλέξει τουλάχιστον μία τάξη από τη λίστα των τάξεων που εμφανίζεται κάτω από τον καμβά.

Βήμα 3: Κάντε κλικ στο "Επόμενο" στο κάτω μέρος της οθόνης για να προχωρήσετε. Για να συμπεράνει την τάξη με ακρίβεια και ταχύτητα, ο συμμετέχων θα πρέπει να επιλέξει τις τοποθεσίες με σύνεση δεδομένων των παρατηρήσεών του μέχρι το τρέχον επεισόδιο. Δεν υπάρχει χρονικό όριο για ένα επεισόδιο. Ωστόσο, περιορίζουμε τον συνολικό χρόνο για T επεισόδια μιας εικόνας σε έξι λεπτά. Επιλέγουμε το T=12 καθώς τα έργα με υψηλή παραπομπή σχετικά με την αναγνώριση χειρογράφου βάσει προσοχής ή τη δημιουργία έχουν χρησιμοποιήσει λιγότερες από 12 αναλαμπές (π.χ. η RAM3 μπορούσε να αναγνωρίσει αριθμούς MNIST μέσα σε 7 αναλαμπές, το DRAW23 θα μπορούσε να δημιουργήσει αριθμούς MNIST μέσα σε 11 αναλαμπές) και Οι άνθρωποι μπορούν να αναγνωρίσουν χειρόγραφους αριθμούς και αλφάβητα σε πολύ λιγότερες από 12 αναλαμπές.

Βαθμολογία απόδοσης. Μια βαθμολογία αποδίδεται στον συμμετέχοντα με βάση την ακρίβεια και την αποτελεσματικότητά του ως προς τον αριθμό των δειγμάτων που παρατηρήθηκαν. Ας είναι το σύνολο των τάξεων που διάλεξε σε οποιοδήποτε επεισόδιο t. Δέκα, η βαθμολογία του στο t είναι:

Figure 1. Our MTurk interface as seen by a participant. Te second sampling for an EMNIST uppercase alphabet is shown.

Εικόνα 1. Η διεπαφή MTurk μας όπως φαίνεται από έναν συμμετέχοντα. Εμφανίζεται η δεύτερη δειγματοληψία για ένα κεφαλαίο αλφάβητο EMNIST.

image


όπου |.| υποδηλώνει την καρδινάτητα ενός συνόλου. Η συνολική βαθμολογία που απονέμεται στα επεισόδια T είναι h {{0}} T t=1 Pt. Επομένως, το μέγιστο που μπορεί κάποιος να σκοράρει στα επεισόδια Τ είναι το Τ αν επιλέγει πάντα μόνο τη σωστή τάξη. Το ελάχιστο που μπορεί κάποιος να σκοράρει στα επεισόδια Τ είναι μηδέν εάν επιλέγει πάντα ένα σύνολο τάξεων που δεν περιλαμβάνει τη σωστή τάξη. Άρα, 0 Μικρότερο ή ίσο του h Μικρότερο ή ίσο του Τ. Όσο πιο γρήγορα ένας συμμετέχων επιλέξει τη σωστή τάξη, τόσο υψηλότερη θα είναι η βαθμολογία του. Έτσι, αυτός ο μηχανισμός βαθμολόγησης λαμβάνει υπόψη την ακρίβεια αναγνώρισης και την αποτελεσματικότητα της δειγματοληψίας. Η προσπάθεια μεγιστοποίησης της βαθμολογίας επιλέγοντας μόνο μία τάξη από το πρώτο επεισόδιο θα είναι επικίνδυνη καθώς θα απονεμηθεί μηδενική βαθμολογία εάν δεν είναι η σωστή τάξη, ενώ μια βαθμολογία μεγαλύτερη από το μηδέν θα απονεμηθεί εάν ο συμμετέχων επιλέξει πολλές τάξεις ( ακόμη και όλες οι τάξεις) που περιλαμβάνουν τη σωστή τάξη. Αυτό θα παρακινήσει τον συμμετέχοντα να απαντήσει με βάση τις πιθανές τάξεις στο μυαλό του σε οποιοδήποτε επεισόδιο. Η βαθμολογία που απονέμεται σε κάθε επεισόδιο αποκαλύπτεται μόνο μετά την ολοκλήρωση των επεισοδίων Τ για να μην παρέχεται οποιαδήποτε υπόδειξη στον συμμετέχοντα. Στο MTurk, η αμοιβή που λαμβάνει ένας συμμετέχων για μια εικόνα είναι ανάλογη με τη συνολική βαθμολογία του, h.

Φιλτράρισμα δεδομένων.

Εάν η βαθμολογία ενός συμμετέχοντα στο τελευταίο (δηλ. Τ-ο) επεισόδιο για μια εικόνα ερεθίσματος είναι μηδέν, τα δεδομένα του που έχουν καταγραφεί για αυτήν την εικόνα απορρίπτονται. Τα δεδομένα απορρίπτονται επίσης εάν ένας συμμετέχων αφήσει την εργασία ημιτελής. Με αυτά τα κριτήρια επιλογής, λάβαμε αποκρίσεις σε 1736 ερεθίσματα από το MNIST, 4431 ερεθίσματα από κεφαλαία γράμματα EMNIST και 4315 ερεθίσματα από πεζά γράμματα EMNIST. δηλαδή 169,1 απαντήσεις ανά τάξη κατά μέσο όρο.

Μοντέλα και μέθοδοι αξιοποίησης δεδομένων

Σε αυτήν την ενότητα, επεξηγούμε τη χρησιμότητα των συλλεγόμενων δεδομένων παρέχοντας ένα βασικό μοντέλο για την πρόβλεψη της συμπεριφοράς ενός συμμετέχοντα και (4.2) δείχνοντας πώς ένα υπάρχον μοντέλο ενίσχυσης που βασίζεται στην προσοχή μπορεί να συγκριθεί με την ανθρώπινη αναγνώριση αριθμών/αλφαβήτου εκτέλεση. Η βάση για την πρόβλεψη συμπεριφοράς. Η συμπεριφορά σε οποιοδήποτε επεισόδιο t αποτελείται από επιλογή τοποθεσίας και επιλογή τάξης. Δεδομένου ότι ένα δείγμα περιέχει διαφορετικές ποσότητες πληροφοριών για διαφορετικούς παρατηρητές, ή ακόμα και για τον ίδιο παρατηρητή σε διαφορετικούς χρόνους9, η πρόβλεψη συμπεριφοράς κάθε συμμετέχοντα είναι ένα δύσκολο πρόβλημα. Έστω n ο αριθμός των κλάσεων σε ένα σύνολο δεδομένων, ηt είναι το μονότονο σύνολο που περιέχει την αληθινή κλάση για την εικόνα του ερεθίσματος στο t, ct είναι το σύνολο των κλάσεων και lt είναι η τοποθεσία που έχει επιλεγεί από έναν συμμετέχοντα στο t, για να είναι η παρατήρησή του στο t, και 1:t δηλώνει την ακολουθία 1, 2, ..., t. Μέχρι κάθε t, οι παρατηρήσεις ενός συμμετέχοντα είναι o1:t και οι τοποθεσίες που επέλεξε είναι l1:t. Διατυπώνουμε το πρόβλημα της πρόβλεψης συμπεριφοράς ενός συμμετέχοντος ως εξής: Πρόβλεψη τάξης Υπολογίστε την πιθανότητα του i∈ct (i=1, 2, ..., n) με δεδομένο το o1:t και το l1:t, δηλαδή P( i ∈ ct|o1:t, l1:t). Πρόβλεψη τοποθεσίας Υπολογίστε την πιθανότητα του lt+1 λαμβάνοντας υπόψη τα o1:t, l1:t και ct, δηλαδή P(lt+1|o1:t, l1:t,ct). Πρόβλεψη τάξης. Για να προβλέψουμε την κλάση που θα επιλέξει ένας συμμετέχων στο επεισόδιο t, υπολογίζουμε την πιθανότητα ότι το ερέθισμα εικόνας στο t ανήκει στην κατηγορία I, λαμβάνοντας υπόψη τις επιλεγμένες θέσεις του συμμετέχοντα l1:t και τις αντίστοιχες παρατηρήσεις o1:t, ως εξής:

image

όπου Ii είναι ο μέσος όρος των εικόνων ερεθισμάτων (27×25) που ανήκουν στην κατηγορία i, το I′ είναι μια εικόνα 27×25 που περιέχει o1:t σε l1:t, · δηλώνει κλιμακωτό γινόμενο και .δηλώνει Ευκλείδειο κανόνα. Όλες οι εντάσεις των εικονοστοιχείων είναι μη αρνητικές. Σε κάθε επεισόδιο t, οι k υψηλότερες πιθανές κλάσεις από την κατανομή πεποιθήσεων P(i|o1:t, l1:t) αποτελούν το σύνολο των κλάσεων, ˆct, που προβλέπονται από το μοντέλο μας, όπου k=|ct|. Η ακρίβεια ταξινόμησης μετριέται χρησιμοποιώντας τον δείκτη Jaccard (JI). Το JI μετρά την ομοιότητα μεταξύ δύο συνόλων, X και Y, ως: J(X, Y) {{10}} |X ∩ Y|/|X ∪ Y|. Το JI οριοθετείται μεταξύ 0 και 1. αν X=Y, J(X, Y)=1. Σε οποιοδήποτε επεισόδιο t, η ακρίβεια ταξινόμησης ενός συμμετέχοντα είναι J(ηt,ct) ενώ του μοντέλου μας είναι J(ηt, ˆct). Λόγω του παρονομαστή του, το JI τιμωρεί περισσότερο καθώς αυξάνεται ο αριθμός των στοιχείων στο προβλεπόμενο σύνολο (ct ή ˆct) που δεν είναι σε ηt, κάτι που είναι μια επιθυμητή ιδιότητα για την περίπτωσή μας. Η ομοιότητα μεταξύ της ταξινόμησης ενός συμμετέχοντα και του μοντέλου μας μετριέται με J(ct, ˆct). Το μοντέλο μας αξιολογείται επίσης ως προς την ακρίβεια επιλογής τάξης και απόρριψης σε σχέση με κάθε συμμετέχοντα. Έστω st=ct − ct−1 το σύνολο των νέων κλάσεων που επιλέχθηκαν και rt=ct−1 − ct το σύνολο των κλάσεων που απορρίφθηκαν από έναν συμμετέχοντα στο t. Ομοίως, ˆst=ˆct − ct−1 είναι το σύνολο των νέων κλάσεων που επιλέχθηκαν, και ˆrt=ct−1 − ˆct είναι το σύνολο των κλάσεων που απορρίφθηκαν από το μοντέλο μας στο t. Στη συνέχεια, η επιλογή κλάσης και η απόρριψη του μοντέλου μπορούν να συγκριθούν με την επιλογή ενός συμμετέχοντα από το J(st, ˆst) όταν |st| > 0 και J(rt, ˆrt) όταν |rt| > 0, αντίστοιχα. Πρόβλεψη τοποθεσίας. Υπόθεση Ιδανικά, η κατανομή των πεποιθήσεων σε όλες τις τάξεις θα πρέπει να είναι μονοτροπική (δηλαδή, μόνο μία κορυφή) και ένα λεπτό Gaussian (δηλαδή, μικρή τυπική απόκλιση) σε σχήμα που υποδεικνύει ότι ένας συμμετέχων είναι σίγουρος για την τάξη (κατάσταση) του ερεθίσματος (περιβάλλον). Ωστόσο, όπως φαίνεται από τα δεδομένα μας (αναφ. Εικ. 2), ένας συμμετέχων συχνά συγχέεται μεταξύ πολλών τάξεων, ειδικά κατά τη διάρκεια των αρχικών μερικών επεισοδίων. Σε αυτές τις περιπτώσεις, η κατανομή των πεποιθήσεών του έχει πολλαπλές κορυφές ή είναι παχύ Gaussian. Υποθέτουμε ότι ο στόχος ενός συμμετέχοντα είναι να συγκλίνει σε ένα μονοτροπικό και λεπτό Gaussian, για να το επιτύχει αυτό δειγματίζει επιλεκτικά τοποθεσίες που μειώνουν την πιθανότητα όλων των κλάσεων εκτός από μία. Αυτή η υπόθεση οδηγεί στην ελαχιστοποίηση της αβεβαιότητας σχετικά με τις τάξεις (περιβαλλοντικές καταστάσεις) που είναι μια πολύ γνωστή αρχή που καθοδηγεί τη δράση24, συμπεριλαμβανομένων των κινήσεων των ματιών25.

Figure 2. Duration and class distribution over all participants and stimuli belonging to categories '0', 'a', and 'A'.


Εικόνα 2. Διάρκεια και κατανομή της τάξης σε όλους τους συμμετέχοντες και τα ερεθίσματα που ανήκουν στις κατηγορίες '0', 'a' και 'A'.

Te observations at certain locations in a stimulus image can discriminate between certain classes. Te observation at a location l might indicate that the numeral/alphabet belongs to class I and not to class j. Such locations are more salient than others in achieving a participant's goal. To sample such locations, a saliency map, Dij, is computed such that if l is salient, the observation at l is evidence to increase the probability of class I and decrease that of j. Mathematically, Dij = N (., σ ) ∗ g(.), where ∗ is the convolution operator, g(.) is a saliency scoring function, and N (., σ ) is a 5×5 Gaussian kernel with standard deviation σ = 6 to smooth the saliency scores. We denote the set of all saliency maps as D = {Dij: i, j ∈ {1, 2, ..., n}, i �= j}. A location l in a stimulus image is salient for class i with respect to class j if Dij(l)>θ, όπου το όριο θ=0.5 × max(D) είναι ένα εμπειρικά καθορισμένο βαθμωτό μέγεθος.

Θεωρούμε δύο ασύμμετρες μετρήσεις, την απόκλιση και τη διαφορά Kullback-Leibler (KL), ως υποψήφιες για τη συνάρτηση g. Απόκλιση KL Δεδομένων δύο κανονικοποιημένων μέσων εικόνων, Ii και Ij, η απόκλιση KL KL(Ii, Ij) μετρά την απώλεια πληροφοριών όταν το Ij χρησιμοποιείται για την προσέγγιση Ii. Αυτό υπολογίζεται για κάθε pixel k as26: KL(Ii,k, Ij,k)=Ii,k log δ + Ii,k Ij,k+δ, όπου Ij,k είναι η ένταση του kth pixel του Ij, και το δ είναι μια σταθερά τακτοποίησης. Όταν Ii,k=Ij,k, KL(Ii,k,Ij,k) → 0. Διαφορά Δεδομένων δύο κανονικοποιημένων μέσων εικόνων, Ii και Ij, η διαφορά για κάθε pixel k είναι Diff (Ii,k, Ij,k)=Ii,k − Ij,k. Όταν Ii,k=Ij,k, Diff (Ii,k, Ij,k)=0. Ένας συμμετέχων είναι αβέβαιος σχετικά με το σύνολο των μαθημάτων, ct, που επέλεξε στο τρέχον επεισόδιο. Ως εκ τούτου, για την πρόβλεψη τοποθεσίας, λαμβάνουμε υπόψη μόνο εκείνους τους χάρτες προεξοχής στο D που περιλαμβάνουν τις κλάσεις στο ct. Μια τοποθεσία προβλέπεται εάν είναι εμφανής με βάση αυτούς τους χάρτες προεξοχής και δεν επιλέχθηκε ποτέ από τον συμμετέχοντα. Έτσι, δοθέντων o1:t, l1:t και ct, η τοποθεσία lt+1 προβλέπεται ως εξής:

image

όπου Ŵ είναι το σύνολο των 3-πλειάδων που περιέχουν την προβλεπόμενη θέση ˆl, την κλάση για την οποία είναι εμφανής για το (i) και ως προς την κλάση (j). Η τοποθεσία προβλέπεται σωστά εάν υπάρχει ένα �ˆl, i, j� ∈ Ŵ τέτοιο ώστε �ˆl − lt+1� < ǫ, I ∈ ct+1 και j /∈ ct{{3} }, όπου ǫ είναι η μέγιστη Ευκλείδεια απόσταση μεταξύ του κεντρικού εικονοστοιχείου και οποιουδήποτε εικονοστοιχείου σε μια ενημερωμένη έκδοση κώδικα παρατήρησης. Ο ψευδοκώδικας για την πρόβλεψη θέσης εμφανίζεται στον Αλγόριθμο 1. Μια λεπτομερής επεξήγηση του ψευδοκώδικα περιλαμβάνεται στην Ενότητα S1 του συμπληρωματικού υλικού. (Η κατανομή πιθανοτήτων, P(lt+1|o1:t, l1:t,ct), μπορεί να υπολογιστεί υποθέτοντας ότι ο βαθμός προεξοχής των τοποθεσιών που δεν είναι στο Ŵ είναι μηδέν και, στη συνέχεια, κανονικοποιώντας τη βαθμολογία εξέχουσας θέσης όλων τοποθεσίες για άθροισμα στη μονάδα. Ωστόσο, αυτή η πιθανότητα δεν έχει χρησιμοποιηθεί, καθώς η εξίσωση (3) είναι επαρκής για τους σκοπούς αυτής της εργασίας.)

image

Αξιολόγηση μοντέλων που βασίζονται στην προσοχή.

Ως εκπρόσωπος των μοντέλων που βασίζονται στην προσοχή, λαμβάνουμε υπόψη το μοντέλο επαναλαμβανόμενης προσοχής (RAM)3 που αναφέρεται σε πολλές αναφορές, το οποίο αναφέρει πειραματικά αποτελέσματα στο σύνολο δεδομένων MNIST. Αυτό το μοντέλο ενίσχυσης λαμβάνει διαδοχικά δείγματα μιας εικόνας και αποφασίζει πού θα γίνει η επόμενη δειγματοληψία σε κάθε στιγμή δειγματοληψίας, καθιστώντας το κατάλληλο για αξιολόγηση χρησιμοποιώντας τα δεδομένα που συλλέγονται.

ΕΜΒΟΛΟ

ταξινομεί τις εικόνες χρησιμοποιώντας μια ακολουθία ματιών. Η επόμενη τοποθεσία επιλέγεται στοχαστικά από μια κατανομή που παραμετροποιείται από ένα δίκτυο τοποθεσίας. Το μοντέλο εκπαιδεύεται από άκρο σε άκρο μεγιστοποιώντας τον ακόλουθο στόχο3:

image


όπου M είναι ο αριθμός των επεισοδίων, T είναι ο αριθμός των παρατηρήσεων, xi 1:t είναι οι ακολουθίες αλληλεπίδρασης που λαμβάνονται με την εκτέλεση του τρέχοντος παράγοντα μέχρι τα επεισόδια I, ui t είναι η τρέχουσα ενέργεια, θ είναι το σύνολο των εκπαιδεύσιμων παραμέτρων, Rit είναι η αθροιστική ανταμοιβή, το bt είναι μια γραμμή βάσης και η π(ui t|xi 1:t; θ ) είναι η πολιτική. Η συμπεριφορά της μνήμης RAM μπορεί να συγκριθεί με τη συμπεριφορά των συμμετεχόντων συγκρίνοντας τους χάρτες στερέωσης που λαμβάνονται από την ακολουθία θέσεων που προβλέπονται από τη μνήμη RAM και εκείνων που επιλέγουν οι συμμετέχοντες. Ένας χάρτης fxation υπολογίζεται εκχωρώντας σε κάθε τοποθεσία μια τιμή ίση με τη συχνότητα της επιλογής της και στη συνέχεια κανονικοποιώντας αυτές τις τιμές για να δημιουργήσετε μια κατανομή σε όλες τις τοποθεσίες.

Μετρήσεις για σύγκριση χαρτών σταθεροποίησης. Για μετρήσεις που συγκρίνουν δύο χάρτες σταθεροποίησης, P και Q, ακολουθούμε πιστά το 26. Χρησιμοποιούμε τρεις μετρήσεις που βασίζονται στην κατανομή: απόκλιση KL (KL), συντελεστή συσχέτισης Pearson (CC) και Ομοιότητα (SIM), για να συγκρίνουμε την κατανομή των τοποθεσιών δειγματοληψίας από ένα μοντέλο με αυτό των συμμετεχόντων όπως καταγράφηκε στα δεδομένα που συλλέχθηκαν.

Το KL (που ορίστηκε νωρίτερα) είναι πολύ ευαίσθητο σε μηδενικές τιμές.

Το CC μπορεί να αξιολογήσει τη γραμμική σχέση μεταξύ δύο χαρτών ως26: CC(P, Q)=σ (P, Q) σ (P)σ (Q), όπου σ είναι η διακύμανση ή η συνδιακύμανση. Δεδομένου ότι το CC είναι συμμετρικό, αποτυγχάνει να συμπεράνει εάν οι διαφορές μεταξύ των χαρτών σταθεροποίησης οφείλονται σε ψευδώς θετικά ή ψευδώς αρνητικά.

Η SIM μετράται ως 26: SIM(P, Q)=k min(Pk, Qk), όπου k Pk=k Qk=1. Όπως το CC, η SIM είναι συμμετρική και κληρονομεί το ίδιο μειονέκτημα. Επίσης, η SIM είναι πολύ ευαίσθητη σε τιμές που λείπουν και τιμωρεί τις προβλέψεις που αποτυγχάνουν να λάβουν υπόψη την πυκνότητα της αλήθειας εδάφους.

Έρευνα σε ανθρώπους και ζώα.

Η Επιτροπή Θεσμικής Αναθεώρησης του Πανεπιστημίου του Μέμφις αποφάσισε ότι αυτή η μελέτη δεν πληροί τον ορισμό του Office of Human Subjects Research Protections για την έρευνα σε ανθρώπινα υποκείμενα και το 45 CFR μέρος 46 δεν ισχύει. Ως εκ τούτου, αυτή η μελέτη δεν απαιτεί έγκριση ή επανεξέταση IRB.

Πειραματικά αποτελέσματα Ανάλυση δεδομένων.

Τα δεδομένα που συλλέγονται μπορούν να οπτικοποιηθούν ως προς την αλληλουχία κατανομής των επιλεγμένων τοποθεσιών (Εικ. 3), των επιλεγμένων τάξεων (Εικ. 2) και της διάρκειας μεταξύ των διαδοχικών επεισοδίων (Εικ. 2). Αυτές οι κατανομές είναι πολύ παρόμοιες για τα τρία σύνολα δεδομένων. Για οποιονδήποτε αριθμό ή αλφάβητο, η κατανομή των επιλεγμένων τοποθεσιών μετά το τελευταίο επεισόδιο μοιάζει με την κατανομή των εντάσεων pixel της κατηγορίας του από το σύνολο δεδομένων. Ωστόσο, η ακολουθία των τοποθεσιών που επιλέχθηκαν είναι στοχαστική. Η κατανομή της τάξης υποδηλώνει σύγχυση μεταξύ κατηγοριών με παρόμοιες δομές στα αρχικά λίγα επεισόδια όταν οι συμμετέχοντες επιλέγουν πολλές τάξεις. Αυτή η σύγχυση μειώνεται με περισσότερη δειγματοληψία. Υπάρχει σημαντική θετική συσχέτιση μεταξύ του βαθμού σύγχυσης (# επιλεγμένες τάξεις/σύνολο # τάξεων) και της διάρκειας δειγματοληψίας (βλ. Εικ. 4). Εάν ο αριθμός των επιλεγμένων τάξεων είναι υψηλός (χαμηλός), η διάρκεια μεταξύ των διαδοχικών επεισοδίων είναι υψηλή (χαμηλή). Το CC της ακολουθίας τοποθεσιών που επιλέγονται από έναν συμμετέχοντα για μια τάξη δεν είναι σημαντικό (Πίνακας 1). Αυτό αναμένεται λόγω της μεταβλητότητας μεταξύ των θεμάτων στη δειγματοληψία στατικών εικόνων. Ο μέσος αριθμός δειγματοληψιών που απαιτούνται από έναν συμμετέχοντα για την ακριβή πρόβλεψη μιας τάξης είναι αρκετά χαμηλός. Κατά μέσο όρο, χρειάζονται 4,2, 4,7 και 4,9 δείγματα που αντιστοιχούν σε 36, 44,1 και 48,1 δευτερόλεπτα για την ακριβή ταξινόμηση των εικόνων MNIST, EMNIST κεφαλαίων και πεζών αντίστοιχα. Οι συμμετέχοντες έβλεπαν κατά μέσο όρο μόνο το 11,3%, το 13,4% και το 13,7% της περιοχής της εικόνας για την ακριβή ταξινόμηση μιας εικόνας με αριθμούς, κεφαλαία και πεζά γράμματα (βλ. Εικ. S2 στο συμπληρωματικό υλικό). Αυτά τα αποτελέσματα υπογραμμίζουν την αποτελεσματικότητα του ανθρώπινου συστήματος οπτικής συλλογιστικής, αν και σε χαμηλότερη ανάλυση από τα δεδομένα παρακολούθησης ματιών, αλλά με λιγότερο θόρυβο και μεταβλητότητα. Αυτά τα εμπειρικά αποτελέσματα μπορεί να είναι χρήσιμα για το σχεδιασμό μοντέλων που βασίζονται στην προσοχή για εφαρμογές πραγματικού κόσμου. Πρόβλεψη συμπεριφοράς. Σε αυτήν την ενότητα, η απόδοση του βασικού μας μοντέλου αξιολογείται ως προς την ακρίβεια που μπορεί να προβλέψει την τοποθεσία και την επιλογή τάξης κάθε συμμετέχοντα. Δεδομένου ότι τα πειραματικά μας αποτελέσματα που χρησιμοποιούν τις δύο συναρτήσεις βαθμολόγησης εξέχουσας σημασίας, την απόκλιση KL και τη διαφορά, είναι αρκετά παρόμοια, τα αποτελέσματα αναφέρονται μόνο χρησιμοποιώντας τη διαφορά, εκτός εάν αναφέρεται διαφορετικά. Πρόβλεψη τάξης. Η πρόβλεψη κλάσης και οι μέθοδοι αξιολόγησης της ακρίβειας περιγράφονται στην ενότητα "Πρόβλεψη κλάσης". Η ακρίβεια πρόβλεψης κλάσης, που φαίνεται στο Σχ. 5, υπολογίζεται σε όλες τις κατηγορίες για όλες τις δειγματοληψίες. Η μέση ακρίβεια πρόβλεψης κλάσης σε όλα τα δείγματα και τα σύνολα δεδομένων είναι 74,4% (std. dev. 26,5). Τα σχήματα 5α και β δείχνουν ότι το σύνολο των τάξεων που επιλέχθηκαν από τους συμμετέχοντες και από το βασικό μας μοντέλο (Εξ. 2) είναι αρκετά ανακριβές στα αρχικά επεισόδια και βελτιώνεται με την αύξηση των δειγμάτων. Το Σχήμα 5γ δείχνει ότι, κατά τα αρχικά επεισόδια, αυτά τα δύο σύνολα, ct και ˆct, είναι αρκετά ανόμοια. η ομοιότητα αυξάνεται με την αύξηση των δειγμάτων. Το ίδιο ισχύει για τις νέες επιλογές κλάσεων (αναφ. Εικ. 5στ). Ωστόσο, οι απορρίψεις τάξης είναι παρόμοιες στα αρχικά επεισόδια. Η ομοιότητα αυξάνεται περαιτέρω με περισσότερα δείγματα (αναφ. Εικ. 5ε). Αφού J(st, ˆst)=|(ct ∩ ˆct) − ct−1| |(ct ∪ ˆct) − ct−1| και J(rt, ˆrt)=|ct−1 − (ct ∪ ˆct)| |ct−1 − (ct ∩ ˆct)|, μπορεί να συναχθεί από το Σχ. 5e, f ότι στα αρχικά επεισόδια, η τομή μεταξύ ct−1 και ct ∪ ˆct είναι μικρή, υποδεικνύοντας ότι αρχικά οι συμμετέχοντες και το βασικό μας μοντέλο κάνουν πολλές αλλαγές στην επιλογή της τάξης τους μεταξύ διαδοχικών επεισοδίων. Επομένως, αρχικά, η διαδικασία επιλογής κλάσης είναι εξαιρετικά στοχαστική. Ενώ υπάρχουν κάποιες διαφορές μεταξύ της πρόβλεψης της τάξης των συμμετεχόντων και του μοντέλου μας κατά τα αρχικά επεισόδια, οι συμπεριφορές γίνονται όλο και πιο παρόμοιες με περισσότερα δείγματα. Κατά τη διάρκεια των πρώτων (συνήθως 4 έως 7) επεισοδίων, αποκαλύπτονται εξαιρετικά σημαντικά μέρη ενός ερεθίσματος. Αυτό βοηθά στην επιλογή μόνο της σωστής κλάσης στις επόμενες δειγματοληψίες, γεγονός που αυξάνει την ακρίβεια πρόβλεψης. Δεδομένου ότι υπάρχουν πολλές τάξεις των οποίων τα μέσα πρότυπα ταιριάζουν με τα παρατηρούμενα μέρη του ερεθίσματος κατά τα αρχικά λίγα επεισόδια, η διαδικασία επιλογής τάξης είναι σημαντικά πιο στοχαστική, οδηγώντας σε χαμηλή ακρίβεια ταξινόμησης από τους συμμετέχοντες καθώς και από το μοντέλο μας.

Figure 3. Distribution of sampling locations over all participants for each numeral/alphabet class and each sampling episode. Each row corresponds to a class, each column corresponds to a sampling episode which increases from left to right.


Εικόνα 3. Κατανομή των τοποθεσιών δειγματοληψίας σε όλους τους συμμετέχοντες για κάθε τάξη αριθμών/αλφαβήτου και κάθε επεισόδιο δειγματοληψίας. Κάθε σειρά αντιστοιχεί σε μια κλάση, κάθε στήλη αντιστοιχεί σε ένα επεισόδιο δειγματοληψίας που αυξάνεται από αριστερά προς τα δεξιά.

Πρόβλεψη τοποθεσίας. Η ακρίβεια πρόβλεψης τοποθεσίας του βασικού μας μοντέλου (Εξ. 3), που υπολογίζεται κατά μέσο όρο σε όλα τα δείγματα και τα σύνολα δεδομένων, είναι 67,7% (std. dev. 14.1) (αναφ. Εικ. 5δ). Η τάση αυτής της ακρίβειας πρόβλεψης είναι αντίθετη με εκείνη της ακρίβειας πρόβλεψης κλάσης. Ωστόσο, η εξήγηση παραμένει η ίδια. Η ακρίβεια πρόβλεψης τοποθεσίας είναι υψηλή κατά τη διάρκεια των αρχικών δειγματοληψιών, επειδή κατά τη διάρκεια αυτών των επεισοδίων, επιλέγονται οι εξαιρετικά εμφανείς τοποθεσίες, αφήνοντας τις λιγότερο εμφανείς τοποθεσίες να επιλέγονται στα επόμενα επεισόδια. Δεδομένου ότι υπάρχουν πολλές τοποθεσίες με χαμηλή προεξοχή, η διαδικασία επιλογής τους είναι εξαιρετικά στοχαστική και ως εκ τούτου δύσκολο να προβλεφθεί, οδηγώντας σε μείωση της ακρίβειας πρόβλεψης με αύξηση των δειγματοληψιών. Η φθίνουσα τάση είναι μοναδική για κάθε σύνολο δεδομένων (αναφ. Εικ. 5δ) καθώς ο αριθμός των κλάσεων και ο αριθμός των εξαιρετικά σημαντικών τοποθεσιών που είναι χρήσιμες για τη διάκριση ποικίλλουν μεταξύ των συνόλων δεδομένων. Όσο μικρότερος είναι ο αριθμός των τάξεων και οι εξαιρετικά εμφανείς διακριτικές τοποθεσίες, τόσο πιο γρήγορη θα είναι η μείωση της ακρίβειας πρόβλεψης τοποθεσίας με αύξηση των δειγματοληψιών.

imageFigure 4. (Lef) Errorbar plot of time diference (seconds) between consecutive samples averaged over all classes. Tat is, value shown at sampling episode t is the time elapsed between a participant's clicks in image at t − 1 and t. (Right) Errorbar plot of confusion averaged over all classes at each episode. Errorbars indicate std. dev.

Σχήμα 4. (Αριστερά) Διάγραμμα της γραμμής σφαλμάτων της χρονικής διαφοράς (δευτερόλεπτα) μεταξύ των διαδοχικών δειγμάτων με μέσο όρο σε όλες τις κατηγορίες. Tat είναι, η τιμή που εμφανίζεται στο επεισόδιο δειγματοληψίας t είναι ο χρόνος που μεσολάβησε μεταξύ των κλικ ενός συμμετέχοντα στην εικόνα στο t − 1 και στο t. (Δεξιά) Η πλοκή σύγχυσης της γραμμής σφαλμάτων υπολογίζεται κατά μέσο όρο σε όλες τις κατηγορίες σε κάθε επεισόδιο. Οι γραμμές σφαλμάτων υποδεικνύουν το std. dev.

Figure 5. Evaluation of our baseline model (ref.

Εικόνα 5. Αξιολόγηση του βασικού μας μοντέλου (αναφ. Ενότητα "Baseline for Behaviour Prediction"). (α) Ακρίβεια ταξινόμησης (σύμ.) των συμμετεχόντων και (β) αυτή του βασικού μας μοντέλου με πραγματικές ετικέτες ως βασική αλήθεια. (γ) Ομοιότητα ταξινόμησης (J(ct, ˆct)), (δ) ακρίβεια πρόβλεψης τοποθεσίας, (ε) ακρίβεια απόρριψης κλάσης και (στ) ακρίβεια επιλογής τάξης του βασικού μας μοντέλου με τα δεδομένα των συμμετεχόντων ως βασική αλήθεια. Δείτε την ενότητα "Πρόβλεψη συμπεριφοράς" για λεπτομέρειες.

Table 1. Average Pearson correlation coefficient (corr.) for fxation sequences for the same class. For any fixation, distance is Euclidean and direction is measured as the polar angle with respect to the center of stimuli as the origin. Std. dev. are included in parenthesis.


Πίνακας 1. Μέσος συντελεστής συσχέτισης Pearson (corr.) για ακολουθίες fxation για την ίδια τάξη. Για οποιαδήποτε στερέωση, η απόσταση είναι Ευκλείδεια και η διεύθυνση μετράται ως η πολική γωνία σε σχέση με το κέντρο των ερεθισμάτων ως αρχή. Std. dev. περιλαμβάνονται σε παρένθεση.

Αξιολόγηση της μνήμης RAM.

Για κάθε κλάση και δειγματοληψία, συγκρίνονται οι χάρτες σταθεροποίησης από τη μνήμη RAM (χρησιμοποιήσαμε την υλοποίηση RAM από το github.com/hehefan/Recurrent-Attention-Model) και τα δεδομένα που συλλέχθηκαν για τα ίδια ερεθίσματα που παρουσιάζονται στο MTurk. Για μια δίκαιη σύγκριση με τους συμμετέχοντες, στη μνήμη RAM καθορίσαμε το μήκος της ακολουθίας στο T=12, την πρώτη θέση δειγματοληψίας στο κέντρο εικόνας, την παρατήρηση εισόδου σε ένα patch 5×5 με την επιλεγμένη θέση ως κέντρο και τροποποίησε τη συνάρτηση ανταμοιβής με την Εξ. (1). Η σωρευτική ανταμοιβή, Rt στην Εξ. Το (4,) αντικαθίσταται από τη αθροιστική βαθμολογία t τ=1 Pτ που λαμβάνεται από την Εξ. (1). Καθώς ένας συμμετέχων μπορεί να επιλέξει πολλές τάξεις σε οποιοδήποτε επεισόδιο, για το μοντέλο RAM, αντί να προβλέψουμε μια μεμονωμένη κατηγορία με βάση την υψηλότερη πιθανότητα, θεωρούμε τη μέση πιθανότητα σε όλες τις κατηγορίες ως κατώφλι και προβλέπουμε το σύνολο των κλάσεων ct με πιθανότητες μεγαλύτερες από την κατώφλι. Αυτό το ct χρησιμοποιείται για τον υπολογισμό της βαθμολογίας χρησιμοποιώντας την Εξ. (1). Υπό αυτές τις συνθήκες, η μνήμη RAM απαιτεί 3,7, 8,5 και 7,6 δείγματα για την αναγνώριση αριθμών MNIST, κεφαλαίων και πεζών αλφάβητων EMNIST, τα οποία αντιστοιχούν στο 8,9%, στο 21.0%, στο 18,7% της περιοχής της εικόνας αντίστοιχα. Έτσι, σε σύγκριση με τους συμμετέχοντες μας (αναφ. ενότητα "Ανάλυση δεδομένων"), η RAM είναι λιγότερο αποδοτική. Δείτε τον Πίνακα 2. Τα αποτελέσματα από τη σύγκριση των χαρτών στερέωσης από τη μνήμη RAM και των συλλεγόμενων δεδομένων φαίνονται στον Πίνακα 3. Το KL είναι υψηλότερο λόγω της ευαισθησίας του σε μηδενικές τιμές. Αυτό σημαίνει ότι δειγματοληψία πολλών τοποθεσιών από τους συμμετέχοντες αλλά όχι από τη μνήμη RAM. Αυτά τα πειράματα μπορούν να χρησιμοποιηθούν ως βάση για την αξιολόγηση τοποθεσιών που δειγματοληπτήθηκαν από ένα μοντέλο προσοχής.

cistanche-Improve memory2

Οφέλη cistanche - Βελτίωση της μνήμης

Συζητήσεις

Το παράδειγμα mcAT, όπως χρησιμοποιείται σε αυτό το άρθρο, έχει ορισμένα σημεία διαφοράς από εκείνα που βασίζονται κυρίως στις κινήσεις των ματιών και τα βλέμματα για τη μελέτη των μηχανισμών αναγνώρισης αντικειμένων. Στο τελευταίο, προεξέχοντα σημεία της σκηνής προσελκύουν πρώτα την προσοχή, ακολουθούμενα από σακκαδικές κινήσεις των ματιών που κατευθύνουν το βλέμμα των ματιών στις εμφανείς τοποθεσίες27. Το βλέμμα καθοδηγείται από σήματα από κάτω προς τα πάνω και από πάνω προς τα κάτω τα οποία, μαζί με τις σημαντικές πληροφορίες, σχηματίζουν χάρτες προτεραιότητας που καθοδηγούν τις κινήσεις των ματιών για την αναγνώριση αντικειμένων. Δεδομένου ότι οι συμμετέχοντες στην παρούσα μελέτη εξέτασαν τις στατικές εικόνες υπό συνθήκες ελεύθερης προβολής και με αρκετό χρόνο στη διάθεσή τους (έξι λεπτά για δειγματοληψίες Τ=12), πιθανότατα συμμετείχαν σε μια σειρά από σακκαδικές κινήσεις των ματιών ή οπτικούς συλλογισμούς28 για να εξερευνήσουν την εικόνα πριν κάνετε κλικ σε ένα AOI. Αυτές οι κινήσεις των ματιών θα μπορούσαν να έχουν αποτυπωθεί στο emAT (χρησιμοποιώντας έναν ανιχνευτή ματιών) αλλά όχι στο mcAT. Ωστόσο, αυτές οι κινήσεις των ματιών επηρεάζονται από την περιπλάνηση του μυαλού. Ενώ το mcAT επηρεάζεται επίσης από την περιπλάνηση του μυαλού29, το αποτέλεσμα μπορεί να μειωθεί κάθε φορά που οι συμμετέχοντες ανταποκρίνονται μετά από οπτική συλλογιστική. Δεδομένου ότι οι κινήσεις των ματιών ως απόκριση σε ένα ερέθισμα επηρεάζονται από την εργασία που εκτελείται30, τα μοτίβα των οφθαλμικών κινήσεων των συμμετεχόντων πιθανότατα επηρεάστηκαν από την εργασία τριών βημάτων που είχε ανατεθεί σε κάθε δειγματοληψία (αναφ. ενότητα "Οπτική εργασία"). Εάν είχε χρησιμοποιηθεί ένας ανιχνευτής ματιών, οι κινήσεις των ματιών των συμμετεχόντων για να εξερευνήσουν το δείγμα θα είχαν αναμειχθεί με τις κινήσεις των ματιών για να κάνουν κλικ στις επιλεγμένες τάξεις τους, κάτι που θα περιέπλεκε την ερμηνεία της οπτικής εξερεύνησης του δείγματος. Το κλικ στις τάξεις είναι ένα απαραίτητο βήμα, καθώς αποκαλύπτει, έστω και ενδοσκοπικά, τις προβλεπόμενες τάξεις στο μυαλό ενός συμμετέχοντα. Είναι πιθανό ότι τα βλέμματα αμέσως πριν και μετά την επιλογή AOI -ενδεχομένως υποβοηθούμενη από καθηλωτικές κινήσεις των ματιών{10}}συνέβαλαν τα μέγιστα στην αναγνώριση αριθμών/αλφαβήτου. Πράγματι, υποθέτουμε ότι οι συμμετέχοντες επέλεξαν διαγνωστικές περιοχές της εικόνας για να διακρίνουν μεταξύ των τάξεων και αυτές οι περιοχές πιθανότατα περιέχουν ένα μείγμα διαγνωστικών πληροφοριών από κάτω προς τα πάνω (π.χ. οπτική αντίθεση) και από πάνω προς τα κάτω (αριθμός/πρότυπο αλφαβήτου). Αυτό είναι σύμφωνο με το εύρημα μας ότι οι συμμετέχοντες γρήγορα (μέσα σε 5 δείγματα κατά μέσο όρο) διέκριναν μεταξύ των κατηγοριών ερεθισμάτων φαινομενικά επιλέγοντας διαγνωστικά επιθέματα.

Table 2. Comparison of efficiency between our participants and the RAM model in terms of the average number of samples required to recognize a numeral/alphabet. The percentage of the image area observed is included in parentheses.

Πίνακας 2. Σύγκριση της αποτελεσματικότητας μεταξύ των συμμετεχόντων μας και του μοντέλου RAM ως προς τον μέσο αριθμό δειγμάτων που απαιτούνται για την αναγνώριση ενός αριθμού/αλφαβήτου. Το ποσοστό της περιοχής εικόνας που παρατηρείται περιλαμβάνεται σε παρένθεση.

Table 3. Evaluation of fixation maps from RAM for the stimuli presented in the MTurk experiments averaged over all classes and samplings. Std. dev. are included in parenthesis.


Πίνακας 3. Αξιολόγηση χαρτών σταθεροποίησης από τη μνήμη RAM για τα ερεθίσματα που παρουσιάστηκαν στα πειράματα MTurk με μέσο όρο σε όλες τις κατηγορίες και τα δείγματα. Std. dev. περιλαμβάνονται σε παρένθεση.

συμπεράσματα

Εισαγάγαμε ένα σύνολο δεδομένων mcAT για την αναγνώριση χειρόγραφων αριθμών και αλφαβήτων μέσω διαδοχικής δειγματοληψίας. Τα δεδομένα συλλέγονται από 382 συμμετέχοντες που παρουσιάζονται με εικόνες επιλεγμένες από σύνολα δεδομένων αναφοράς (MNIST, EMNIST). Κατά μέσο όρο, καταγράφονται 169,1 απαντήσεις ανά τάξη αριθμών/αλφαβήτου. Τα δεδομένα αναλύονται αυστηρά για να αποκαλυφθεί η αποτελεσματικότητα της ανθρώπινης οπτικής αναγνώρισης. Οι συμμετέχοντες παρατήρησαν μόνο το 12,8% μιας εικόνας για αναγνώριση. Προτείναμε ένα βασικό μοντέλο για να προβλέψουμε την τοποθεσία και τις τάξεις που θα επέλεγε ένας συμμετέχων στην επόμενη δειγματοληψία. Δείξαμε πώς οι πειραματικές συνθήκες και τα δεδομένα μας μπορούν να χρησιμοποιηθούν για την αξιολόγηση ενός μοντέλου ενίσχυσης που βασίζεται στην προσοχή σε σύγκριση με την ανθρώπινη απόδοση. Αυτό το σύνολο δεδομένων mcAT, με πολλαπλά οφέλη σε σχέση με τα δεδομένα παρακολούθησης ματιών, καλύπτει ένα κρίσιμο κενό στην έρευνα μοντέλων που βασίζεται στην προσοχή σε τεχνητή νοημοσύνη, ML και άλλους τομείς.

βιβλιογραφικές αναφορές

1. Ranzato, MA Σχετικά με την εκμάθηση πού να κοιτάξετε. arXiv:1405.5488, (2014).

2. Ba, J., Salakhutdinov, RR, Grosse, RB, & Frey, BJ Εκμάθηση μοντέλων επαναλαμβανόμενης προσοχής εγρήγορσης-ύπνου. Στο NIPS, 2593–2601 (2015).

3. Mnih, V. et αϊ. Επαναλαμβανόμενα μοντέλα οπτικής προσοχής. Στο NIPS, 2204–2212 (2014).

4. Ba, J., Mnih, V., & Kavukcuoglu, K. Αναγνώριση πολλαπλών αντικειμένων με οπτική προσοχή. arXiv:1412.7755 (2014).

5. Dutta, JK & Banerjee, B. Διακύμανση στην ακρίβεια ταξινόμησης με αριθμό ματιών. Στο IJCNN, 447–453 (IEEE, 2017).

6. Larochelle, H. & Hinton, GE Μαθαίνουμε να συνδυάζουμε βλεφαρίδες με ένα μηχάνημα Boltzmann τρίτης τάξης. Στο NIPS, 1243–1251 (2010).

7. Elsayed, G., Kornblith, S. & Le, QV Saccader: Βελτίωση της ακρίβειας των μοντέλων σκληρής προσοχής για την όραση. Στο NIPS, 702–714 (2019).

8. van Beers, RJ Te πηγές μεταβλητότητας στις σακαδικές κινήσεις των ματιών. J. Neurosci. 27(33), 8757–8770 (2007).

9. Itti, L. & Baldi, P. Bayesian έκπληξη προσελκύει την ανθρώπινη προσοχή. Vis. Res. 49(10), 1295–1306 (2009).

10. Egner, S. et al. Προσοχή και απόκτηση πληροφοριών: Σύγκριση του κλικ του ποντικιού με την παρακολούθηση της προσοχής των κινήσεων των ματιών. J. Eye Mov. Res. 11(6), (2018).

11. Peterson, MS, Kramer, AF & Irwin, DE Οι κρυφές μετατοπίσεις της προσοχής προηγούνται των ακούσιων κινήσεων των ματιών. Αντίληψη. Psychophys. 66(3), 398–405 (2004).

12. Jiang, Μ. et αϊ. Πυρίτιο: Εξέχουσα θέση στο πλαίσιο. Στο CVPR, 1072–1080 (2015).

13. Kim, NW et al. BubbleView: Μια διεπαφή για crowdsourcing χαρτών σημασίας εικόνων και παρακολούθηση οπτικής προσοχής. ACM Trans. Υπολογιστής. Βουητό. Αλληλεπιδρώ. 24(5), 1–40 (2017).

14. Sermanet, P., Frome, A. & Real, E. Προσοχή για λεπτόκοκκη κατηγοριοποίηση. arXiv:1412.7054 (2014).

15. Egner, S., Itti, L. & Scheier, C. Σύγκριση μοντέλων προσοχής με διαφορετικούς τύπους δεδομένων συμπεριφοράς. Ερευνήστε. Ophthalmol. Vis. Sci. 41(4), S39 (2000).

16. Navalpakkam, V. et al. Μέτρηση και μοντελοποίηση συμπεριφοράς ματιού-ποντικιού παρουσία μη γραμμικών διατάξεων σελίδας. Στο Proc. Int. Συνδ. WWW, 953–964 (2013).

17. Matzen, LE, Stites, MC & Gastelum, ZN Μελέτη οπτικής αναζήτησης χωρίς ανιχνευτή ματιών: Μια αξιολόγηση της τεχνητής φύσεως. Cogn. Res. Princ. Υπονοούμενα. 6(1), 1–22 (2021).

18. Tafi, AP et al. OCR ως υπηρεσία: Μια πειραματική αξιολόγηση των Εγγράφων Google OCR, Tesseract, ABBYY FineReader και Transym. Στο Int. Συμπτ. Vis. Comput., 735–746 (Springer, 2016).

19. Memon, J., Sami, M., Khan, RA & Uddin, M. Handwritten optical character recognition (OCR): Μια ολοκληρωμένη συστηματική βιβλιογραφική ανασκόπηση (SLR). IEEE Access 8, 142642–142668 (2020).

20. Chaudhuri, A., Mandaviya, K., Badelia, P. & Ghosh, SK Optical character recognition systems. Στο Optical Character Recognition Systems for Different Language with Sof Computing, 9–41 (Springer, 2017).

21. LeCun, Υ. et αϊ. Η μάθηση βάσει κλίσης εφαρμόστηκε στην αναγνώριση εγγράφων. Proc. IEEE 86(11), 2278-2324 (1998).

22. Cohen, G., Afshar, S., Tapson, J. & van Schaik, A. EMNIST: Μια επέκταση του MNIST στα χειρόγραφα γράμματα. arXiv:1702.05373, (2017).

23. Gregor, K., Danihelka, I., Graves, A., Rezende, D. & Wierstra, D. DRAW: Ένα επαναλαμβανόμενο νευρωνικό δίκτυο για τη δημιουργία εικόνων. Στο ICML, 1462–1471 (2015).

24. Friston, K. Te free-energy origin: A rough guide to the brain?. Trends Cogn. Sci. 13(7), 293–301 (2009).

25. Mirza, MB, Adams, RA, Friston, K. & Parr, T. Εισαγωγή ενός Bayesian μοντέλο επιλεκτικής προσοχής που βασίζεται σε ενεργό συμπέρασμα. Sci. Rep. 9(1), 1–22 (2019).

26. Bylinskii, Z., Judd, T., Oliva, A., Torralba, A. & Durand, F. Τι μας λένε οι διαφορετικές μετρήσεις αξιολόγησης για τα μοντέλα προεξοχής; IEEE Trans. Μοτίβο Anal. Mach. Intell. 41(3), 740–757 (2018).

27. Itti, L. & Koch, C. Υπολογιστική μοντελοποίηση οπτικής προσοχής. Nat. Σεβ. Neurosci. 2(3), 194–203 (2001).

28. Lamme, VAF Οπτικές λειτουργίες που δημιουργούν συνειδητή όραση. Εμπρός. Psychol., 11, (2020).

29. da Silva, MRD & Postma, M. Περιπλανώμενα μυαλά, περιπλανώμενα ποντίκια: Η παρακολούθηση του ποντικιού υπολογιστή ως μέθοδος ανίχνευσης της περιπλάνησης του νου. Υπολογιστής. Βουητό. Συμπεριφορά. 112, 106453 (2020).

30. Schütz, AC, Braun, DI & Gegenfurtner, KR Κινήσεις ματιών και αντίληψη: Μια επιλεκτική ανασκόπηση. J. Vis. 11(5), 9–9 (2011).

31. Intoy, J. & Rucci, M. Οι λεπτές κινήσεις των ματιών ενισχύουν την οπτική οξύτητα. Nat. Commun. 11(1), 1–11 (2020).

Μπορεί επίσης να σας αρέσει