AttentionMNIST: nabor podatkov za sledenje pozornosti s klikom miške za prepoznavanje ročno napisanih številk in abecede

Feb 22, 2024

Več modelov, ki temeljijo na pozornosti in prepoznavajo predmete prek zaporedja prebliskov, so poročali o rezultatih prepoznavanja ročno napisanih številk. Vendar pa podatki o sledenju pozornosti za prepoznavanje ročno napisanih številk ali abecede niso na voljo. Razpoložljivost takih podatkov bi omogočila ovrednotenje modelov, ki temeljijo na pozornosti, v primerjavi s človeško zmogljivostjo. Zbiramo podatke o sledenju pozornosti s klikom miške od 382 udeležencev, ki poskušajo prepoznati ročno napisane številke in črke (velike in male črke) iz slik prek zaporednega vzorčenja. Slike iz nizov primerjalnih podatkov so predstavljene kot dražljaji. Zbrani nabor podatkov, imenovan AttentionMNIST, je sestavljen iz zaporedja vzorčnih (klik z miško) lokacij, prurejene oznake razreda pri vsakem vzorčenju in trajanje vsakega vzorčenja. Naši udeleženci v povprečju opazujejo le 12,8 % slike za prepoznavanje. Predlagamo osnovni model za napovedovanje lokacije in razreda, ki ga bo udeleženec izbral pri naslednjem vzorčenju. Ko je izpostavljen enakim dražljajem in eksperimentalnim pogojem kot naši udeleženci, zelo citiran model okrepitve, ki temelji na pozornosti, ne doseže človeške učinkovitosti.

Chinese herb cistanche

kitajski cistanchezelišče- Izdelki za preprečevanje Alzheimerjeve bolezni

Modeli strojnega učenja (ML), ki prepoznavajo predmete prek zaporedja utrinkov, so v zadnjih letih pridobili zanimanje zaradi svoje razširljivosti in učinkovitosti. Mnogi od teh modelov, kot je 1–7, so poročali o eksperimentalnih rezultatih na primerjalnem naboru podatkov MNIST za prepoznavanje ročno napisanih številk. Na žalost podatki o sledenju pozornosti za MNIST niso na voljo. To preprečuje vrednotenje modelov, ki temeljijo na pozornosti, v primerjavi s človeško zmogljivostjo. V to vrzel smo padli tako, da smo zbrali nabor podatkov odraslih udeležencev, ki so poskušali prepoznati ročno napisane številke in abecede iz slik prek zaporednega vzorčenja. Za razliko od sledenja pozornosti gibanja oči (emAT) udeleženec klikne lokacijo na sliki, ki jo želi videti (oblika sledenja pozornosti s klikom miške (mcAT)). Takoj za tem izbere razred(e), za katerega(-e) predvideva, da bi mu predmet lahko pripadal na podlagi svojih dosedanjih opazovanj. Tako so pri vsaki epizodi vzorčenja naši podatki sestavljeni iz izbrane lokacije slike, predvidenih oznak razreda in časa, ki ga je udeleženec porabil od zadnje epizode. Po vsaki sliki udeleženec prejme nagrado glede na svojo uspešnost (natančnost in učinkovitost).

Anti Alzheimer's disease

Koristi cistanche tubulosa-proti Alzheimerjevi bolezni

Prednosti mcAT pred emAT za prepoznavanje ročno napisanih številk/abecede.

(1) meso vsebuje znatno intra- in medosebno variabilnost v lokaciji fiksacije, zlasti za statične dražljaje (slike) 8,9. Za doseganje statistično pomembnih zaključkov je torej potrebna velika količina podatkov o fiksaciji oči. mcAT ni dovzeten za nekatere vire tehničnega šuma, ki je običajen za podatke o sledenju očem10. (2) Premiki oči so lahko posledica tako namernih kot naključnih mehanizmov11. Da bi olajšali odločanje, odvisno od nalog, udeležencem predstavimo ustrezen čas, kontekst in signale okrepitve, ki jih je mogoče predstaviti tudi modelu ML. (3) Natančnost in točnost podatkov emAT sta odvisni od sledilnika oči, medtem ko so podatki mcAT neodvisni od katere koli naprave. (4) Izziv je uskladiti gibanje oči z izbiro razreda. Da bi to odpravili, so v našem primeru lokacija vzorčenja in razred(-i) izbrani v isti epizodi. (5) Končno, naša metoda omogoča zbiranje podatkov z uporabo Amazon Mechanical Turk (MTurk), kot v 12,13, ki je stroškovno in časovno učinkovito ter enostavno ponovljivo.

Prispevki.

Nabor podatkov mcAT, imenovan AttentionMNIST, z uporabo MTurk zbiramo od 382 udeležencev, nagrajenih za natančno in učinkovito prepoznavanje ročno napisanih številk in abeced (velikih in malih črk) iz slik prek zaporednega vzorčenja. Slike iz primerjalnih nizov podatkov (MNIST, EMNIST) so predstavljene kot dražljaji. V povprečju je zabeleženih 169,1 odgovorov na razred številk/abecede. Z uporabo tega nabora podatkov pokažemo naslednje: • V povprečju udeleženci potrebujejo 4,2, 4,7 in 4,9 vzorcev za prepoznavanje številk, velikih in malih črk, kar ustreza le 11,3 %, 13,4 % oziroma 13,7 % površine slike. . Natančnost klasifikacije se poveča z več vzorci. • Model, predstavljen kot izhodišče, lahko napove razred(-e) in lokacijo, ki jo bo udeleženec izbral pri naslednji epizodi vzorčenja, s 74,4% oziroma 67,7% natančnostjo, oba povprečna za vsa vzorčenja in nize podatkov. Natančnost napovedi razreda se poveča, natančnost napovedi lokacije pa zmanjša s povečanjem vzorcev. • Ko je izpostavljen enakim dražljajem in pogojem kot naši udeleženci, visoko citirani model ponavljajoče se pozornosti (RAM)3 zahteva 3,7, 8,5 in 7,6 vzorcev za prepoznavanje številk, velikih in malih črk, kar ustreza 8,9 % , 21.0%, 18,7 % površine slike oz. Druge modele krepitve, ki temeljijo na pozornosti (npr. 1,2,4,5,7,14), je mogoče podobno ovrednotiti v primerjavi s človeško zmogljivostjo.

Cistanche supplement near me-Improve memory2

Cistanche dodatek blizu mene-izboljšanje spomina

Kliknite tukaj za ogled izdelkov Cistanche za izboljšanje spomina in preprečevanje Alzheimerjeve bolezni

【Vprašajte za več】 E-pošta:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Povezano delo

Časovno zaporedje klikov miške v mcAT je analogno poti skeniranja gibanja oči10. mcAT lahko učinkovito nadomesti emAT, saj sta močno povezana 10,12,13,15–17. V študijah mcAT so bile uporabljene različne vrste dražljajev, kot so slike živih in neživih predmetov10, slike naravnih prizorov12,13, statične spletne strani13, postavitve iskalnih strani16 in dva seznama alfanumeričnih nizov za vizualno primerjavo17. Vendar mcAT ni bil uporabljen za ročno napisane naloge klasifikacije številk/abecede ali vrednotenje modelov klasifikacije, ki temeljijo na pozornosti. Študije mcAT so uporabile funkcije, kot so čas do stika, relativna pogostost fiksacije v interesnih območjih (AOI), relativni delež subjektov, ki so vsaj enkrat kliknili v AOI10, število fiksacij na poskus, ponovna fiksacija v poskusih, časi zadrževanja in poti skeniranja17 , fiksacijski zemljevidi12,13, AOI in vzorec pretoka informacij16. Zaporedje časovno žigosanih lokacij klikov in predvidenih oznak razredov predstavlja neobdelane podatke, potrebne za ovrednotenje učinkovitosti in točnosti modelov, ki temeljijo na pozornosti, ali ljudi pri nalogah klasifikacije. Iz teh podatkov je mogoče izpeljati različne značilnosti. Naš nabor podatkov mcAT s številnimi prednostmi v primerjavi s podatki sledenja očem zapolnjuje ključno vrzel v raziskavah modelov, ki temeljijo na pozornosti, v AI, ML in drugih področjih. Naš nabor podatkov bo omogočil ovrednotenje modelov, ki temeljijo na pozornosti, v primerjavi s človeško zmogljivostjo. Med drugim bo to olajšalo razvoj učinkovitih sistemov za optično prepoznavanje znakov v realnem času, ki imajo široko uporabo v praksi (glej primer 18–20). Načela, ki vodijo vizualne fiksacije, je mogoče domnevati in preizkusiti z uporabo našega nabora podatkov. Uspešna načela je mogoče prenesti v razvoj sistemov za naloge vizualnega prepoznavanja v resničnem svetu, kjer je učinkovitost ključnega pomena, na primer pri avtonomni vožnji.

podatki

Naši podatki so sestavljeni iz zaporedja T epizod za vsakega udeleženca. Podatki iz vsake epizode so sestavljeni iz (1) lokacije na sliki, ki jo je udeleženec kliknil (en klik na sliko na epizodo), (2) razreda(-ov), ki jih je izbral udeleženec, in (3) časa, ki ga je porabil udeleženec registrira trenutni vzorec (tj. čas, ki je pretekel med zadnjim in trenutnim klikom na sliko). Ta razdelek bo razložil naš postopek zbiranja podatkov, vključno z izbiro dražljajev, udeleženci, vizualnimi nalogami, točkovanjem uspešnosti in filtriranjem podatkov.

Izbor dražljajev. Dražljaji so izbrani iz slik v dveh primerjalnih nizih podatkov: (1)

Nabor podatkov MNIST21 je sestavljen iz 70,000 označenih slik (28 × 28 slikovnih pik) z 10 ročno napisanimi številkami {0, 1, ..., 9}. (2)

Nabor podatkov EMNIST22 je sestavljen iz 145.600 slik (28 × 28 slikovnih pik) ročno napisanih angleških abeced z velikimi in malimi črkami, ki tvorijo uravnotežen razred. Vse slike so označene z enim od 26 razredov {a, b, ..., z}. Vendar pa oznaka z velikimi ali malimi črkami ni povezana z nobeno sliko. Iz vsake kategorije izberemo 15 pravilno oblikovanih številk iz MNIST in 15 pravilno oblikovanih abeced iz podatkovnih nizov EMNIST velikih in malih črk EMNIST. Dobro oblikovana številka ali abeceda je podobna normi svojega razreda. Tako predstavljamo dražljaje iz nabora 15 (10 + 26 + 26)=930 edinstvenih slik, pri čemer 15 slik pripada vsakemu od 62 razredov. Dobro oblikovane slike 930 so izbrane na naslednji način:

1. korak: Normalizirajte vsako sliko z uporabo min-max za spreminjanje intenzivnosti med 0 in 1.

2. korak: Označite dobro oblikovane slike EMNIST z velikimi ali malimi črkami. Za vsak razred abecede je ročno izbrana in označena dobro oblikovana abeceda iz slik z velikimi in malimi črkami. Izračuna se kosinusna podobnost vseh slik, ki pripadajo temu razredu, z dvema označenima slikama. Slikam, ki so nad kosinusnim pragom podobnosti (empirično izbranim kot 0.8), se dodeli oznaka z velikimi ali malimi črkami.

3. korak: Izračunajte povprečje slik, ki pripadajo vsakemu razredu. Povprečna podoba razreda predstavlja njegovo normo. Slika je primerna za dražljaj, če je njena kosinusna podobnost s srednjo sliko njenega razreda večja od empirično določenega praga (0.7 za MNIST, 0.75 za EMNIST).

4. korak: Med primernimi slikami je ročno izbranih 15 slik iz vsakega razreda glede na to, kako dobro so oblikovane. Vsaka slika, prvotno 28 × 28 slikovnih pik, je pomanjšana na 27 × 25 z odstranitvijo slikovnih pik blizu meja, saj nimajo variacije intenzivnosti. Povprečna vrednost teh 15 slik se izračuna za vsakega od 62 razredov. Te srednje slike označimo kot I1, I2, ..., In za n razredov v vsakem nizu podatkov.

Udeleženci.

V naši študiji je sodelovalo skupno 382 različnih odraslih posameznikov. Izbirna merila niso bila uporabljena. Udeleženec je lahko odgovoril na več slik. Za vsakega od 62 razredov je bilo zabeleženih povprečno 169,1 odgovorov.

man-5989553_960_720

Prednosti cistanche tubulosa-Proti Alzheimerjevi bolezni

Vizualna naloga.

Vmesnik MTurk za našo vizualno nalogo je prikazan na sliki 1. Platno velikosti 270×250 ves čas prikazuje sliko ozadja nizke intenzivnosti. Slike ozadja in dražljaja se desetkrat povečajo na 270 × 250. Sredina platna je poravnana s sredino slik. Ozadje Na začetku je ozadje povprečje vseh slik v naboru podatkov, iz katerega je dražljaj črpan. Po prvi epizodi je ozadje povprečje vseh slik iz nabora razredov, ki jih je udeleženec izbral v zadnji epizodi. V resničnem svetu je kontekst za lokacijo, velikost in orientacijo številke ali abecede pridobljen iz pisave v njeni bližini, ki tukaj manjka. Ko so bili naši poskusi izvedeni s praznim ozadjem, so udeleženci pogosto vzorčili lokacije slike, ki niso vsebovale nobenega dela predmeta. To vedenje je bilo omejeno s predstavitvijo povprečne slike izbranih razredov v ozadju nizke intenzivnosti in zmanjšanjem velikosti vseh slik MNIST in EMNIST z 28 × 28 slikovnih pik na 27 × 25. Vsakič, ko udeleženec izbere lokacijo na platnu s klikom nanjo, se prikaže zaplata 50 × 50 slikovnih pik s središčem na tej lokaciji iz slike dražljaja. Ko je popravek enkrat razkrit, je še naprej prikazan do zadnje epizode. Naloga udeleženca je sestavljena iz treh korakov v vsaki epizodi t (t=1, ..., T):

1. korak: Kliknite kjer koli na platnu 270 × 250, da razkrijete obliž, ki ga želi vzorčiti. Sprejet je le prvi klik.

2. korak: Prepoznajte številko/abecedo iz vseh do sedaj opazovanih vzorcev. Udeleženec lahko izbere več razredov in bo moral izbrati vsaj en razred s seznama razredov, prikazanega pod platnom.

3. korak: Za nadaljevanje kliknite »Naprej« na dnu zaslona. Za natančno in hitro sklepanje o razredu bo moral udeleženec premišljeno izbrati lokacije glede na svoja opažanja do trenutne epizode. Za epizodo ni časovne omejitve. Vendar pa omejimo skupni čas za T epizod slike na šest minut. Izbrali smo T=12, saj so visoko citirana dela o prepoznavanju ali ustvarjanju pisave na podlagi pozornosti uporabila manj kot 12 prebliskov (npr. RAM3 bi lahko prepoznal številke MNIST v 7 utripih, DRAW23 bi lahko ustvaril številke MNIST v 11 utripih) in ljudje lahko prepoznajo ročno napisane številke in abecede v veliko manj kot 12 pogledih.

Točkovanje uspešnosti. Ocena se dodeli udeležencu na podlagi njegove natančnosti in učinkovitosti glede na število opazovanih vzorcev. Naj bo to niz razredov, ki jih je izbral v kateri koli epizodi t. Deset, njegov rezultat pri t je:

Figure 1. Our MTurk interface as seen by a participant. Te second sampling for an EMNIST uppercase alphabet is shown.

Slika 1. Naš vmesnik MTurk, kot ga vidi udeleženec. Prikazano je drugo vzorčenje za abecedo velikih črk EMNIST.

image


kjer |.| označuje kardinalnost množice. Skupni rezultat, podeljen v T epizodah, je h {{0}} T t=1 Pt. Zato je največje možno število točk v T epizodah T, če vedno izbere le pravilen razred. Najmanjši možni rezultat v epizodah T je nič, če vedno izbere nabor razredov, ki ne vključuje pravilnega razreda. Torej, 0 Manjše ali enako h Manjše ali enako T. Prej ko udeleženec izbere pravilen razred, višji bo njegov rezultat. Tako ta mehanizem točkovanja upošteva natančnost prepoznavanja in učinkovitost vzorčenja. Poskus maksimiziranja rezultata z izbiro samo enega razreda iz prve epizode bo tvegan, saj bo rezultat nič podeljen, če ni pravilen razred, medtem ko bo rezultat, višji od nič, podeljen, če udeleženec izbere več razredov ( celo vse razrede), ki vključujejo pravilen razred. To bo motiviralo udeleženca, da se odzove na podlagi verjetnih razredov v svojih mislih v kateri koli epizodi. Rezultat, dodeljen v vsaki epizodi, se razkrije šele po zaključku T epizod, da se vzdrži kakršnega koli namiga udeležencu. V MTurk je plačilo, ki ga prejme udeleženec za sliko, sorazmerno z njegovim skupnim rezultatom, h.

Filtriranje podatkov.

Če je rezultat udeleženca v zadnji (tj. T-ti) epizodi za sliko dražljaja nič, se njegovi podatki, zabeleženi za to sliko, zavržejo. Podatki se prav tako zavržejo, če udeleženec pusti nalogo nedokončano. S tem izbirnim kriterijem smo pridobili odgovore na 1736 dražljajev iz MNIST, 4431 dražljajev iz EMNIST velikih črk in 4315 dražljajev iz EMNIST malih črk; to je v povprečju 169,1 odgovora na razred.

Modeli in metode za uporabo podatkov

V tem razdelku ponazarjamo uporabnost zbranih podatkov tako, da (4.1) zagotavljamo osnovni model za napovedovanje vedenja udeleženca in (4.2) prikazujemo, kako je mogoče obstoječi model krepitve, ki temelji na pozornosti, primerjati s človeškim prepoznavanjem številk/abecede. izvedba. Osnova za napovedovanje vedenja. Vedenje v kateri koli epizodi t je sestavljeno iz izbire lokacije in izbire razreda. Ker vzorec vsebuje različne količine informacij za različne opazovalce ali celo za istega opazovalca ob različnih časih9, je napovedovanje vedenja vsakega udeleženca težak problem. Naj bo n število razredov v naboru podatkov, ηt bo enojni nabor, ki vsebuje pravi razred za sliko dražljaja pri t, ct bo nabor razredov in lt bo lokacija, ki jo je izbral udeleženec ob t, da bo njegovo opazovanje ob t t in 1:t označuje zaporedje 1, 2, ..., t. Do katerega koli t so opažanja udeleženca o1:t in lokacije, ki jih je izbral, so l1:t. Problem napovedi vedenja udeleženca oblikujemo takole: Napoved razreda Ocenite verjetnost i∈ct (i=1, 2, ..., n) glede na njegova o1:t in l1:t, tj. P( i ∈ ct|o1:t, l1:t). Napoved lokacije Ocenite verjetnost lt+1 glede na njegove o1:t, l1:t in ct, tj. P(lt+1|o1:t, l1:t,ct). Napoved razreda. Za predvidevanje razreda, ki ga bo udeleženec izbral v epizodi t, izračunamo verjetnost, da slikovni dražljaj pri t pripada razredu I glede na izbrane lokacije udeleženca l1:t in ustrezna opazovanja o1:t, kot sledi:

image

kjer je Ii povprečje slik dražljajev (27×25), ki pripadajo razredu i, I′ je slika 27×25, ki vsebuje o1:t pri l1:t, · označuje skalarni produkt in .označuje evklidsko normo. Vse intenzivnosti slikovnih pik so nenegativne. V kateri koli epizodi t sestavlja k najvišjih verjetnih razredov iz porazdelitve prepričanj P(i|o1:t, l1:t) niz razredov, ˆct, ki jih napoveduje naš model, kjer je k=|ct|. Natančnost klasifikacije se meri z Jaccardovim indeksom (JI). JI meri podobnost med dvema nizoma, X in Y, kot: J(X, Y) {{10}} |X ∩ Y|/|X ∪ Y|. JI je omejen med 0 in 1; če je X=Y, J(X, Y)=1. V kateri koli epizodi t je klasifikacijska natančnost udeleženca J(ηt,ct), medtem ko je natančnost našega modela J(ηt, ˆct). Zaradi svojega imenovalca JI bolj kaznuje, ko se poveča število elementov v napovedani množici (ct ali ˆct), ki niso v ηt, kar je zaželena lastnost za naš primer. Podobnost med klasifikacijo udeleženca in klasifikacijo našega modela se meri z J(ct, ˆct). Naš model je ocenjen tudi z vidika izbire razreda in natančnosti zavrnitve glede na vsakega udeleženca. Naj bo st=ct − ct−1 množica novih izbranih razredov in rt=ct−1 − ct množica razredov, ki jih je zavrnil udeleženec pri t. Podobno je ˆst=ˆct − ct−1 množica novih izbranih razredov in ˆrt=ct−1 − ˆct množica razredov, ki jih je naš model zavrnil pri t. Potem lahko izbiro razreda in zavrnitev modela primerjamo z udeleženčevo z J(st, ˆst), ko je |st| > 0 in J(rt, ˆrt), ko |rt| > 0 oziroma. Napoved lokacije. Hipoteza V idealnem primeru bi morala biti porazdelitev prepričanja po vseh razredih unimodalna (tj. samo en vrh) in tanka Gaussova (tj. majhen standardni odklon) oblike, kar kaže, da je udeleženec prepričan o razredu (stanju) dražljaja (okolja). Vendar, kot je razvidno iz naših podatkov (ref. slika 2), je udeleženec pogosto zmeden med več razredi, zlasti v prvih nekaj epizodah. V teh primerih ima njegova porazdelitev prepričanj več vrhov ali pa je debela Gaussova. Predvidevamo, da je cilj udeleženca konvergirati k unimodalnemu in tankemu Gaussu, da bi to dosegel, selektivno vzorči lokacije, ki zmanjšujejo verjetnost vseh razredov razen enega. Ta hipoteza vodi do zmanjšanja negotovosti glede razredov (stanj okolja), kar je dobro znano načelo, ki vodi dejanja24, vključno z gibi oči25.

Figure 2. Duration and class distribution over all participants and stimuli belonging to categories '0', 'a', and 'A'.


Slika 2. Porazdelitev trajanja in razreda po vseh udeležencih in dražljajih, ki pripadajo kategorijam '0', 'a' in 'A'.

Te observations at certain locations in a stimulus image can discriminate between certain classes. Te observation at a location l might indicate that the numeral/alphabet belongs to class I and not to class j. Such locations are more salient than others in achieving a participant's goal. To sample such locations, a saliency map, Dij, is computed such that if l is salient, the observation at l is evidence to increase the probability of class I and decrease that of j. Mathematically, Dij = N (., σ ) ∗ g(.), where ∗ is the convolution operator, g(.) is a saliency scoring function, and N (., σ ) is a 5×5 Gaussian kernel with standard deviation σ = 6 to smooth the saliency scores. We denote the set of all saliency maps as D = {Dij: i, j ∈ {1, 2, ..., n}, i �= j}. A location l in a stimulus image is salient for class i with respect to class j if Dij(l)>θ, kjer je prag θ=0.5 × max(D) empirično določena skalarna količina.

Kot kandidata za funkcijo g obravnavamo dve asimetrični metriki, Kullback-Leiblerjevo (KL) divergenco in razliko. Divergenca KL Glede na dve normalizirani srednji sliki, Ii in Ij, divergenca KL KL(Ii, Ij) meri izgubo informacij, ko se Ij uporabi za približek Ii. To se izračuna za vsako slikovno piko k kot26: KL(Ii,k, Ij,k)=Ii,k log δ + Ii,k Ij,k+δ, kjer je Ij,k intenzivnost k-te slikovne pike od Ij in δ je regularizacijska konstanta. Ko je Ii,k=Ij,k, KL(Ii,k,Ij,k) → 0. Razlika Glede na dve normalizirani srednji sliki, Ii in Ij, je razlika za vsako slikovno piko k Diff (Ii,k, Ij,k)=Ii,k − Ij,k. Ko je Ii,k=Ij,k, Diff (Ii,k, Ij,k)=0. Udeleženec je negotov glede nabora razredov, ct, ki jih je izbral v trenutni epizodi. Zato za napovedovanje lokacije upoštevamo samo tiste zemljevide vidnosti v D, ki vključujejo razrede v ct. Lokacija je predvidena, če je pomembna na podlagi teh zemljevidov opaznosti in je udeleženec nikoli ni izbral. Tako je glede na o1:t, l1:t in ct lokacija lt+1 predvidena takole:

image

kjer je Ŵ nabor 3-tork, ki vsebujejo predvideno lokacijo ˆl, razred, za katerega je pomembna (i), in glede na kateri razred (j). Lokacija je pravilno napovedana, če obstaja �ˆl, i, j� ∈ Ŵ, tako da je �ˆl − lt+1� < ǫ, I ∈ ct+1 in j /∈ ct{{3} }, pri čemer je ǫ največja evklidska razdalja med osrednjo slikovno piko in katero koli slikovno piko v opazovalnem delu. Psevdo koda za predvidevanje lokacije je prikazana v algoritmu 1. Podrobna razlaga psevdo kode je vključena v razdelku S1 dodatnega gradiva. (Verjetnostno porazdelitev, P(lt+1|o1:t, l1:t,ct), je mogoče izračunati tako, da predpostavimo, da je rezultat opaznosti lokacij, ki niso v Ŵ, enak nič, nato pa normaliziramo rezultat opaznosti vseh lokacije za seštevek na enoto. Vendar ta verjetnost ni bila uporabljena, saj enačba (3) zadostuje za namene tega dokumenta.)

image

Vrednotenje modelov, ki temeljijo na pozornosti.

Kot predstavnik modelov, ki temeljijo na pozornosti, obravnavamo zelo citiran model ponavljajoče se pozornosti (RAM)3, ki poroča o eksperimentalnih rezultatih na naboru podatkov MNIST. Ta ojačitveni model zaporedno vzorči sliko in se v vsakem trenutku vzorčenja odloči, kje naj vzorči naprej, zaradi česar je primeren za vrednotenje z uporabo zbranih podatkov.

Oven

razvršča slike z uporabo zaporedja utrinkov. Naslednja lokacija je izbrana stohastično iz porazdelitve, ki jo parametrira lokacijsko omrežje. Model se usposablja od konca do konca z maksimiziranjem naslednjega cilja3:

image


kjer je M število epizod, T je število opazovanj, xi 1:t so interakcijske sekvence, dobljene z izvajanjem trenutnega agenta do I epizod, ui t je trenutno dejanje, θ je niz parametrov, ki jih je mogoče učiti, Ri t je kumulativna nagrada, bt je osnovna vrednost, π(ui t|xi 1:t; θ ) pa je politika. Vedenje RAM-a je mogoče primerjati z obnašanjem udeležencev s primerjavo fiksacijskih zemljevidov, pridobljenih iz zaporedja lokacij, ki jih je predvidel RAM, in tistih, ki so jih izbrali udeleženci. Zemljevid fksacije se izračuna tako, da se vsaki lokaciji dodeli vrednost, ki je enaka pogostosti njene izbire, in nato normalizira te vrednosti, da se ustvari porazdelitev po vseh lokacijah.

Meritve za primerjavo zemljevidov fiksacije. Za metrike, ki primerjajo dve fiksacijski karti, P in Q, natančno sledimo 26. Za primerjavo porazdelitve lokacij vzorčenja uporabljamo tri metrike, ki temeljijo na porazdelitvi: divergenco KL (KL), Pearsonov korelacijski koeficient (CC) in podobnost (SIM). iz modela s tistim od udeležencev, kot je zapisano v zbranih podatkih.

KL (definiran prej) je zelo občutljiv na ničelne vrednosti.

CC lahko ovrednoti linearno razmerje med dvema zemljevidoma kot26: CC(P, Q)=σ (P, Q) σ (P)σ (Q), kjer je σ varianca ali kovarianca. Ker je CC simetričen, ne uspe sklepati, ali so razlike med zemljevidi fiksacije posledica lažno pozitivnih ali lažno negativnih rezultatov.

SIM se meri kot 26: SIM(P, Q)=k min(Pk, Qk), kjer je k Pk=k Qk=1. Tako kot CC je SIM simetrična in podeduje isto pomanjkljivost. Poleg tega je SIM zelo občutljiv na manjkajoče vrednosti in kaznuje napovedi, ki ne upoštevajo gostote resnice na tleh.

Raziskave na ljudeh in živalih.

Institucionalni revizijski odbor na Univerzi v Memphisu je ugotovil, da ta študija ne ustreza definiciji Urada za zaščito raziskav na ljudeh in da 45 CFR del 46 ne velja. Zato ta študija ne zahteva odobritve ali pregleda IRB.

Eksperimentalni rezultati Analiza podatkov.

Zbrane podatke je mogoče vizualizirati v smislu zaporedja porazdelitve izbranih lokacij (slika 3), izbranih razredov (slika 2) in trajanja med zaporednimi epizodami (slika 2). Te porazdelitve so zelo podobne za tri nize podatkov. Za katero koli številko ali abecedo je porazdelitev izbranih lokacij po zadnji epizodi podobna porazdelitvi intenzivnosti slikovnih pik svojega razreda iz nabora podatkov. Vendar je zaporedje izbranih lokacij po naravi stohastično. Porazdelitev po razredih kaže na zmedo med kategorijami s podobnimi strukturami v prvih nekaj epizodah, ko udeleženci izberejo več razredov. Ta zmeda se zmanjša z več vzorčenja. Obstaja pomembna pozitivna korelacija med stopnjo zmede (# izbranih razredov/skupno # razredov) in trajanjem vzorčenja (glej sliko 4). Če je število izbranih razredov veliko (nizko), je trajanje med zaporednimi epizodami veliko (nizko). CC zaporedja lokacij, ki jih je udeleženec izbral za razred, ni pomemben (tabela 1). To je pričakovano zaradi variabilnosti med subjekti pri vzorčenju statičnih slik. Povprečno število vzorčenj, ki jih udeleženec potrebuje za natančno napoved razreda, je precej nizko. V povprečju je potrebnih 4,2, 4,7 in 4,9 vzorcev, ki ustrezajo 36, 44,1 in 48,1 sekundam za natančno razvrstitev slik MNIST, EMNIST z velikimi oziroma malimi črkami. Udeleženci so si v povprečju ogledali le 11,3 %, 13,4 % in 13,7 % površine slike za natančno razvrstitev slike s številkami, velikimi in malimi črkami (glej sliko S2 v dodatnem gradivu). Ti rezultati poudarjajo učinkovitost človeškega sistema vizualnega sklepanja, čeprav pri nižji ločljivosti kot podatki sledenja očem, vendar z manj šuma in spremenljivosti. Ti empirični rezultati so lahko koristni za oblikovanje modelov, ki temeljijo na pozornosti, za aplikacije v resničnem svetu. Napoved vedenja. V tem razdelku je uspešnost našega osnovnega modela ocenjena glede na to, kako natančno lahko napove lokacijo vsakega udeleženca in izbiro razreda. Ker so naši eksperimentalni rezultati z uporabo dveh funkcij točkovanja opaznosti, razhajanja KL in razlike, precej podobni, so rezultati sporočeni samo z uporabo razlike, razen če je navedeno drugače. Napoved razreda. Napoved razreda in metode vrednotenja njegove natančnosti so opisane v razdelku »Napoved razreda«. Natančnost napovedi razreda, prikazana na sliki 5, je izračunana za vse razrede za vsa vzorčenja. Povprečna natančnost napovedi razreda za vse vzorčenje in nabore podatkov je 74,4 % (std. razl. 26,5). Sliki 5a in b prikazujeta, da je niz razredov, ki so jih izbrali udeleženci in naš osnovni model (Eq. 2), v začetnih epizodah precej netočen in se izboljšuje s povečanjem vzorcev. Slika 5c kaže, da sta si med začetnimi epizodami ta dva niza, ct in ˆct, precej različna; podobnost se povečuje z večanjem vzorcev. Enako velja za nove izbire razredov (glej sliko 5f). Vendar so zavrnitve razreda podobne v začetnih epizodah; podobnost se še poveča z več vzorci (glej sliko 5e). Ker je J(st, ˆst)=|(ct ∩ ˆct) − ct−1| |(ct ∪ ˆct) − ct−1| in J(rt, ˆrt)=|ct−1 − (ct ∪ ˆct)| |ct−1 − (ct ∩ ˆct)| je mogoče iz slike 5e, f sklepati, da je v začetnih epizodah presečišče med ct−1 in ct ∪ ˆct majhno, kar kaže, da so na začetku udeleženci in naš osnovni model med zaporednimi epizodami narediti veliko sprememb pri izbiri razreda. Zato je na začetku postopek izbire razreda zelo stohastičen. Medtem ko med začetnimi epizodami obstajajo nekatere razlike med napovedjo razreda udeležencev in našega modela, postanejo vedenja z več vzorci vse bolj podobna. V prvih nekaj (običajno 4 do 7) epizodah se razkrijejo zelo pomembni deli dražljaja. To pomaga izbrati le pravilen razred pri poznejših vzorčenjih, kar poveča natančnost napovedi. Ker obstaja veliko razredov, katerih povprečne predloge se ujemajo z opazovanimi deli dražljaja v prvih nekaj epizodah, je postopek izbire razreda bistveno bolj stohastičen, kar vodi do nizke natančnosti razvrščanja udeležencev in našega modela.

Figure 3. Distribution of sampling locations over all participants for each numeral/alphabet class and each sampling episode. Each row corresponds to a class, each column corresponds to a sampling episode which increases from left to right.


Slika 3. Porazdelitev lokacij vzorčenja po vseh udeležencih za vsak razred številk/abecede in vsako epizodo vzorčenja. Vsaka vrstica ustreza razredu, vsak stolpec ustreza epizodi vzorčenja, ki se povečuje od leve proti desni.

Napoved lokacije. Natančnost napovedi lokacije našega osnovnega modela (Eq. 3), izračunana v povprečju vseh vzorčenj in naborov podatkov, je 67,7 % (std. dev. 14.1) (ref. slika 5d). Trend te natančnosti napovedi je nasproten trendu natančnosti napovedi razreda. Vendar pa razlaga ostaja enaka. Natančnost predvidevanja lokacije je med začetnimi vzorčenji visoka, ker se med temi epizodami izberejo zelo pomembne lokacije, pri čemer ostanejo manj izrazite lokacije izbrane v kasnejših epizodah. Ker obstaja veliko lokacij z nizko opaznostjo, je njihov izbirni postopek zelo stohastičen in zato težko predvidljiv, kar vodi do zmanjšanja natančnosti napovedi s povečanjem vzorčenja. Trend zmanjševanja je edinstven za vsak nabor podatkov (ref. slika 5d), saj se število razredov in število zelo pomembnih lokacij, uporabnih za diskriminacijo, razlikujeta med nabori podatkov. Manjše kot je število razredov in zelo izrazitih diskriminativnih lokacij, hitreje se bo zmanjšala natančnost napovedi lokacije s povečanjem vzorčenja.

imageFigure 4. (Lef) Errorbar plot of time diference (seconds) between consecutive samples averaged over all classes. Tat is, value shown at sampling episode t is the time elapsed between a participant's clicks in image at t − 1 and t. (Right) Errorbar plot of confusion averaged over all classes at each episode. Errorbars indicate std. dev.

Slika 4. (Levo) Vrstica napak časovne razlike (sekunde) med zaporednimi vzorci v povprečju vseh razredov. To pomeni, da je vrednost, prikazana v epizodi vzorčenja t, čas, ki je pretekel med udeleženčevimi kliki slike pri t − 1 in t. (Desno) Vrstica napak povprečje zmede za vse razrede v vsaki epizodi. Vrstice napak označujejo std. dev.

Figure 5. Evaluation of our baseline model (ref.

Slika 5. Ocena našega osnovnega modela (glej razdelek »Izhodišče za napovedovanje vedenja«). (a) Klasifikacijska natančnost (po) udeležencev in (b) točnost našega osnovnega modela z dejanskimi oznakami kot osnovno resnico. (c) Klasifikacijska podobnost (J(ct, ˆct)), (d) natančnost napovedi lokacije, (e) natančnost zavrnitve razreda in (f) natančnost izbire razreda našega osnovnega modela s podatki udeležencev kot osnovno resnico. Za podrobnosti glejte razdelek »Napoved vedenja«.

Table 1. Average Pearson correlation coefficient (corr.) for fxation sequences for the same class. For any fixation, distance is Euclidean and direction is measured as the polar angle with respect to the center of stimuli as the origin. Std. dev. are included in parenthesis.


Tabela 1. Povprečni Pearsonov korelacijski koeficient (kor.) za fiksacijske sekvence za isti razred. Za vsako fiksacijo je razdalja evklidska, smer pa se meri kot polarni kot glede na središče dražljajev kot izvor. Std. dev. so vključeni v oklepaju.

Ocena RAM-a.

Za vsak razred in vzorčenje se primerjajo zemljevidi fiksacije iz RAM-a (uporabili smo implementacijo RAM-a iz github.com/hehefan/Recurrent-Attention-Model) in zbrani podatki za iste dražljaje, predstavljene v MTurk. Za pošteno primerjavo z udeleženci smo v RAM-u fiksirali dolžino zaporedja na T=12, prvo lokacijo vzorčenja v središču slike, vhodno opazovanje na zaplato 5×5 z izbrano lokacijo kot središčem in spremenil funkcijo nagrajevanja z enačbo. (1). Kumulativna nagrada, Rt v enačbi (4,) se nadomesti s kumulativnim rezultatom t τ=1 Pτ, dobljenim iz enačbe. (1). Ker lahko udeleženec izbere več razredov v kateri koli epizodi, za model RAM namesto napovedi posameznega razreda na podlagi največje verjetnosti upoštevamo srednjo verjetnost za vse razrede kot prag in napovemo nabor razredov ct z verjetnostmi, večjimi od prag. Ta ct se uporablja za izračun rezultata z enačbo. (1). Pod temi pogoji zahteva RAM 3,7, 8,5 in 7,6 vzorcev za prepoznavanje številk MNIST, velikih in malih črk EMNIST abecede, ki ustrezajo 8,9 %, 21.0%, 18,7 % površine slike. Tako je RAM v primerjavi z našimi udeleženci (glej razdelek »Analiza podatkov«) manj učinkovit. Glej tabelo 2. Rezultati primerjave fiksacijskih zemljevidov iz RAM-a in zbranih podatkov so prikazani v tabeli 3. KL je višji zaradi svoje občutljivosti na ničelne vrednosti. To pomeni, da udeleženci vzorčijo več lokacij, ne pa RAM. Te poskuse je mogoče uporabiti kot osnovo za ocenjevanje lokacij, vzorčenih z modelom pozornosti.

cistanche-Improve memory2

prednosti cistanche - izboljšanje spomina

Razprave

Paradigma mcAT, kot je uporabljena v tem dokumentu, ima določene točke razlike od tistih, ki se za preučevanje mehanizmov prepoznavanja predmetov primarno zanašajo na gibe oči in poglede. Pri slednjem pozornost najprej pritegnejo izstopajoči deli prizora, ki jim sledijo sakadični gibi oči, ki usmerjajo pogled na izstopajoče lokacije27. Pogled poganjajo signali od spodaj navzgor in od zgoraj navzdol, ki skupaj z informacijami o pomembnosti tvorijo prednostne zemljevide, ki usmerjajo gibanje oči za prepoznavanje predmeta. Ker so udeleženci v tej študiji gledali statične slike v pogojih prostega gledanja in z dovolj časa (šest minut za vzorčenje T=12), so se za raziskovanje verjetno vključili v vrsto sakadičnih gibov oči ali vizualnega sklepanja28 sliko, preden kliknete na AOI. Te gibe oči bi lahko zajeli v emAT (z uporabo sledilnika oči), ne pa v mcAT. Vendar pa na te gibe oči vpliva tavanje misli. Medtem ko na mcAT vpliva tudi tavanje misli29, se lahko učinek zmanjša vsakič, ko se udeleženci odzovejo po vizualnem razmišljanju. Ker na premike oči kot odziv na dražljaj vpliva obravnavana naloga30, je na vzorce gibanja oči udeležencev verjetno vplivala dodeljena naloga v treh korakih pri vsakem vzorčenju (glej razdelek »Vizualna naloga«). Če bi uporabili sledilnik oči, bi se gibi oči udeležencev za raziskovanje vzorca pomešali z gibi oči za klikanje njihovih izbranih razredov, kar bi zapletlo interpretacijo vizualnega raziskovanja vzorca. Klik na razred(-e) je nujen korak, saj razkrije, čeprav introspektivno, predvideni razred(-e) v mislih udeleženca. Verjetno so pogledi tik pred in po izbiri AOI – morda tudi s pomočjo fiksacijskih gibov oči31-največ prispevali k prepoznavanju številk/abecede. Dejansko domnevamo, da so udeleženci izbrali diagnostična področja slike, da bi razlikovali med razredi, in ta področja verjetno vsebujejo mešanico diagnostičnih informacij od spodaj navzgor (npr. vizualni kontrast) in od zgoraj navzdol (številka/abecedna predloga). To je skladno z našo ugotovitvijo, da so udeleženci hitro (povprečno znotraj 5 vzorcev) razlikovali med razredi dražljajev, navidezno z izbiro diagnostičnih obližev.

Table 2. Comparison of efficiency between our participants and the RAM model in terms of the average number of samples required to recognize a numeral/alphabet. The percentage of the image area observed is included in parentheses.

Tabela 2. Primerjava učinkovitosti med našimi udeleženci in modelom RAM glede na povprečno število vzorcev, potrebnih za prepoznavanje številke/abecede. Odstotek opazovane površine slike je vključen v oklepajih.

Table 3. Evaluation of fixation maps from RAM for the stimuli presented in the MTurk experiments averaged over all classes and samplings. Std. dev. are included in parenthesis.


Tabela 3. Vrednotenje zemljevidov fiksacije iz RAM-a za dražljaje, predstavljene v poskusih MTurk, povprečno v vseh razredih in vzorčenjih. Std. dev. so vključeni v oklepaju.

Sklepi

Predstavili smo nabor podatkov mcAT za prepoznavanje ročno napisanih številk in abeced prek zaporednega vzorčenja. Podatki so zbrani od 382 udeležencev, predstavljenih s slikami, izbranimi iz primerjalnih nizov podatkov (MNIST, EMNIST). V povprečju je zabeleženih 169,1 odgovorov na razred številk/abecede. Podatki so natančno analizirani, da bi razkrili učinkovitost človeškega vizualnega prepoznavanja. Udeleženci so za prepoznavanje opazili le 12,8 % slike. Predlagali smo osnovni model za napovedovanje lokacije in razreda, ki bi jih udeleženec izbral pri naslednjem vzorčenju. Pokazali smo, kako se lahko naši eksperimentalni pogoji in podatki uporabijo za ovrednotenje modela okrepitve, ki temelji na pozornosti, v primerjavi s človeško zmogljivostjo. Ta nabor podatkov mcAT s številnimi prednostmi v primerjavi s podatki sledenja očem zapolnjuje ključno vrzel v raziskavah modelov, ki temeljijo na pozornosti, v AI, ML in drugih področjih.

Reference

1. Ranzato, MA O učenju, kje iskati. arXiv:1405.5488, (2014).

2. Ba, J., Salakhutdinov, RR, Grosse, RB, & Frey, BJ. Učenje modelov ponavljajoče se pozornosti med budnostjo in spanjem. V NIPS, 2593–2601 (2015).

3. Mnih, V. et al. Ponavljajoči se modeli vizualne pozornosti. V NIPS, 2204–2212 (2014).

4. Ba, J., Mnih, V. in Kavukcuoglu, K. Prepoznavanje več objektov z vizualno pozornostjo. arXiv:1412.7755 (2014).

5. Dutta, JK & Banerjee, B. Različice v natančnosti klasifikacije s številom utrinkov. V IJCNN, 447–453 (IEEE, 2017).

6. Larochelle, H. & Hinton, GE Učenje kombiniranja fovealnih utrinkov z Boltzmannovo napravo tretjega reda. V NIPS, 1243–1251 (2010).

7. Elsayed, G., Kornblith, S. & Le, QV Saccader: Izboljšanje natančnosti modelov trde pozornosti za vid. V NIPS, 702–714 (2019).

8. van Beers, RJ Viri variabilnosti sakadičnih gibov oči. J. Neurosci. 27(33), 8757–8770 (2007).

9. Itti, L. & Baldi, P. Bayesovo presenečenje pritegne človeško pozornost. Vis. Res. 49 (10), 1295–1306 (2009).

10. Egner, S. et al. Pozornost in pridobivanje informacij: Primerjava klika miške s sledenjem pozornosti gibanja oči. J. Eye Mov. Res. 11 (6), (2018).

11. Peterson, MS, Kramer, AF & Irwin, DE Prikriti premiki pozornosti so pred nehotenimi gibi oči. Percept. Psychophys. 66(3), 398–405 (2004).

12. Jiang, M. et al. Silicij: opaznost v kontekstu. V CVPR, 1072–1080 (2015).

13. Kim, NW et al. BubbleView: vmesnik za zbiranje zemljevidov pomembnosti slik in sledenje vizualne pozornosti. ACM Trans. Računalništvo. Hum. Interakcija. 24(5), 1–40 (2017).

14. Sermanet, P., Frome, A. & Real, E. Pozor za natančno kategorizacijo. arXiv:1412.7054 (2014).

15. Egner, S., Itti, L. in Scheier, C. Primerjava modelov pozornosti z različnimi vrstami vedenjskih podatkov. Raziskati. Ophthalmol. Vis. Sci. 41(4), S39 (2000).

16. Navalpakkam, V. et al. Merjenje in modeliranje vedenja oko-miška v prisotnosti nelinearnih postavitev strani. V Proc. Int. konf. WWW, 953–964 (2013).

17. Matzen, LE, Stites, MC & Gastelum, ZN Preučevanje vizualnega iskanja brez sledilnika oči: ocena umetne foveacije. Cogn. Res. Princ. Implicitno. 6(1), 1–22 (2021).

18. Tafi, AP et al. OCR kot storitev: Eksperimentalna ocena Google Docs OCR, Tesseract, ABBYY FineReader in Transym. V Int. Symp. Vis. Računalništvo, 735–746 (Springer, 2016).

19. Memon, J., Sami, M., Khan, RA & Uddin, M. Ročno optično prepoznavanje znakov (OCR): celovit sistematični pregled literature (SLR). IEEE Access 8, 142642–142668 (2020).

20. Chaudhuri, A., Mandaviya, K., Badelia, P. & Ghosh, SK Optični sistemi za prepoznavanje znakov. V optičnih sistemih za prepoznavanje znakov za različne jezike s Sof Computing, 9–41 (Springer, 2017).

21. LeCun, Y. et al. Gradientno učenje, uporabljeno za prepoznavanje dokumentov. Proc. IEEE 86(11), 2278–2324 (1998).

22. Cohen, G., Afshar, S., Tapson, J. & van Schaik, A. EMNIST: Razširitev MNIST na ročno napisana pisma. arXiv:1702.05373, (2017).

23. Gregor, K., Danihelka, I., Graves, A., Rezende, D. & Wierstra, D. DRAW: ponavljajoča se nevronska mreža za generiranje slik. V ICML, 1462–1471 (2015).

24. Friston, K. Načelo proste energije: Grob vodnik do možganov?. Trends Cogn. Sci. 13(7), 293–301 (2009).

25. Mirza, MB, Adams, RA, Friston, K. & Parr, T. Predstavitev Bayesovega modela selektivne pozornosti, ki temelji na aktivnem sklepanju. Sci. Rep. 9 (1), 1–22 (2019).

26. Bylinskii, Z., Judd, T., Oliva, A., Torralba, A. & Durand, F. Kaj nam različne metrike vrednotenja povedo o modelih opaznosti? IEEE Trans. Analni vzorec. Mach. Intell. 41 (3), 740–757 (2018).

27. Itti, L. & Koch, C. Računalniško modeliranje vizualne pozornosti. Nat. Rev. Neurosci. 2(3), 194–203 (2001).

28. Lamme, VAF Vidne funkcije, ki ustvarjajo zavestno videnje. Spredaj. Psihol., 11, (2020).

29. da Silva, MRD & Postma, M. Tavajoči umi, tavajoče miši: Sledenje računalniške miške kot metoda za odkrivanje tavajočih misli. Računalništvo. Hum. Obnašaj se. 112, 106453 (2020).

30. Schütz, AC, Braun, DI & Gegenfurtner, KR Gibanje oči in zaznavanje: selektivni pregled. J. Vis. 11(5), 9–9 (2011).

31. Intoy, J. & Rucci, M. Fino uglašeni gibi oči povečajo ostrino vida. Nat. Komun. 11(1), 1–11 (2020).

Morda vam bo všeč tudi