Razložljivo avtomatizirano prepoznavanje čustvenih stanj iz izrazov pasjega obraza: primer pozitivnega pričakovanja in frustracije

Aug 11, 2023

Uporaba optimizatorja Adam s hitrostjo učenja {{0}}.0001. Za najboljši model je bil izbran model, ki dosega največjo natančnost na validacijskem nizu podatkov. V prvih 10 obdobjih so bile uteži vseh plasti natančno naravnane. V prvih 10 obdobjih je bila teža vseh plasti natančno prilagojena. V preostalih obdobjih so bile uteži ResNet50 zamrznjene in posodobljene le uteži novih zgornjih plasti. Za spremenljivke, ki niso povezane z orientacijo ('Ears Flattener', 'Lips Part', 'Ears Adductor', 'Ears Forward' in 'Nose Lick') smo uporabili tehniko povečanja, ki temelji na naključnem vodoravnem fipu slike in rotaciji do 20 stopinj. Kot vhod za kodirnik smo uporabili vhodno tabelo, kjer vsaka vrstica predstavlja prisotnost (1)/odsotnost (0) vsake od 11 spremenljivk DogFACS na vsakem videu. Cilj kodirnika je tabela, ki vsebuje stanje (negativno (0)/pozitivno (1)) vsakega videa.

ResNet50 je arhitektura globoke nevronske mreže, ki je postala eno izmed klasičnih omrežij na področju računalniškega vida. Za omrežje ResNet50 je značilen zelo močan spomin in sposobnost pomnjenja predhodno naučenega znanja med treningom, zaradi česar se dobro obnese pri kompleksnih nalogah prepoznavanja slik.

Kako ResNet50 doseže spomin? Sprejema metodo preostale povezave in doda povezavo bližnjic med plastmi v vsaki konvolucijski plasti, kar lahko izboljša pretok informacij v omrežju. Med postopkom usposabljanja se lahko zaradi obstoja teh bližnjičnih povezav omrežje lažje nauči preostalih preslikav in ni treba porabiti preveč časa za iskanje teh preostalih preslikav.

Zaradi te vrste zmogljivosti pomnilnika ResNet50 dobro deluje pri obsežnih nalogah prepoznavanja slik. ResNet50 je pri težavah, kot so klasifikacija slik, zaznavanje ciljev in prepoznavanje obrazov, dosegel zelo dobre rezultate. Ta zmogljivost spomina je podobna našim možganom, ki prav tako povezujejo nevrone za izboljšanje spomina. Tako lahko rečemo, da je ResNet50 zelo dober model globoke nevronske mreže, ki ima močan spomin in lahko dobro obvlada kompleksne naloge prepoznavanja slik. Hkrati pa nam daje tudi nekaj navdiha. Iz idej ResNet50 se lahko naučimo oblikovati učinkovitejši model globoke nevronske mreže, ki bo bolje služil potrebam ljudi. Vidi se, da moramo izboljšati spomin. Cistanche lahko izboljša spomin, ker je cistanche tradicionalno kitajsko zdravilno sredstvo s številnimi edinstvenimi učinki, med katerimi je tudi izboljšanje spomina. Učinkovitost mletega mesa izhaja iz različnih učinkovin, ki jih vsebuje, vključno s karboksilno kislino, polisaharidi, flavonoidi itd. Te sestavine lahko spodbujajo zdravje možganov prek različnih kanalov.

increase memory

Kliknite načine za izboljšanje delovanja možganov

V raziskavah na živalih je avtomatizacija prepoznavanja afektivnega stanja doslej v glavnem obravnavala bolečino pri nekaj vrstah. Čustvena stanja ostajajo neraziskana območja, zlasti pri psih, zaradi kompleksnosti njihove obrazne morfologije in izrazov. Ta študija prispeva k zapolnitvi vrzeli z dveh vidikov. Prvič, je prvi, ki obravnava čustvena stanja psov z uporabo nabora podatkov, pridobljenih v nadzorovanem eksperimentalnem okolju, vključno z videoposnetki (n=29) labradorcev, za katere se domneva, da so v dveh eksperimentalno povzročenih čustvenih stanjih: negativnem (frustracija) in pozitivnem (pričakovanje). Obrazne izraze psov so izmerili s sistemom kodiranja obraznih dejanj psov (DogFACS).

Primerjamo dva različna pristopa: (1) pristop, ki temelji na DogFACS, z dvostopenjskim cevovodom, ki ga sestavljata (i) detektor spremenljivk DogFACS in (ii) klasifikator drevesa odločanja o pozitivnem/negativnem stanju; (2) Pristop, ki uporablja tehnike globokega učenja brez vmesne predstavitve. Pristopa dosežeta natančnost nad 71 % oziroma 89 %, pri čemer je pristop globokega učenja boljši. Drugič, ta študija je tudi prva, ki preučuje razložljivost modelov AI v kontekstu čustev pri živalih. Pristop, ki temelji na DogFACS, zagotavlja drevesa odločitev, ki so matematična predstavitev, ki odraža predhodne ugotovitve človeških strokovnjakov o nekaterih obraznih izrazih (spremenljivke DogFACS), ki so korelati specifičnih čustvenih stanj. Pristop globokega učenja ponuja drugačno, vizualno obliko razložljivosti v obliki toplotnih zemljevidov, ki odražajo področja, na katerih je usmerjena pozornost omrežja, ki v nekaterih primerih kažejo fokus, povezan z naravo določenih spremenljivk DogFACS. Ti toplotni zemljevidi so morda ključ do novih spoznanj o občutljivosti omrežja na niansirane vzorce slikovnih pik, ki odražajo informacije, nevidne človeškemu očesu.

Charles Darwin je v svojem temeljnem delu 'Izražanje čustev pri človeku in živalih'1 slavno opisal uporabo obrazne mimike kot prikaza čustvenih stanj pri ljudeh in različnih nečloveških vrstah (v nadaljevanju živali). Dandanes je splošno priznano, da je obrazna mimika pomemben vir informacij za prepoznavanje čustvenih stanj. Pri ljudeh obrazna mimika služi kot primarno neverbalno sredstvo za uravnavanje interakcij2, povezava med obrazno mimiko in čustvenimi stanji pa je že dolgo ugotovljena s sistematičnimi študijami v psihologiji3,4. Pri živalih obrazno mimiko ustvari večina vrst sesalcev5 in tako kot pri ljudeh se domneva, da posredujejo informacije o čustvenih stanjih6,7. Zato se izrazi obraza vedno bolj proučujejo kot možni indikatorji subjektivnih stanj v raziskavah čustev in dobrega počutja živali.

Zlati standard za objektivno ocenjevanje sprememb obrazne mimike pri raziskavah človeških čustev je Facial Action Coding System – FACS8,9. FACS je bil nedavno prilagojen za različne nečloveške vrste, vključno z več primati (npr. orangutani10, šimpanzi11, makaki12,13), marmozetkami14, psi15 in mačkami16. Ti sistemi, imenovani AnimalFACS, se tako kot pri ljudeh vse bolj uporabljajo za preučevanje čustvenih stanj živali (npr. 17–19).

Velik izziv pri prepoznavanju standardiziranih obraznih izrazov pri psih se nanaša na morfološko raznolikost njihovih glav 20, 21 in prekrivnih dermalnih struktur, kot je vključitev trajnih gub pri nekaterih pasmah. Za prepoznavanje čustvenih obraznih izrazov pri psih so Caeiro et al.18 uporabili DogFACS za oceno spontanega odziva posameznikov različnih pasem in mešanic v naturalističnih čustvenih okoljih z uporabo spletnih videoposnetkov. Raziskana so bila tako pozitivna kot negativna čustva, vključno s pričakovanjem nagrade (pozitivno valentno čustvo) in frustracijo (negativno valentno čustvo), za obe pa je značilno pričakovanje želenega dražljaja16. Pozitivno pričakovanje je bilo opredeljeno kot sproženo v situacijah, ki vključujejo "[v]vizualizacijo hrane ali sluh obroka/besede, povezane s hrano; [v]vizualizacijo povodca, slišanje besed, povezanih s hojo", frustracija pa je bila opredeljena kot povzročena z "[v]izualizacijo želenega vira (igrače, hrane, prostora), ki je ali postane nedostopen"18. Medtem ko so Caeiro et al.18 ugotovili, da so psi kazali bistveno drugačne obrazne izraze pri razlikovanju določenih čustvenih stanj, v kontekstu frustracije ni bilo ugotovljenih nobenih značilnih značilnosti. V skladu s tem so Bremhorst et al.22 raziskovali pasje obrazne izraze pozitivnega pričakovanja in frustracije v nadzorovanem eksperimentalnem okolju, za razliko od Caeira et al.18, ki je standardiziral tudi pasmo psov (labradorec retriever). Poleg tega so avtorji uporabili nesocialni kontekst, da bi odpravili tveganje motenj zaradi predhodno naučenih odzivov, ki pritegnejo pozornost. Za eksperimentalno izvabljanje obeh proučevanih čustvenih stanj je bila kot sprožilni dražljaj v dveh pogojih uporabljena hrana visoke vrednosti: pozitivno stanje je bilo predvideno, da bo spodbudilo pozitivno pričakovanje (s pogojenim pričakovanjem hrane), negativno stanje pa naj bi povzročilo frustracijo (tj. preprečitev dostopa do pričakovane nagrade za hrano). Obrazne mimike psov v teh dveh stanjih so izmerili z DogFACS. Avtorji so ugotovili, da je bila spremenljivka "Ears Adductor" pogostejša v pozitivnem stanju, medtem ko so bile spremenljivke "Blink", "Lips Del", "Jaw Drop", "Nose Lick" in "Ears Flattener" pogostejše v negativnem stanju. stanje22. V nadaljnji študiji so Bremhorst et al.19 testirali novo skupino psov s podobno nastavitvijo. Vendar pa sta bili v tej študiji uporabljeni dve različni vrsti nagrad (hrana in igrače), da bi preizkusili posplošljivost svojih prejšnjih ugotovitev na širši spekter kontekstov19.

Prejšnji rezultati so bili ponovljeni19, s štirimi nadaljnjimi spremenljivkami, ki so bolj pogoste v negativnem stanju: "ušesa obrnjena navzdol", "povleka ustnic", "pokazovanje jezika" in "dvig zgornje ustnice". Vsi prepoznani obrazni izrazi, razen "dviga zgornje ustnice", so bili neodvisni od vrste nagrade, ki so jo psi pričakovali prejeti19. Poleg tega so bile ovrednotene osnovne mere diagnostične natančnosti za identificirane izraze obraza kot možne kazalce čustev, vključno z njihovo občutljivostjo, specifičnostjo ter pozitivnimi in negativnimi napovednimi vrednostmi19. Rezultati so pokazali, da nobeden od teh obraznih izrazov ne bi zagotovil dosledne pravilne klasifikacije povezanih čustev, če bi se uporabljal samostojno kot individualni indikator čustev19. To ne zmanjša njihove potencialne vrednosti kot signalov, ampak morda poudarja normalno celostno obdelavo obraznih konfiguracij23, namesto osredotočenosti na posamezne elemente v njej.

Prisotnost občinstva v čustvenem kontekstu je pomemben element, ki ga je treba upoštevati pri raziskovanju obraznih izrazov (čustev) pri psih, kot je pokazala nedavna študija Pedrettija et al.24. Podobno kot19,22 so avtorji pse izpostavili tudi pozitivnemu pričakovanju ter nesocialnim in nesocialnim frustracijam, kar je povzročilo testne seje. Uporabili so tudi DogFACS za analizo obraznih izrazov psov v teh situacijah, poleg drugih vedenj, kot je mahanje z repom, in merjenje koncentracije kortizola v slini pred in po testu. Ugotovili so, da se "ušesa naprej" bolj pojavljajo v pozitivnih pogojih kot v negativnih. Poleg tega je na to spremenljivko pozitivno vplivala prisotnost občinstva in je bila v negativni korelaciji s koncentracijami kortizola pred testom, kar kaže, da je lahko dober pokazatelj stopnje pozornosti psov. "Ploščanje ušes", "Mežikanje", "Oblizovanje nosu", "Mahanje z repom" in "Jinčenje" (slednji dve nista vključeni v spremenljivke DogFACS) so bili prav tako povezani s prisotnostjo občinstva, vendar niso bili povezani s koncentracijo kortizola, kar kaže na komunikacijska komponenta teh vedenj.

improve your memory

To kaže, da lahko DogFACS služi tudi za raziskovanje obraznih izrazov psov, ne samo kot znaki (tj. ustvarjanje sprememb v vedenju, ki spremljajo čustvena stanja), temveč tudi kot signali (tj. vedenja, ki so posebej ustvarjena za sporočanje čustev komunikacijskemu partnerju), glejte tudi 25. Sistemi AnimalFACS zato zagotavljajo pomembno sredstvo za spodbujanje razumevanja obraznih izrazov živali. Vendar pa ima uporaba teh sistemov za analizo obraznih izrazov svoje izzive, vključno z odvisnostjo od ročnega označevanja, ki zahteva obsežno človeško usposabljanje in certificiranje, kar je lahko zamudno za izvedbo in je lahko nagnjeno k človeški napaki ali pristranskosti26.

Avtomatizacija lahko zagotovi pomemben dopolnilni napredek k temu procesu. Predvsem se trdi, da imajo avtomatizirana orodja večjo objektivnost in zanesljivost kot ročno kodiranje, odpravljajo subjektivnost in pristranskost 27, 28, vendar tudi niso odvisni od zaznavanja ene same funkcije za njihov uspeh. Zato ni presenetljivo, da je avtomatizirano kodiranje obraznih izrazov živahno področje raziskovanja človeških čustev, saj so na voljo številna komercialna programska orodja, kot je Noldus29 FaceReader, Afdex30, EmoVu31, pa tudi obsežne baze podatkov, kot je CAS(ME)332.

Pri živalih je po drugi strani avtomatizacija analize obrazne mimike premalo raziskana. To je posledica številnih izzivov (kot je razloženo v 33, 34), vključno s prvo relativno nedavno rastjo ali zanimanjem za raziskave čustev živali, kar pomeni, da je na voljo veliko manj podatkov v primerjavi z ogromnimi količinami podatkov na področju človeka. Drugič, zlasti pri udomačenih vrstah, velike razlike v morfologiji obraza predstavljajo tehnične izzive35. Nazadnje, zaradi pomanjkanja verbalnega samoporočila je težko ugotoviti temeljno resnico o čustvenem stanju, ki ga doživljajo živali, medtem ko je pri ljudeh samoporočanje standardni pristop za ta namen. Protokoli zbiranja podatkov za živali tako zahtevajo obsežen nadzor in regulacijo, operativne definicije proučevanih čustvenih stanj (glej npr. 18) ali morebitno ocenjevanje s strani strokovnjakov za ljudi – čeprav to lahko povzroči pristranskost in subjektivno presojo.

Broomé et al.36 so zagotovili obsežen pregled dvajsetih študij, ki predstavljajo najsodobnejše pristope k avtomatiziranemu prepoznavanju čustev in bolečine pri živalih. Večina teh del se osredotoča na pojav bolečine. Vrste, ki so bile obravnavane v tem kontekstu, vključujejo glodavce37–39, ovce40, konje33,41,42 in mačke43. Vsa ta dela zagotavljajo binarni klasifikator za bolečino/brez bolečine z uporabo tehnik strojnega učenja.

Delo na širši avtomatizaciji prepoznavanja čustev živali je veliko bolj malo. Dve študiji na primatih razen človeka se osredotočata na povezano akcijsko enoto/prepoznavanje obraznih izrazov, ne da bi izrecno obravnavali čustvena stanja44,45. Blumrosen in sod.44 so avtomatizirali prepoznavanje štirih obraznih izrazov primatov razen človeka: nevtralnega, cmokanja z ustnicami, žvečenja in naključnega odpiranja ust z minimalnimi napori pri zapisovanju, medtem ko so Morozov in sod.45 uvedli prototipni sistem za samodejno kodiranje MaqFACS za Rhesus makake. , usposobljen za razvrščanje šestih spremenljivk MacFACS.

V Broomé et al.36 so bila raziskana samo tri dela, ki zagotavljajo razvrstitev od konca do konca za različna čustvena stanja. Corujo et al.46 so opredelili štiri čustvena stanja za konje: "vznemirjen", "razdražen", "radoveden" in "sproščen", pri čemer so vsakega od njih opredelili glede na vedenje oči, ušes, nosu in vratu. Na primer, "sproščeno" je bilo opredeljeno kot oči: delno do večinoma zaprte, ušesa: sproščena, odprtina obrnjena vstran, nos: sproščena usta in vrat: približno vzporedna. Model konvolucijske nevronske mreže (CNN) je bil usposobljen za napovedovanje teh štirih "razredov" čustev. Ferres et al.47 so uporabili avtomatizirano oceno položaja z uporabo DeepLabCut48 za razvrstitev štirih razredov čustev "jeza", "strah", "sreča" in "sproščenost" za pse. Franzoni et al.49 so prav tako uporabili model CNN za razvrščanje omejenih atributov, povezanih s čustvenimi stanji: "nasmeh" (povezan z "veseljem"), "renčanje" (povezan z "jezo") in "spanje" (povezan z nevtralnim država).

Od treh del, povezanih s psi47,49,50, sta se dve osredotočali na telo za prepoznavanje čustvenih stanj47 in bolečine50, eno pa na obrazno izražanje čustev49. Vendar pa so nabori podatkov, uporabljeni v študijah Ferresa et al.47 in Franzonija et al.49, vsebovali slike, zbrane iz interneta in opombe s strani nestrokovnjakov, zato so bili potencialno nizke zanesljivosti in veljavnosti. Delo Zhu50 preučuje prepoznavanje bolečine na podlagi govorice telesa in ne obrazne mimike.

Tukaj predstavljena študija je prva, ki raziskuje avtomatizirano prepoznavanje pasjih čustev iz obrazne mimike z uporabo nabora podatkov, zbranih iz skrbno zasnovanega eksperimentalnega protokola, kjer kontekst brani čustvena stanja22. V tem protokolu sta bila čustvena stanja pozitivnega pričakovanja (pozitivno čustvo) in frustracije (negativno čustvo) operativno definirana (v skladu z 18 in eksperimentalno inducirana v vzorcu 29 preiskovancev labradorcev, kar je zmanjšalo variabilnost morfoloških razlik med psi. obrazne izraze, ki so jih izdelali psi, so objektivno kodirali s standardiziranim sistemom DogFACS certificirani kodirniki DogFACS. Ta nabor podatkov ustvarja edinstveno eksperimentalno okolje za raziskovanje različnih pristopov k avtomatizaciji prepoznavanja čustev z minimalno pristranskostjo pri definiciji čustev. Podatki dodatno izkoriščajo zmanjšana morfološka variacija obrazov udeležencev zaradi standardizacije pasme.

Glede na to36 obstajata dve standardni poti za klasifikacijo čustvenega ali bolečinskega stanja: uporaba ročno izdelanih lastnosti ali uporaba paradigme globokega učenja, ki temelji na naučenih značilnostih51. Ročno izdelane funkcije lahko v grobem razdelimo na funkcije nizke ravni, ki temeljijo na statističnih podatkih slike (kot so histogrami usmerjenih prelivov), ki se običajno uporabljajo v literaturi o računalniškem vidu51, in funkcije visoke ravni, ki so semantično utemeljene v vrsti- posebna anatomska struktura obraza in/ali telesa, luske grimase, akcijske enote itd. Primeri slednjih so obrazne točke mačke52, ključne točke telesa psa47 ali akcijske enote bolečine ovce40. Te funkcije spodbujajo razložljivost algoritmov strojnega učenja z utemeljitvijo odločitev modela na vedenjskih konceptih. Po drugi strani pa je pristop globokega učenja bolj prilagodljiv in se pričakuje, da bo deloval bolje (še posebej, če so na voljo veliki nabori podatkov), vendar zahteva drage računalniške vire in je "črna škatla" v smislu, da ni primeren za razlago v človeku razumljivih izrazih, zakaj je sprejeta določena odločitev o razvrstitvi.

V tej študiji raziskujemo obe alternativni poti do avtomatizirane klasifikacije čustvenih stanj pri psih. Prva pot uporablja spremenljivke DogFACS kot razložljive funkcije na visoki ravni. Cev za razvrščanje ima v tem primeru dve stopnji: prvič, avtomatizirano prepoznavanje kod DogFACS in drugič, uporaba opomb za razvrščanje proučevanih čustev. Prikazujemo uporabnost takšne razložljive predstavitve za razumevanje, kako se spremenljivke DogFACS uporabljajo pri odločanju stroja. Druga pot uporablja (preprostejši, enostopenjski) pristop globokega učenja, ki omogoča stroju, da se uči neposredno iz podatkovnih funkcij, ki niso nujno razumljive človeku. Nadalje primerjamo vidike razložljivosti med obema pristopoma in uporabljamo tehnike vizualizacije toplotnega zemljevida, da poudarimo odnos naučenih lastnosti do pomenskih objektov, povezanih z obraznimi deli psa.

Rezultati

Nabor podatkov.

Uporabili smo nabor podatkov in opombe DogFACS, ki so jih ustvarili kot del prejšnje študije Bremhorst et al.22. Da bi zmanjšali učinke morfoloških variacij, je bilo testiranih 29 subjektov ene pasme brez izrazitih obraznih potez (labradorski prinašalec) (19 samic – 13 kastriranih, 10 samcev – 9 kastriranih; starostni razpon: 2–9,5 let, povprečna starost {{9} }.22 let). Slika 1 prikazuje porazdelitev starosti in spola subjekta.

Nabor podatkov je vključeval skupno 248 video vzorcev dolžine 3 s, posnetih s hitrostjo sličic 25,25 sličic/s, pri čemer je bila ločljivost vsake sličice 1920 × 1080 slikovnih pik. Za snemanje je bila uporabljena kamera HIKVision, IR Mini Bullet Network Camera; snemalnik: HIKVision, serija DS-7600. Subjekti so bili nameščeni za prozornim oknom z uporabo protokola, ki je v celoti opisan v Bremhorst et al.22. Vsak subjekt je bil testiran 3-krat v pozitivnem in 6-krat v negativnem stanju. Na splošno sta bili dve tretjini videoposnetkov označeni kot negativni, ena tretjina pa kot pozitivni. V tej študiji se domneva, da negativno stanje povzroča frustracijo, pozitivno stanje pa pozitivno pričakovanje, zato odslej uporabljamo pozitivno/negativno valenco za označevanje obeh čustvenih stanj. Slika 2 prikazuje izrezke obrazov psov, pridobljene iz nabora podatkov.

boost memory

Nabor podatkov je bil uravnotežen z naključnim premajhnim vzorčenjem, pri čemer je ostalo 82 videoposnetkov pozitivnih stanj in 82 videoposnetkov negativnih stanj (n = 29) posameznikov, skupno 164 videoposnetkov. Uravnoteženje je bilo izvedeno ob ohranjanju enakega števila pozitivnih in negativnih vzorcev na posameznika.

Vsi video vzorci so bili kodirani z uporabo 39 spremenljivk DogFACS, ki temeljijo na priročniku DogFACS53 s strani certificiranega kodirnika DogFACS, z označevanjem enega okvirja na 200 ms z uporabo kodirnika Solomon (različica 15.03.15, Andràs Péter). Od teh 39 spremenljivk je bilo v študiji Bremhorsta22 uporabljenih enajst spremenljivk, predstavljenih v tabeli 1, na podlagi vsaj 10-odstotne razširjenosti v vseh vzorcih bodisi pozitivnega bodisi negativnega stanja in vsaj znatne trdnosti interkoderskega dogovora (glej22). za dodatne podrobnosti).

10 ways to improve memory

Pregled obeh pristopov.

Tukaj predstavljamo primerjavo dveh različnih pristopov za samodejno razvrščanje pozitivnih in negativnih stanj: pristop, ki temelji na DogFACS, v primerjavi s čistim (pristop DogFACS ima tudi modul globokega učenja za zaznavanje spremenljivk DogFACS). Slika 3 predstavlja pregled obeh pristopov na visoki ravni.

Razpoložljivost video podatkov nam omogoča delo z dvema vrstama vnosa: posameznimi sličicami ali zaporedji sličic. Prva pomeni večjo izgubo informacij, vendar je preprostejša in bolj nadzorovana; medtem ko slednja vključuje časovno dimenzijo, za katero se je izkazalo, da je pomembna za tovrstne naloge, npr. v kontekstu odkrivanja bolečine pri konjih42,54. Prevladujoč pristop v kontekstu avtomatiziranega prepoznavanja afektivnih stanj in bolečine pri živalih pa je osnova enega samega okvira (npr. 33,39,41,55). Zaradi raziskovalne narave te študije smo se odločili za to možnost.

Oba pristopa torej delujeta na podlagi enega okvirja, tj. klasifikacija se izvaja na posameznih okvirih, ekstrahiranih iz videoposnetkov. Vendar se združevanje informacij o enem okvirju v obeh primerih izvede drugače. Po koraku predhodne obdelave ekstrahiranja obrezanih obrazov psov iz okvirjev (glej sliko 2 za primere) pri globokem pristopu neobdelane obraze vzame kot vhod nevronska mreža. Tukaj eksperimentiramo z arhitekturami nevronskih mrež dveh vrst: konvolucijsko nevronsko mrežo (Resnet5056) in nedavno uvedeno mrežo vision transformer57 (ViT). Odločitve izbranega omrežja se nato združijo z večinskim glasovanjem in doseže se odločitev o razvrstitvi na video.

Pristop, ki temelji na DogFACS, po drugi strani uporablja cevovod z dvema zaporednima korakoma. Prvi je avtomatiziran detektor spremenljivk DogFACS, ki zazna nabor spremenljivk DogFACS v vsakem okvirju. Spremenljivke DogFACS se nato združijo za celoten video. Drugi korak je drevo odločitev, katerega vhod je nabor spremenljivk DogFACS, zaznanih v videoposnetku, ki se uporabijo za dosego končne odločitve o razvrstitvi.

Tako pristop, ki temelji na DogFACS, sprejme odločitev o razvrstitvi na podlagi niza spremenljivk DogFACS, identificiranih v videu; pristop globokega učenja na drugi strani odloča o vsaki sličici posebej, ekstrahira naučene značilnosti iz neobdelanih slik, nato pa združi odločitev za vse sličice za video. Zato se pri raziskovanju razložljivosti obeh pristopov pričakuje, da bomo v prvem imeli 'razlage' po vzoru Bremhorsta et al.22 (prepoznavanje prevladujočih spremenljivk v vsakem od pogojev ali neke kombinacije le-teh). Slednji pristop pa naj bi prinesel več vizualnih razlag o tem, na katere značilnosti slike se osredotoča model, kot je podrobneje opisano spodaj.

Za ocenjevanje delovanja naših modelov smo uporabili standardne metrike točnosti, natančnosti in priklica, ki je standardna metoda v kontekstu strojnega učenja. Kot metodo validacije smo uporabili navzkrižno validacijo enega subjekta brez prekrivanja subjektov, kar pomeni uporabo vsakega subjekta psa kot ločen testni niz. Ta metoda je priporočljiva za nize podatkov, v katerih ima en posameznik več kot en povezan vzorec36. Glej Broomé et al.36 za razpravo o pomembnosti izbire ustrezne metode validacije.

short term memory how to improve

Pristop, ki temelji na DogFACS.

Nizi spremenljivk DogFACS. Eksperimentirali smo z dvema različnima nizoma spremenljivk DogFACS:

1. Nabor enajstih spremenljivk, predstavljenih v tabeli 1, ki so bili uporabljeni v študiji Bremhorsta et al.22, je najbolj obetavnih ali potencialno najpomembnejših spremenljivk (na podlagi prevalence vsaj 10 % v vseh vzorcih bodisi pozitiven ali negativen pogoj) in jih je mogoče zanesljivo kodirati (z vsaj precejšnjo trdnostjo medkoderskega dogovora, glej 22).

2. Celoten niz 39 spremenljivk DogFACS, kodiranih v študiji Bremhorsta et al.22.

Classification results. To explore optimal performance, we used the manual DogFACS annotations from Bremhorst et al.22 to experiment with different machine learning techniques, including Decision Tree, XGBoost, and Random Forest. Table 2 presents a comparison of their performance, with Random Forest performing slightly better for the full set of DogFACS variables (39 variables), reaching accuracy > 71%. In the limited set (11 DogFACS variables), the three models converged to one tree, and thus are presented together, reaching a slightly lower accuracy of > 66%.

Minimiziranje odločitvenega drevesa. Nato smo izvedli sistematično iskanje minimalnega nabora spremenljivk DogFACS, ki bi dal enako učinkovitost razvrščanja, predstavljeno v tabeli 2. Tabela 3 kaže, da uporaba samo ene spremenljivke DogFACS kot funkcije zagotavlja podobno zmogljivost kot tista, predstavljena v tabeli 2. Spremenljivka 'Ears Flattener' je najpomembnejša za klasifikacijo z uporabo omejenega nabora 11 spremenljivk DogFACS, njena prisotnost pa napoveduje negativno stanje. Slika 4 prikazuje poenostavljeno drevo odločanja s samo eno značilnostjo, ki napoveduje pozitivno stanje – odsotnost 'Ears Flattener' in negativno stanje - njegovo prisotnost (z natančnostjo > 66 %).

Pri upoštevanju vseh 39 spremenljivk DogFACS je 'Eyes Up' najpomembnejša spremenljivka za klasifikacijo z uporabo vseh 39 spremenljivk, njena prisotnost pa napoveduje pozitivne pogoje z visoko natančnostjo > 71 %.

Avtomatizirano zaznavanje spremenljivk DogFACS. Na podlagi naših ugotovitev usposabljanje detektorja za spremenljivki DogFACS 'Ears Flattener' in 'Eyes Up' zadostuje za popolnoma avtomatiziran sistem klasifikacije. Raziskali smo tudi zaznavanje drugih spremenljivk z uporabo vnaprej usposobljene konvolucijske nevronske mreže ResNet50 na uravnoteženih nizih podatkov (na različnem številu slik zaradi variabilnosti spremenljive frekvence DogFACS). Učinkovitost dobljenih detektorjev je predstavljena v tabeli 4.

ways to improve memory

Globok pristop.

Pri tem pristopu smo uporabili običajno nastavitev "prenosnega učenja", pri čemer smo usposabljali linearno sondo na vrhu fiksne predhodno usposobljene hrbtenice z uporabo človeških opomb. Raziskujemo primernost različnih hrbteničnih ogrodij za to nalogo s ponovitvijo poskusa s štirimi vnaprej usposobljenimi ogrodji: ResNet in ViT, usposobljena bodisi na nadzorovan način za klasifikacijo slik57 bodisi na samonadzorovan način z uporabo DINO58.

Usposobili smo štiri različne modele (na celotnem naboru podatkov) in preizkusili njihovo delovanje z okvirji iz istega uravnoteženega nabora podatkov, opisanega zgoraj (82 videoposnetkov negativnega stanja, 82 videoposnetkov pozitivnega stanja od (n = 29) posameznikov, kar je skupaj 164 videoposnetkov).

Tabela 5 predstavlja rezultate razvrščanja, analizirane na videoposnetek, kar pomeni, da pravimo, da je video pravilno razvrščen, če je večina njegovih okvirjev pravilno razvrščenih. Vidimo lahko, da model, treniran s hrbtenico DINO-ViT, kaže najboljšo zmogljivost z več kot 89-odstotno natančnostjo. Tabela 6 prikazuje rezultate razvrščanja, analizirane po okvirih. Kot je bilo pričakovano, so v tem primeru ukrepi nekoliko zmanjšani v primerjavi z analizo, opravljeno pri združevanju okvirjev, kar ima za posledico 85-odstotno natančnost za model, usposobljen s hrbtenico DINO-ViT.

memory enhancement

Diskusija

The present study is the first to explore automated recognition of canine emotional states focusing on diverse facial expressions, whilst using a carefully designed controlled experimental setup for dataset creation and annotation. We present classifiers of two different types: deep learning-based and DogFACS-based, both having a performance that is comparable to and in some cases outperforms those presented in previous studies addressing recognition of pain or emotional state from facial expressions, including mice38,39 (> 89% and 93% respectively), cats43 (> 72%), horses42,46 (> 75% and 65% respectively) and sheep55 (> 64%).

The DogFACS-based approach described here reached an accuracy of > 71% using the full set (n =  39) of DogFACS variables, but a lower accuracy of > 66% when using only the eleven DogFACS variables which were utilized in the study of Bremhorst et al.22 ( this accuracy was achieved based on manual DogFACS annotations and is expected to drop even lower in an end-to-end pipeline). Of the full set of 39 DogFACS variables, 'Eyes Up' were of considerable importance for classification, and including them in the Decision Tree leads to higher accuracy (>71 %). Vendar pa je treba pri razlagi smernih spremenljivk, kot so gibi oči in njihovega pomena kot potencialnih indikatorjev čustev, vedno upoštevati eksperimentalno postavitev študije, v kateri so bili zbrani podatki. V Bremhorstu et al.22 je izvajalec poskusa podelil nagrado s hrano z gibom nekoliko nad črtalom za oči psov. To je morda spodbudilo pse, da so pogledali navzgor (kar je povzročilo spremenljivko 'Eyes Up') v pričakovanju hrane. Zato moramo priznati, da je ta spremenljivka DogFACS lahko artefakt eksperimentalnega postopka. Ko izbirate spremenljivke kot del razvoja indikatorjev čustev, je pomembno pretehtati tveganje napake tipa I (lažno pozitivno) v primerjavi z napako tipa II (lažno negativno) skoraj neizogibno. Pri delu z zmanjšanim naborom enajstih spremenljivk DogFACS smo dali prednost izogibanju lažno negativnim rezultatom pred lažno pozitivnim rezultatom, da spremenljivke ne bi predčasno izključili iz nadaljnje preiskave. Pričakujemo lahko, da bodo napačno sprejete spremenljivke v naslednjih študijah izključene, če se ugotovi, da nimajo napovedne veljavnosti (kot je razloženo v 19).

As a byproduct of these results, we obtained automated detectors for nine DogFACS variables, of which five performed with an accuracy >70 %, kar dokazuje izvedljivost natančnega avtomatiziranega prepoznavanja spremenljivk DogFACS. Glavni izziv za usposabljanje detektorjev za vsako spremenljivko je razpoložljivost podatkov, tj. nizka pogostost pojavljanja nekaterih spremenljivk DogFACS, kar zahteva osredotočena prizadevanja za zbiranje nizov podatkov za specifične spremenljivke. Poleg tega imajo nekatere spremenljivke časovno razsežnost in jih ni mogoče obravnavati na podlagi enega okvira (npr. mežikanje z očmi ali sopihanje). Razvijanje detektorjev zanje zahteva modele, ki uporabljajo tudi časovno dinamiko, kot je pristop Brooméja et al.42.

Nadalje je treba opozoriti, da je naš nabor podatkov omejen na eno pasmo, zato je nujna raziskava v neposredni prihodnosti ocena posplošljivosti modelov na druge pasme. Če se uspešnost znatno zmanjša pri prenosu rezultatov na druge pasme, so navedeni alternativni pristopi k globinskemu pristopu, ki se uporablja tukaj, npr. v Feighelstein et al.43.

improve your memory

Raziskovanje posplošljivosti modelov, predstavljenih tukaj, ni pomembno samo v kontekstu zaznavanja spremenljivk DogFACS, ampak tudi za klasifikacijo čustev. Nabor podatkov, ki se tukaj uporablja, ni nadzorovan samo za pasmo, ampak je tudi zabeležen v strogo nadzorovanih okoljskih pogojih. Posploševanje iz nadzorovanih okolij v naturalistična okolja je znano težek izziv tudi v človeškem afektivnem računalništvu60. Feng et al.61 nudijo pregled človeške domene načinov, na katere lahko tehnike prenosnega učenja premagajo izzive, povezane z omejenimi količinami vzorcev podatkov, redkimi oznakami in spremenljivostjo okolja, ter spodbujajo robustne in posplošljive avtomatizirane sisteme za prepoznavanje čustev. Podobne načine je mogoče raziskati pri pasjem afektivnem računalništvu; tukaj predstavljeni rezultati zagotavljajo osnovo za nadaljnje raziskovanje te smeri.

Vprašanja, kot je "Ali lahko stroji prepoznajo čustvena stanja živali?" zanimivi sami po sebi in imajo daljnosežne praktične uporabe za dobro počutje živali. Rezultati naše študije kažejo na pozitiven odgovor, vsaj v primeru pozitivne frustracije in pričakovanja pri psih. Vendar pa ima izdelava modelov umetne inteligence, ki prepoznavajo pasja čustva, pomembno dodano vrednost, saj nam pomaga razumeti, kako stroji razvrščajo čustva, ali so občutljivi na nianse, ki jih človeški strokovnjak ne vidi, in kakšne posledice ima to za naše razumevanje živalskih čustev in tekočega razprave o čutenju živali. Iz tega razloga je ključno in obetavno raziskati razložljivost (kakšna je utemeljitev za odločitvijo stroja?) in interpretabilnost (kako je struktura modela povezana s takšno odločitvijo?)62. Te teme so temeljne v AI in jih obravnava ogromno raziskav63–65, pri čemer se večina prizadevanj osredotoča na pristope globokega učenja, katerih interpretabilnost je omejena zaradi njihove kompleksne strukture66. Metode razlage so po svoji naravi specifične za področje: zagotavljanje razlag za samodejno prepoznavanje osebnostnih lastnosti na razgovorih za službo je drugačno, npr. od zagotavljanja klinične utemeljitve zdravstvenih odločitev62.

increase brain power

Naša študija je prva, ki obravnava vidike razložljivosti modelov AI za prepoznavanje živalskih čustev. Ko smo primerjali dva različna pristopa k klasifikaciji čustev, je dodana vrednost zmožnosti primerjave tudi razlik v vidikih razložljivosti, ki jih obravnavata. Pristop, ki temelji na DogFACS, vodi do modelov v obliki preprostih dreves odločitev, ki modelirajo človeško logično razmišljanje v obliki kombinacije logičnih pogojev glede prisotnosti/odsotnosti določenih spremenljivk DogFACS. Pojasnjevalna narava odločitvenih dreves se še posebej odraža v njihovi poenostavljeni različici s samo enim vozliščem, kot je to, ki smo ga preučevali tukaj (z 'Ears Flattener'). Takšna drevesa so tesno povezana s koncepti, ki so uporabni za človeške strokovnjake, zlasti za kazalnike čustev, ki so jih proučevali Bremhorst et al.19. Veljavni indikatorji čustev so namenjeni natančni identifikaciji določenega čustvenega stanja, pri čemer so prisotni, kadar koli je čustvo prisotno, sicer pa odsotni.

Te značilnosti so opisane z občutljivostjo in specifičnostjo, meritvami, ki se običajno uporabljajo za ocenjevanje točnosti diagnostičnih testov. Bremhorst et al.19 so ugotovili, da nobene od spremenljivk DogFACS, obravnavanih v študiji, ni mogoče šteti za specifičen individualni indikator za pozitivno pričakovanje ali frustracijo pri psih. Natančneje, pokazalo se je, da ima "Ears Flattener" razmeroma visoko občutljivost, vendar nizko specifičnost. Zato ni presenetljivo, da model, opisan v naši študiji, ki je drevo odločanja z eno samo funkcijo 'Ears Flattener', ni dosegel visoke zmogljivosti. Vendar razmerje med meritvami indikatorjev čustev, kot jih uporabljajo Bremhorst et al.19, in meritvami, uporabljenimi tukaj za oceno uspešnosti našega modela, ni preprosto. Medtem ko prvi izračuna občutljivost, specifičnost ter pozitivno in negativno napovedno vrednost za celotne neuravnotežene podatke, drugi ocenjuje uspešnost v nalogi napovedovanja. To pomeni, da so podatki razdeljeni na dva dela: usposabljanje, ki se uporablja za usposabljanje modela, in testiranje za oceno njegove učinkovitosti. V nasprotju z Bremhorstom et al.19 smo podatke uravnotežili tudi s premajhnim vzorčenjem. Vendar pa je intuitivna povezava med obema ta, da bi lahko pričakovali, da bi drevo odločanja, ki ga uporablja kot funkcijo, doseglo odlično zmogljivost, če bi bil najden odličen indikator čustev s prvim pristopom.

Poleg razložljivosti lahko pristop strojnega učenja, predstavljen tukaj za iskanje optimalnih modelov drevesa odločanja za napovedovanje čustev psa, vodi do novih vpogledov v kazalnike čustev. Kot je razloženo zgoraj, je odkritje natančnih indikatorjev čustev v smislu Bremhorsta et al.19 tesno povezano s problemom iskanja klasifikatorjev drevesa odločanja z eno samo spremenljivko DogFACS za napoved čustev. Medtem ko se v naši študiji takšni klasifikatorji niso izkazali za visoko natančne (in dejansko v19 niso odkrili nobenih natančnih indikatorjev čustev), je mogoče učinkovitost klasifikacije izboljšati z upoštevanjem bolj sofisticiranih oblik odločitvenih dreves, na primer z združevanjem spremenljivk DogFACS v pare. , trojčki itd. Naši preliminarni poskusi z uporabo parov spremenljivk DogFACS kot vozlišč, prikazanih na sliki 5, kažejo, da je to izboljšalo učinkovitost modela v smislu priklica. Pomembno je, da je preiskavo, katere kombinacije spremenljivk DogFACS lahko izboljšajo klasifikacijo, mogoče izvesti na avtomatiziran, izčrpen in sistematičen način, kar lahko vodi do natančnejših predstav o indikatorjih čustev. To zagotavlja obetavno pot za prihodnje raziskave.

Po drugi strani pa je pristop globokega učenja dosegel izrazito višjo uspešnost nad 89%, kar dokazuje potencial takih pristopov za klasifikacijo čustev. Poleg tega se zdi, da je hrbtenica DINO-ViT najbolj primerna za nalogo klasifikacije čustev izmed vseh štirih raziskanih možnosti. Predvidevamo, da je to posledica občutljivosti funkcij DINO-ViT na dele predmeta, kot je prikazano v 67; in zaradi narave naloge razvrščanja čustev zahteva razumevanje na ravni predmeta-del (deli obraza, kot so oči, ušesa itd.). Zanimivo je, da hrbtenice, predhodno usposobljene z DINO, dajejo boljše rezultate kot hrbtenice pod nadzorom.

Treba je opozoriti, da je klasifikator globokega učenja deloval na podlagi slik, nato pa združeval rezultate na video. To pomeni, da kljub temu, da številni okvirji ne kažejo prisotnosti spremenljivk DogFACS, je model še vedno uspešen pri njihovi pravilni klasifikaciji. To lahko kaže na občutljivost modela na drobnozrnate podrobnosti na ravni slikovnih pik, kar lahko presega zmožnosti človeškega očesa. Vendar pa je lahko povezana tudi z morebitnimi pastmi v obliki neke inherentne pristranskosti. Tudi spremenljivka 'Eyes Up', o kateri smo razpravljali zgoraj, je morda bila ključnega pomena za omrežje in njenega učinka na odločanje ni enostavno nevtralizirati v omrežju globokega učenja. Raziskovanje teh vprašanj zahteva nadaljnje zbiranje podatkov v različnih eksperimentalnih in okoljskih pogojih, da se izključijo takšne pasti.

Po drugi strani pa je razložljivost pristopa globokega učenja, ki ga obravnavamo tukaj, popolnoma drugačne, bolj vizualne narave v primerjavi s tisto, ki temelji na DogFACS. Za razliko od modelov drevesa odločanja je zelo težko razložiti odločanje nevronskih mrež v človeku razumljivih izrazih zaradi njihove zelo zapletene narave 'črne skrinjice'68. Uporaba metode EigenCAM59 poudarja razlike med različnimi modeli, s katerimi smo eksperimentirali (ResNet/ViT, nadzorovan/DINO). Kot je prikazano na sliki 6, obstaja nekaj razlik med modeli. Zdi se, da modeli Te ViT kažejo boljšo lokalizacijo kot modeli ResNet, saj so močno aktivirane regije (označene z rdečo) manjše in ležijo na bolj izrazitih regijah (npr. oči, ušesa, nos in ne koža). Poleg tega se zdi, da se model DINO-ViT aktivira na več pomembnih regijah in ne na eni (npr. aktivira se na ušesih, očeh in nosu in ne samo na ušesih na zgornjem desnem primeru). Uspeh modelov, ki temeljijo na ViT, pripisujemo sposobnosti ViT, da zagotovijo bolj lokaliziran signal kot modeli ResNet. To izhaja iz njihove arhitekture – ločljivost funkcij ViT ostaja nespremenjena v vseh plasteh, medtem ko se ločljivost funkcij CNN zmanjšuje, ko so plasti globlje.

Medtem ko doseganje dokončnih zaključkov zahteva nadaljnje raziskave, smo eksperimentirali z metodo EigenCAM in se osredotočili na okvirje, ki izpolnjujejo naslednje pogoje: (i) ročno kodirani s spremenljivko 'Ears Flattener' in (ii) spadajo v razred video vzorcev negativno stanje in (iii) pravilno razvrščeno s strani omrežja DINO-ViT kot negativno stanje. V naši analizi smo primere razdelili v tri kategorije, kot je prikazano na sliki 7. Primeri kategorije A so toplotni zemljevidi z jasnim poudarkom samo na ušesih. To je mogoče razumeti kot skladno z razlago 'Ears Flattener', povezane z DogFACS, tj. lahko se zgodi, da se je model naučil vzorcev, povezanih z gibanjem ušesa. S tem je skladna tudi kategorija B, ki prikazuje toplotne karte, ki se osredotočajo na ušesa in druga področja, kot so oči, čelo, nos in usta. Slednje je lahko tudi posredno povezano z gibanjem 'Ears Flattener', pa tudi z drugimi spremenljivkami DogFACS ali kakšno drugo posturalno značilnostjo, ki je lahko prisotna v okvirju. Najbolj zanimiva kategorija pa je kategorija C: tukaj model zaznava signale iz delov obraza, ki niso ušesa, in še vedno pravilno razvršča. Ti primeri so morda ključ do razumevanja občutljivosti omrežja na nianse, ki niso vidne človeškemu očesu. Vsekakor je treba opozoriti, da opombe DogFACS ne morejo izčrpno pokriti vseh možnih sprememb v obnašanju obraza, kar se lahko odraža v vzorcih slikovnih pik, na katere je omrežje občutljivo. Nato smo ekstrahirali tudi toplotne zemljevide iz videoposnetkov, ki niso imeli označenih spremenljivk DogFACS. Bilo je devet videoposnetkov brez spremenljivk, od tega osem 'pozitivnih' in en — 'negativen'. Presenetljivo je, da je bila večina teh videoposnetkov (77 %) še vedno pravilno razvrščena po modelu. To je lahko še en znak, da model zazna subtilno vedenje obraza, ki ga DogFACS ne zajame. Pri pregledu toplotnih zemljevidov, izdelanih za okvirje teh videoposnetkov, smo opazili, da je bil glavni poudarek modela območje nosu in ust. Nekateri drugi okvirji kažejo fokus na druge dele obraza, medtem ko obstajajo primeri pravilno razvrščenih okvirjev, vendar zamegljenih in nejasnih toplotnih zemljevidov. Primeri iz teh treh kategorij so prikazani na sliki 8. Zanimivo je, da ti toplotni zemljevidi niso osredotočeni na določene dele obraza, kar nakazuje, da so bili v teh primerih vizualni znaki za model manj očitni.

increase memory power

improve short term memory

Druga pomembna težava, povezana z obema pristopoma glede zmogljivosti, je kratka dolžina videoposnetkov (3 s) v trenutnem naboru podatkov. Uporaba daljših videoposnetkov vodi do izziva identifikacije optimalnega časovnega okna, v katerem je mogoče notranje stanje obravnavati kot konstantno. Ta problem je bil obravnavan v 69 v kontekstu šibke ortopedske bolečine pri konjih in je pomembna usmeritev za prihodnje raziskave tudi za čustvena stanja psov.

Če povzamemo, ta študija je pokazala vrednost dveh različnih pristopov avtomatiziranega razvrščanja za dve čustveni stanji pri psih na podlagi njihovih obraznih izrazov: pozitivno stanje proti negativnemu. Oba sta dosegla dobro natančnost, primerljivo z drugimi najsodobnejšimi metodami avtomatiziranega prepoznavanja učinkov živali. Ti rezultati ne samo, da prvič dajejo pritrdilen odgovor na vprašanje "Ali lahko stroji prepoznajo pozitivna/negativna pasja čustva?", ampak tudi odpirajo nove raziskovalne poti raziskovanja, kako jih stroji prepoznajo in kako to prepoznavanje razložiti ljudem. . Nadaljnje eksperimentiranje z večjimi zbirkami podatkov s širšimi značilnostmi udeležencev bo prav tako spodbudilo naše razumevanje, kako razviti dobre kazalnike čustev živali. Ena posebna smer, ki se zdi posebej obetavna, je raziskovanje potenciala pristopov, povezanih z zaznavanjem obraznih mejnikov, kot sta OpenFace70 in Google MediaPipe71. Podobne pristope šele začenjajo raziskovati za nečloveške živali, glej npr. študijo Feighelsteina et al.43 o mačjih obrazih. Tako kot v človeški domeni bo njihov razvoj zahteval obsežna multidisciplinarna prizadevanja za zbiranje velikega nabora podatkov za različne vrste.

Metode

Nabor podatkov.

Nabor podatkov, ki se nanaša na pse, uporabljene za to študijo, je bil predhodno zbran v skladu z naslednjimi etičnimi odobritvami Univerze v Lincolnu (UID: CoSREC252) po Bremhorstu et al.22 s spremembo te raziskave je bila pridobljena z Univerze v Lincolnu za uporabo izvirnega nabora podatkov v tej študiji. Trenutni protokol, ki uporablja te podatke, je pregledal Etični odbor Univerze v Haifi in ni bila potrebna nadaljnja odobritev.

Obrezovanje in predobdelava.

Ta korak je pomemben tako za DogFACS kot za globinske pristope. Izvirni video okvirji vsebujejo nered v ozadju, vključno z okoliško sobo, ljudmi, pasjimi telesi itd. Osredotočiti se želimo na obrazne izraze psov in se izogniti učenju drugih napovedovalcev čustvenega stanja (npr. telesne drže psa). Zato smo masko-RCNN72 usposobili za prepoznavanje pasjih obrazov in jo uporabili za obrezovanje omejevalnega polja obraza iz vsake slike. Mask-RCNN smo usposobili na približno 200 označenih slikah iz tega nabora podatkov, zaradi česar je najbolj primeren za to specifično eksperimentalno postavitev. Primere obraznih pridelkov, pridobljenih s stopnjo predhodne obdelave, lahko vidite na sliki 2.

Pristop, ki temelji na DogFacs.

Od videoposnetkov do spremenljivk DogFACS. Celoten cevovod je opisan v naslednjem diagramu, glejte sliko 9. Vključuje naslednje korake:

• Izrezovanje pasjih obrazov iz okvirjev z uporabo zgoraj opisane metode.

• Izdelava podatkovnih nizov spremenljivk DogFACS. Z uporabo ročnega kodiranja DogFACS Bremhorsta et al.22 smo za vsako spremenljivko DogFACS ustvarili dve mapi s pozitivnimi in negativnimi primeri (pasji obraz izraža ali ne izraža to spremenljivko DogFACS). Za pozitivne vzorce (prisotna spremenljivka) smo izbrali slike vseh okvirjev, ročno kodiranih s to spremenljivko. Za negativne vzorce smo izbrali okvirje v videoposnetkih, ki nimajo spremenljivke, označene na njihovem kodiranju, do prvega pojava te spremenljivke (ali do konca videoposnetka, če ni prisoten). Nabori podatkov so bili nato uravnoteženi, tako da je ostalo enako število slik za pozitivne in negativne primere za vsako spremenljivko. Tabela 4 prikazuje velikost naborov podatkov za vse spremenljivke DogFACS, za katere so bili pridobljeni detektorji.

Od spremenljivk DogFACS do klasifikacije čustvenih stanj. Uporabili smo učenje prenosa, ki temelji na predhodno usposobljeni omrežni arhitekturi ResNet50, inicializirani z utežmi Imagenet. Njegovo zgornjo plast smo zamenjali s plastjo povprečnega bazena, 20-odstotno plastjo izpada in plastjo klasifikatorja dveh razredov. Model je bil učen v 20 obdobjih z uporabo optimizatorja Adam s stopnjo učenja 0,0001. Za najboljši model je bil izbran model, ki dosega največjo natančnost na validacijskem nizu podatkov. V prvih 10 obdobjih so bile uteži vseh plasti natančno naravnane. V prvih 10 obdobjih je bila teža vseh plasti natančno prilagojena. V preostalih obdobjih so bile uteži ResNet50 zamrznjene in posodobljene le uteži novih zgornjih plasti. Za spremenljivke, ki niso povezane z orientacijo ('Ears Flattener', 'Lips Part', 'Ears Adductor', 'Ears Forward' in 'Nose Lick') smo uporabili tehniko povečanja, ki temelji na naključnem vodoravnem fipu slike in rotaciji do 20 stopinj. Kot vhod za kodirnik smo uporabili vhodno tabelo, kjer vsaka vrstica predstavlja prisotnost (1)/odsotnost (0) vsake od 11 spremenljivk DogFACS na vsakem videu. Cilj kodirnika je tabela, ki vsebuje stanje (negativno (0)/pozitivno (1)) vsakega videa.

supplements to boost memory

Globok pristop.

Do nedavnega so konvolucijske nevronske mreže (CNN) veljale za najsodobnejše naloge računalniškega vida. Pred kratkim se je kot alternativa pojavila arhitektura Vision Transformer (ViT)57. Metoda DINO za usposabljanje je bila uvedena šele leta 2021 kot samodestilacijski učni okvir. Usposabljanje več hrbtenic DNN (ResNet50, visit-small, vit-base itd.) v tej konfiguraciji je pokazalo, da hrbtenica ViT, usposobljena s pristopom DINO, prekaša prejšnje rezultate klasifikacije na standardnem naboru podatkov ImageNet74.

Uporabili smo arhitekturo ResNet50 za nadzorovane in DINO usposobljene hrbtenice; ViT-S/16 treniran pod nadzorom in ViT-S/8 usposobljen z DINO. Uporabljamo vnaprej pripravljene uteži ViT iz knjižnice Timm75. Usposabljamo vse štiri modele za 30 obdobja z uporabo Adam optimizerja76 z beta=(0, 0,999) in stopnjami učenja: 10−4 za hrbtenice ResNet in 5 · 10−6 za hrbtenico ViT. Krivulje izgub treniranih modelov so predstavljene na sliki 10.

Vizualizacija zemljevida.

Za vizualizacijo glavnih komponent končnih aktivacij za vsak model se odločimo za metodo Eigen-CAM59. Izkazalo se je, da Eigen-CAM zagotavlja lažje interpretativne rezultate z manj računanja v primerjavi z drugimi metodami CAM, kot je priljubljena Grad-CAM77. Poleg tega je za razliko od drugih vizualizacijskih metod, kot sta Grad-CAM59 in Grad-CAM++78, Eigen-CAM orodje neodvisno od razreda. Ta lastnost omogoča Eigen-CAM vizualizacijo naučenih vzorcev, tudi če je napoved modela napačna, v nasprotju s starejšimi metodami CAM, ki proizvajajo nepomembne zemljevide, če je njihova napoved napačna. Ta lastnost EigenCAM omogoča razlago razlogov za neuspešno napovedovanje. V primerjavi z drugimi najsodobnejšimi vizualizacijskimi metodami je bolj dosleden in razredno diskriminativen. Poleg tega EigenCAM ni specifičen za model – uporablja se lahko za ViT in CNN brez spreminjanja plasti.

Razpoložljivost podatkov

Nabor podatkov, uporabljen v tem prispevku, je na voljo na zahtevo ustreznega avtorja.


Reference

Darwin, C. Te Izražanje čustev pri živalih in človeku Vol. 11, 1872 (Murray, 1872).

2. Ekman, P. & Friesen, WV Merjenje gibanja obraza. Okolje. Psychol. Neverbalno vedenje. 1, 56–75 (1976).

3. Ekman, P. & Keltner, D. Univerzalni obrazni izrazi čustev. V neverbalni komunikaciji: kjer narava sreča kulturo (ur. Segerstrale UP & Molnar, P.) vol. 27, 46 (1997).

4. Russell, JA, Bachorowski, J.-A. in Fernández-Dols, J.-M. Obrazni in glasovni izrazi čustev. Ann. Rev. Psychol. 54, 329–349 (2003).

5. Diogo, R., Abdala, V., Lonergan, N. & Wood, B. Od FSH do sodobnega človeka – primerjalna anatomija, homologije in razvoj muskulature glave in vratu. J. Anat. 213, 391–424 (2008).

6. Descovich, KA et al. Izraz obraza: premalo uporabljeno orodje za oceno dobrobiti sesalcev (Altex, 2017).

7. Mota-Rojas, D. et al. Trenutni napredek pri ocenjevanju pasjih čustev, mimike in njihove uporabe za klinično prepoznavanje bolečine. Živali 11, 3334 (2021).

8. Ekman, P. & Friesen, WV Facial Action Coding System: Priročnik (Consulting Psychologists Press, 1978).

9. Ekman, P. & Friesen, W. Sistem kodiranja obraznih dejanj: tehnika za merjenje obraznih gibov (1978).


For more information:1950477648nn@gmail.com




Morda vam bo všeč tudi