Raziskovanje samonadzorovanih vidnih transformatorjev za prepoznavanje hoje v divjini 1. del
Nov 24, 2023
Povzetek:
Način hoje (hoja) je močna biometrija, ki se uporablja kot edinstvena metoda odvzema prstnih odtisov, ki omogoča izvajanje nevsiljive vedenjske analize na daljavo brez sodelovanja subjekta.
Vsi vemo, da telovadba pomaga k dobremu zdravju. Poleg tega vadba pomaga izboljšati spomin. Hoja je najenostavnejša in najlažja oblika vadbe za vadbo in veliko ljudi uživa v sproščanju med hojo ali tekom. Zdaj več raziskav kaže, da hoja vpliva na možgane.
Prvič, hoja stimulira živčni sistem možganov, kar pomaga krepiti delovanje možganov. Ko se telo premika, se naš srčni utrip in krvni pretok povečata, kar tudi spodbudi možgane, da proizvajajo več nevronov in sinaps. Povezave med temi nevroni in sinapsami lahko ustvarijo nove nevronske mreže in hitrejše miselne procese.
Drugič, hoja lahko ublaži stres in tesnobo, kar je zelo pomembno za izboljšanje spomina. Ko sta um in telo v stanju napetosti, depresije ali tesnobe, možgani sproščajo hormon, imenovan kortizol. Kortizol poškoduje nevrone in sinapse v možganih, kar lahko povzroči izgubo spomina. Hoja lajša stres in tesnobo, zmanjšuje nastajanje kortizola v telesu in pomaga ohranjati zdrave nevrone in sinapse.
Končno hoja poveča krvni obtok v možganih. Nekatere študije kažejo, da lahko dobra prekrvavitev pomaga izboljšati spomin. S staranjem se krvne žile v možganih postopoma zamašijo, kar povzroči nezadostno oskrbo možganov s kisikom. Hoja lahko izboljša zdravje srca, saj srcu omogoči učinkovitejšo dostavo kisika in hranilnih snovi v možgane ter tako spodbuja spomin in delovanje možganov.
Zato je hoja odlična oblika gibanja tako za mlade kot za starejše. Poleg izboljšanja telesnega zdravja lahko hoja pomaga izboljšati tudi spomin. Vsak dan prehodimo veliko razdaljo, da bomo bolj zdravi in boljši! Vidimo, da moramo izboljšati spomin, in Cistanche deserticola lahko bistveno izboljša spomin, saj je Cistanche deserticola tradicionalno kitajsko zdravilno sredstvo, ki ima številne edinstvene učinke, eden od njih je izboljšanje spomina. Učinkovitost mletega mesa izhaja iz različnih učinkovin, ki jih vsebuje, vključno s kislino, polisaharidi, flavonoidi itd. Te sestavine lahko na različne načine spodbujajo zdravje možganov.

Kliknite spoznajte 10 načinov za izboljšanje spomina
V nasprotju z bolj tradicionalnimi metodami biometrične avtentikacije analiza hoje ne zahteva eksplicitnega sodelovanja preiskovanca in jo je mogoče izvesti v nastavitvah z nizko ločljivostjo, ne da bi zahteval, da je obraz preiskovanca neoviran/viden. Večina trenutnih pristopov je razvita v nadzorovanem okolju s čistimi, zlatimi standardi označenimi podatki, ki so spodbudili razvoj nevronskih arhitektur za prepoznavanje in razvrščanje.
Šele pred kratkim se je analiza hoje odločila za uporabo bolj raznolikih, obsežnih in realističnih naborov podatkov za vnaprej usposobljena omrežja na samonadzorovan način. Režim samonadzorovanega treninga omogoča učenje raznolikih in robustnih predstavitev hoje brez dragih ročnih človeških opomb. Na podlagi vseprisotne uporabe transformatorskega modela na vseh področjih globokega učenja, vključno z računalniškim vidom, v tem delu raziskujemo uporabo petih različnih arhitektur transformatorja vida, ki se neposredno uporabljajo za samonadzorovano prepoznavanje hoje.
Enostavne ViT, CaiT, CrossFormer, Token2Token in TwinsSVT prilagodimo in ponovno usposobimo na dveh različnih obsežnih nizih podatkov o hoji: GREW in DenseGait. Zagotavljamo obsežne rezultate za zero-shot in natančno nastavitev na dveh primerjalnih nizih podatkov o prepoznavanju hoje, CASIA-B in FVG, ter raziskujemo razmerje med količino prostorskih in časovnih informacij o hoji, ki jih uporablja vizualni transformator.
Naši rezultati kažejo, da načrtovanje transformatorskih modelov za obdelavo gibanja uporablja hierarhični pristop (tj. modele CrossFormer) na sejmih bolj drobnega gibanja sorazmerno bolje kot prejšnji pristopi celotnega skeleta.
Ključne besede:
prepoznavanje hoje; biometrična avtentikacija; transformator vida; ocena položaja; samonadzorovano učenje; kontrastno učenje.
1. Uvod
Kako se gibljemo, vsebuje pomembne namige o nas samih. Zlasti našo hojo (način hoje) so natančno preučevali v medicini [1], psihologiji [2] in športni znanosti [3]. V zadnjem času je analiza hoje prejela večjo pozornost [4,5] računalniške skupnosti, kar sovpada z eksponentnim napredkom poglobljenega učenja in široko dostopnostjo računalniške strojne opreme.
Sistemi za analizo hoje, ki jih poganja umetna inteligenca, so lahko uspešno prepoznali subjekte [6–10], ocenili demografske podatke, kot sta spol in starost [11], in ocenili zunanje atribute, kot so oblačila [12], brez uporabe zunanjih znakov videza. Ti rezultati niso presenetljivi, glede na veliko individualnih razlik v hoji, ki so posledica razlik v mišično-skeletni strukturi, genetskih in okoljskih dejavnikih ter čustvenem stanju in osebnosti hoje [13].
Trenutni sistemi so resnično usposobljeni in preizkušeni samo v nadzorovanih notranjih okoljih. Večina metod uporablja nabor podatkov CASIA-B [6] kot standardno merilo za modele prepoznavanja hoje, ki vsebuje 124 subjektov, ki hodijo v zaprtih prostorih na strogo nadzorovan način, posnetih z več kamerami. Kompleksnosti v resničnem svetu ni mogoče v celoti oblikovati s tako omejenimi scenariji. Šele pred kratkim je bil poudarek na modeliranju hoje "v divjini" z nabori podatkov, kot so DenseGait [12], GREW [7] in Gait3D [14].

Zbiranje obsežnega nabora podatkov, ki je čist in v celoti označen, predstavlja izjemen napor v smislu finančnih virov in dodeljenega časa. Nabor podatkov GREW [7] je menda potreboval 3 mesece neprekinjenega dela, da so bili zbrani in označeni. Čeprav so bili takšni pristopi uporabni pri razvoju nevronskih arhitektur za obdelavo hoje [8, 9], niso dovolj raznoliki, da bi jih lahko pravilno uporabljali v bolj sproščenih okoljih resničnega sveta.
Skupnost umetne inteligence se počasi odmika od tega pristopa na drugih področjih, z metodami za samonadzorovano učenje tako za vid [15] kot za jezik [16], ki pridobivajo velik oprijem in pogosto presegajo tradicionalne nadzorovane metode. Nedavni napredek pri samonadzorovanem učenju je pokazal, da so samonadzorovani modeli bolj robustni in kažejo nastajajoča vedenja, ki med usposabljanjem niso izrecno definirana.
Na primer, DINO [17], pretvornik vida, usposobljen za samonadzorovani režim, se je naučil lastnosti, specifičnih za razred, ki omogočajo nenadzorovano segmentacijo objektov brez uporabe takšnih oznak med usposabljanjem. Cosmaand Radoi [10] je predlagal prvo kontrastno metodo za samonadzorovano učenje za analizo gaitanije z usposabljanjem ST-GCN [18] na manjši različici DenseGait [12]. Njihova metoda je pridobila razumne rezultate pri nalogah prepoznavanja hoje navzdol in pokazala, da obstaja močna korelacija med velikostjo vnaprej usposobljenega nabora podatkov in zmogljivostjo prenosa brez strela.
Medtem ko številni pristopi za analizo hoje uporabljajo silhuete, pridobljene z odštevanjem ozadja [6, 8, 9], pridobivanje silhuet v resničnih scenarijih nadzora pomeni uporabo naprednejših tehnik, kot je segmentacija primerkov [19], ki zahtevajo visoke računske stroške. Zaporedja silhuet zasedajo veliko prostora za shranjevanje in niso dovolj prilagodljiva za uporabo pri drugih sosednjih nalogah, kot je prepoznavanje dejavnosti. Poleg tega silhuete kodirajo subtilne znake videza, zaradi česar ni jasno, v kolikšni meri je gibanje uporabljeno pri identifikaciji [20].
Po drugi strani pa so 2D modeli za ocenjevanje položaja postali vse bolj natančni in računsko učinkoviti [21, 22]. Okostnjake je poceni za pridobivanje in so trenutno bolj zanesljivi kot 3D mreže in 3D poze, zlasti na daljavo. Poleg tega so 2D skeleti bistveno lažji od silhuet v smislu dolgotrajnega shranjevanja.
Trenutne arhitekture za obdelavo zaporedij okostij uporabljajo strukturo naravnega prostorskega grafa, ki je prisotna v človeškem okostju, in v zasnovo modela uvajajo induktivno pristranskost. Modela, kot sta priljubljena ST-GCN [18] in MS-G3D [23], imata impresivne rezultate za prepoznavanje dejanj na osnovi okostja.
Hkrati je prišlo do eksplozije v uporabi transformatorskih modelov na skoraj vseh področjih globokega učenja od njihove prve uporabe za obdelavo naravnega jezika.
Transformatorji veljajo za bolj splošno arhitekturo z malo induktivnimi pristranskostmi. Sprva so se transformatorji težko ujemali z modeli CNN za razvrščanje slik [24], vendar trenutno presegajo druge modele in kažejo obetavne rezultate v samonadzorovanih scenarijih, bolj kot druge vrste arhitektur so transformatorji pokazali impresivno učno sposobnost in pojavno vedenje pod lastnim nadzorom. - nadzor [17].
Cosma in Radoi [12] sta bila prva, ki sta predlagala GaitFormer, neposredno prilagoditev modela kodirnika vidnega transformatorja za prepoznavanje hoje, ki uporablja posamezne okostje kot vhodne "obliže", v bistvu izvaja samo časovno pozornost, ne upošteva odnosov prostorske pozornosti.
GaitFormer je bil usposobljen na samonadzorovan način in je presegel druge metode prepoznavanja hoje tudi brez kakršnega koli natančnega prilagajanja. Tako prejšnje delo je spodbudno in utira pot za bolj poglobljeno študijo potencialne uporabe transformatorskih arhitektur za analizo hoje. Ali je mogoče modele transformatorjev vida prilagoditi za samonadzorovano učenje predstavitev skeletne hoje?
Glavna arhitekturna težava pri transformatorjih vida je definiranje ustreznih odnosov med slikovnimi zaplatami, ki definirajo lokalne in globalne informacije. Ko se uporablja za hojo, izbira dimenzij zaplate ustreza količini kodiranih časovnih in prostorskih informacij zaporedja okostja.
V tem delu predstavljamo obsežno študijo petih različnih transformatorjev vida, prilagojenih za prepoznavanje hoje. Raziskujemo klasični model ViT [24], CaiT [25], CrossFormer [26], TwinsSVT [27] in ViT od žetona do žetona [28].

Vsaka arhitektura se posebej usposablja na kontrasten samonadzorovan način na dveh obsežnih naborih podatkov "v divjini" 2D zaporedij okostja hoje: DenseGait—samodejno zbrani nabor podatkov iz neobdelanih tokov nadzora in GREW, manjši nabor podatkov, ki vsebuje čiste opombe ljudi.
Raziskujemo zmožnosti prenosa v dveh nadzorovanih nizih podatkov za prepoznavanje hoje, CASIA [6] in FVG [29]. Za vsak nabor podatkov analiziramo neposreden prenos in učinkovitost podatkov med finim uravnavanjem z usposabljanjem s postopno večjimi podnabori naborov podatkov. Poleg tega izvajamo študijo ablacije o razmerju med prostorskimi in časovnimi dimenzijami za velikosti popravkov za SimpleViT in CaiT , standardne hrbtenice za večino dosedanjih transformatorjev za vid.
Preostali del prispevka je organiziran na naslednji način. Izvajamo pregled na visoki ravni povezanih del o modelih za prepoznavanje hoje in transformatorjih vida. Opažamo, da modeli za predstavitev hoje zelo koristijo samonadzorovanemu usposabljanju, da imajo bolj robustne in splošne vdelave, transformatorski modeli pa so pokazali veliko zmogljivost modeliranja v režimih samonadzorovanega usposabljanja.
Nadalje matematično opisujemo pet arhitektur, ki jih primerjamo, in opisujemo predprocesiranje podatkov in skeletne transformacije, ki jih je treba izvesti, tako da morajo transformatorji vida brezhibno delovati na skeletnih zaporedjih. Opisujemo tudi povečave podatkov, nabore podatkov za usposabljanje in primerjalno analizo ter poskusne nastavitve.
Predstavljamo rezultate na CASIA-B in FVG za vsako od petih arhitektur in dva nabora podatkov o 'predusposabljanju v naravi'. Nazadnje naredimo študijo ablacije o razmerju med prostorsko in časovno velikostjo zaplate ter podamo kratko razpravo o naših rezultatih. Našo izvorno kodo naredimo javno dostopno na GitHubu (https://github.com/cosmaadrian/gait-vit, dostopno 28. februarja 2023) zaradi preglednosti in ponovljivosti.
2. Sorodno delo
V tem razdelku naredimo kratek pregled obstoječih metod za prepoznavanje hoje v nadzorovanem okolju in "v divjini". Nadalje opisujemo glavni razvoj modelov transformatorjev in zlasti njihovo uporabo na področju vida.
2.1. Prepoznavanje hoje
Podobno kot identifikacija na podlagi obraza se prepoznavanje hoje opira na učenje metrike. V nasprotju s tradicionalnimi biometričnimi metodami avtentikacije, ki temeljijo na eni sami sliki (npr. prepoznavanje obraza) in zahtevajo obsežno sodelovanje (npr. biometrična avtentikacija na osnovi šarenice), se značilnosti hoje obdelujejo kot zaporedje posnetkov gibanja. Takšna dinamika geste zahteva več zapletenosti pri določanju najbolj informativnega podzaporedja, vendar omogoča uporabo nevsiljive avtentikacije na daljavo.
V tem kontekstu naloga vključuje usposabljanje omrežja kodirnikov za preslikavo zaporedja hoje v prostor vdelave, kjer podobnost vdelave ustreza podobnosti hoje. Vdelave hoj, ki pripadajo isti osebi, bi morale biti blizu prostora za vdelavo, tiste, ki prihajajo iz različnih identitet, pa morajo biti bolj oddaljene. V tem prostoru za vdelavo je mogoče sklepati tako, da pridobimo vgradnjo zaporedja hoje in uporabimo najbližjega soseda pristop na bazi podatkov znanih sprehodov.
Trenutni pristopi k prepoznavanju na podlagi hoje so razdeljeni v dve kategoriji: na podlagi videza [8,9] in na podlagi modela [10,12,30]. Metode, ki temeljijo na videzu, najprej pridobijo silhuete hodečih subjektov z algoritmi za odštevanje ozadja ali segmentacijo iz vsakega video okvirja.
Nato se zaporedje silhuet vnese v arhitekture, ki temeljijo na CNN, ki izločijo prostorske in časovne značilnosti, ki se združijo v končno vgradnjo za prepoznavanje. Pristopi, ki temeljijo na modelih, izvlečejo okostja iz videoposnetkov RGB z modeli za oceno posesti [21,22]. Zaporedja skeletov se običajno obdelujejo z modeli, ki se opirajo na konvolucije grafov [10,30] za pridobitev vdelave hoje.
GaitSet, delo Chao et al. [8] obravnava hojo kot neurejen niz silhuet. Avtorji trdijo, da je ta predstavitev bolj prilagodljiva kot zaporedje silhuet, ker je robustna za različne razporeditve okvirjev ali kombinacijo več smeri hoje in variacij. Uporabljajo konvolucijske plasti za vsako silhueto, da pridobijo funkcije na ravni slike in jih združijo v funkcijo na ravni niza s funkcijo Set Pooling. Končni rezultat pridobijo z uporabo svoje različice HorizontalPyramid Matching [31].
Fan et al. [9] je opazil dejstvo, da morajo imeti določeni deli človeške silhuete svoj prostorsko-časovni izraz, saj ima vsak edinstven vzorec. Njihova arhitektura, GaitPart, uporablja fokalne konvolucijske plasti (FConvs), ki so specializirana vrsta konvolucije z bolj omejenim receptivnim poljem. Avtorji trdijo, da FConv-ji pomagajo njihovi arhitekturi pri učenju natančnejših funkcij za različne dele premikajočega se telesa. Predstavljajo tudi module za zajemanje mikro gibanja, ki se uporabljajo za ekstrahiranje značilnosti majhnih časovnih zaporedij.
Teepe et al. [30] predlagajo GaitGraph, ki izkorišča prilagojeno konvolucijsko mrežo grafov, imenovano ResGCN [32] za kodiranje prostorsko-časovnih značilnosti, dobljenih iz zaporedja skeletov. Li et al. [33] predlagajo PTP, ki je struktura, ki združuje več časovnih značilnosti iz enega cikla hoje na podlagi njihove analize najpomembnejših stopenj hoje.
Uporabljajo tudi konvolucijsko mrežo grafov za ekstrakcijo prostorskih značilnosti, ki deluje skupaj s PTP. Avtorji predstavljajo novo metodo povečanja podatkov, ki spreminja hojo, da ima več korakov v bolj realističnem ciklu.
Vendar pa si za razliko od prejšnjih del prizadevamo raziskati delovanje arhitektur za prepoznavanje hoje v samonadzorovanih scenarijih. Navdihnjen z izjemnim napredkom na področju računalniškega vida, predlagamo prilagoditev obstoječih arhitektur transformatorjev vida za delovanje na skeletnih zaporedjih namesto na slikah in za testiranje njihove zmogljivosti modeliranja v samonadzorovanih scenarijih. Večina drugih del [8,9,30] se osredotoča na razvoj nevronskih arhitektur, ki dosegajo impresivne rezultate pri prepoznavanju hoje na nadzorovanih zbirkah podatkov.
Vendar pa nameravamo odpraviti potrebo po zelo dragih ročnih opombah za nabore podatkov o hoji in raziskati načine, na katere je samonadzorovano učenje primerno za analizo hoje.

Prejšnja dela na tem področju [10,12] so pokazala potencial za učenje dobrih predstavitev hoje iz šibko označenih naborov podatkov. Cosmaand Radoi [12] sta predlagala GaitFormer, prvo na transformatorju temelječo arhitekturo za obdelavo skeletnih zaporedij, ki se zgleduje po modelu ViT [24]. Podobno kot [12] poskušamo raziskati delovanje drugih modelov transformatorjev vida z drugačno prostorsko in časovno dinamiko v mehanizmu obdelave popravkov. V preteklosti so bili predlagani obsežni nabori podatkov za prepoznavanje hoje [7, 12], kar omogoča razvoj splošnih arhitektur za predstavitveno učenje.
For more information:1950477648nn@gmail.com






