Raziskovanje samonadzorovanih vidnih transformatorjev za prepoznavanje hoje v divjini 2. del

Nov 24, 2023

2.2. Vision Transformers

Medtem ko so bili prvotno predlagani za naloge NLP [16,34] z izjemnim uspehom, so se transformatorji v zadnjih letih pogosto uporabljali v računalniškem vidu [24,25,28,35–37]. Obe domeni sta z uporabo različnih variacij transformatorjev dosegli neverjetne zmogljivosti, delno zaradi povečane zmogljivosti modela in zmožnosti transformatorjev, da izkoristijo samonadzor veliko bolj kot prejšnji modeli [17].

Samonadzor in spomin sta tesno povezana. Samonadzor se nanaša na vrednotenje in prilagajanje lastnega vedenja, mišljenja in čustev, medtem ko se spomin nanaša na sposobnost pridobivanja, obdelave in shranjevanja informacij. Samonadzor nam lahko pomaga pridobiti boljši nadzor nad svojim vedenjem in čustvi ter s tem izboljšati spomin.

Prvič, samonadzor nam lahko pomaga, da se bolje upremo skušnjavi. Skušnjava ponavadi odvrne našo pozornost in energijo ter vpliva na naš spomin. S samonadzorom se lahko bolje obvladujemo in se izognemo pretiranim motnjam ter s tem izboljšamo spomin.

Drugič, samonadzor nam lahko tudi pomaga bolje razumeti in si zapomniti informacije. Samonadzor nam omogoča, da smo bolj pozorni na ključne točke informacij in smo pozorni na povezave med informacijami, da bolje razumemo in si zapomnimo informacije. Ko smo pozorni, smo bolje opremljeni za razumevanje in zadrževanje informacij.

Nenazadnje nam lahko samonadzor tudi pomaga bolje opazovati in povzemati svoje vedenje in razmišljanje. Z razmišljanjem o lastnih dejanjih in miselnih procesih lahko prepoznamo pomanjkljivosti in jih izboljšamo. Ta izboljšava ne le izboljša naše vedenje in razmišljanje, ampak tudi izboljša naše spominske sposobnosti.

Če povzamemo, sta samonadzor in spomin tesno povezana. S samonadzorom se lahko bolje nadzorujemo, bolje razumemo in si zapomnimo informacije ter bolje izboljšamo svoje vedenje in miselne procese. Hkrati nam bo to pomagalo tudi izboljšati spomin, kar nam bo omogočilo učinkovitejše učenje in delo. Pojasnimo si cilje, aktivno se prilagajajmo in nenehno sledimo napredku! Vidi se, da moramo izboljšati spomin in Cistanche deserticola lahko bistveno izboljša spomin, saj lahko Cistanche deserticola uravnava tudi ravnovesje nevrotransmiterjev, kot je povečanje ravni acetilholina in rastnih faktorjev. Te snovi so zelo pomembne za spomin in učenje. Poleg tega lahko meso izboljša pretok krvi in ​​spodbuja dostavo kisika, kar lahko zagotovi, da možgani prejmejo dovolj hranilnih snovi in ​​energije, s čimer se izboljša vitalnost in vzdržljivost možganov.

supplements to boost memory

Kliknite poznajte dodatke za izboljšanje spomina

Dosovitskiy et al. [24] so bili prvi, ki so predlagali uporabo transformatorskih kodirnikov za klasifikacijo slik in predstavili Vision Transformer (ViT). Arhitektura razdeli vhodno sliko na zaplate fiksne velikosti 16x16, jih izravna in projicira z linearno plastjo na dimenzijo vdelave. Žeton dodatnega razreda (CLS) je vstavljen v zaporedje in vsakemu vektorju so dodana pozicijska kodiranja.

Nastalo zaporedje vdelav je podano kot vhod transformatorskemu kodirniku, ki ima enako strukturo kot tisti v [34], vendar uporablja operator LayerNorm pred vsakim blokom namesto za njim (prednorma). MLPhead se uporablja za pridobitev oznake razreda iz globalno zbranih informacij v žetonu razreda.

Mehanizem samopozornosti, ki so ga predstavili Vaswani et al. [34] vzame zaporedje elementov kot vhod in oceni interakcijo med vsemi z združevanjem globalnih informacij za vsak element v zaporedju. Za izračun različnih interakcij med elementi zaporedja modul večglave samopozornosti (MSA) združuje rezultate več blokov samopozornosti in projicira izhod na učljivo matriko uteži. Transformatorski kodirnik, predstavljen v [34], je sestavljen iz več zloženih plasti, ki jih sestavljajo blok MSA, blok s posredovanjem naprej (FFN), preostale povezave med vsakim blokom in LayerNorm (LN) za vsakim blokom.

Touvron et al. [25] predlagata dve arhitekturni spremembi za izboljšanje delovanja transformatorjev globokega vida. Njihov prvi prispevek, LayerScale, olajša usposabljanje globljih modelov z dodajanjem učljive diagonalne matrike, ki je pomnožena z rezultatom preostalih blokov. Ker je matrika inicializirana z majhnimi vrednostmi, prisili, da imajo rezultati plasti kodirnika transformatorja majhen prispevek k izhodu preostalega bloka na začetku usposabljanja.

Njihov drugi prispevek je mehanizem razredne pozornosti. Namesto prvotnega dodajanja žetona CLS, kot na primer v standardnem ViT, je pripet po več blokih kodirnika. Po tej stopnji se posodobi samo žeton razreda, žetoni popravkov pa ostanejo zamrznjeni. Ta mehanizem pomaga pri ločevanju operacij samopozornosti med popravki od združevanja informacij, ki bodo uporabljene za klasifikacijo.

Yuan et al. [28] trdijo, da ima preprosta tokenizacija obližev v vanilla ViT omejitev, da ne more modelirati lokalne strukture slike in interakcije med sosednjimi obliži. Posledično uvajajo progresivni proces tokenizacije, ki združuje sosednje žetone v enega samega.

Ta proces je sestavljen iz modula Reshape, ki vzame zaporedje žetonov iz prejšnje plasti in iz njih sestavi sliko na podlagi prostorske bližine. Modul Soft Split konstruirano sliko razdeli na prekrivajoče se zaplate žetonov in jih posreduje naslednjemu kodirniku. Ustvarjeni žetoni se po postopku tokenizacije vnesejo v globoko ozko hrbtenico NarrowViT za klasifikacijo.

ways to improve your memory

Kot ugotavljajo Wang et al. [35] standardni Vision Transformer je bil zasnovan posebej za razvrščanje slik in ni primeren za druge naloge, kot je zaznavanje objektov ali segmentacija. Zaradi tega predlagajo Pyramid Vision Transformer (PVT), ki se zgleduje po arhitekturah CNN z izdelavo vmesnih zemljevidov funkcij z manjšo prostorsko dimenzijo in naraščajočim številom kanalov.

Ta piramidna struktura pomaga modelu pri učenju funkcij na več lestvicah, ki jih je mogoče uporabiti za različne naloge. Model najprej obdela žetone, pridobljene iz zaplat dimenzij 4 × 4, na vsaki stopnji pa žetoni ustrezajo večjim prostorskim dimenzijam zaplat.

Računski stroški klasične samopozornosti so O(N2·d), kjer je N število žetonov v zaporedju in d vektorska dimenzija. Kvadratni računski stroški v smislu števila žetonov postanejo praktična težava s povečanjem ločljivosti vhodne slike, saj vsak žeton v zaporedju ustreza zaplati na sliki.

V literaturi je na voljo več tehnik, s katerimi lahko zmanjšamo računske stroške samopozornosti [26,35,36]. PVT [35] uporablja prostorsko redukcijsko pozornost, ki zmanjša prostorsko velikost vektorjev ključa in vrednosti pred samopozornostjo z operacijo preoblikovanja in linearno projekcijo.

Transformator Swin [36], ki ima prav tako piramidno strukturo, nadomešča blok samopozornosti z modulom, ki ga približuje. Modul združuje sosednje popravke v lokalnih oknih in izvaja operacijo samopreverjanja samo znotraj teh oken.

Za sporočanje informacij z drugimi okni premakne lokalna okna tako, da vsebujejo tudi popravke iz sosednjih oken, in znova izračuna samopozornost. Chu et al. [27] so sprejeli arhitekturo PVT in predlagali podobno metodo za približevanje samopozornosti. Izvajali so tudi lokalno pozornost med popravki v oknu, podobno kot transformator Swin.

Za sporočanje informacij z drugimi okni so izvajali samopozornost med predstavnikom vsakega okna in vsemi drugimi okni. CrossFormer [26] prav tako temelji na PVT. Uporablja pozornost na kratki razdalji, ki je podobna lokalni pozornosti v transformatorju Swin, vendar za uhajanje informacij v druga okna uporablja pozornost na veliko razdaljo, ki izračuna interakcijo med zaplatami, ki imajo fiksno razdaljo med seboj. Prav tako združuje zaplate v več merilih, osredotočene okoli iste slikovne pike, da pridobi žetone za transformatorske bloke, kar pomaga modelu pri učenju medsebojnih interakcij.

Yang et al. [37] predlagajo mehanizem osredotočene pozornosti za učenje tako kratkih kot tudi daljnosežnih interakcij med žetoni, zaradi česar lahko transformatorji vida obdelajo slike visoke ločljivosti. Za vsak zaplat slike žariščni modul samopozornosti izračuna interakcije s prostorsko zaprtimi zaplatami in s povzetimi okni zaplat, ki so bolj oddaljene. Seštevanje oken popravkov poteka prek združevanja in zajema manj informacij, ko so popravki daleč.

RegionViT [38] uporablja arhitekturo PVT in doda dve poti tokenizacije za vsak zemljevid funkcij. Prva pot tokenizacije pridobi regionalne žetone, ki so sestavljeni iz popravkov, ki pokrivajo veliko število slikovnih pik. Druga pot tokenizacije pridobi lokalne žetone, ki zajamejo informacije nizke ravni, tako da vsebujejo nekaj slikovnih pik. Ti dve vrsti žetonov se dovajata kot vhod v regionalno-lokalni transformatorski kodirnik, v katerem se najprej izračuna lastna pozornost med regijami, nato pa med vsakim regionalnim žetonom in njegovimi ustreznimi lokalnimi žetoni.

Arhitektura LeViT [39] združuje tako CNN-je kot tudi mehanizem samopozornosti. Slika se najprej vnese v kodirnik CNN, ki zmanjša prostorske dimenzije in poveča dimenzijo kanala. Nastali zemljevidi funkcij se vnesejo v hierarhični ViT, ki vsebuje modul za krčenje pozornosti med svojimi kodirniki za nadaljnje zmanjšanje prostorskih dimenzij in povečanje dimenzije kanala zemljevidov funkcij.

Arhitekture, ki temeljijo na pozornosti, so bile uporabljene tudi pri nalogah, ki temeljijo na videu, kjer je treba upoštevati časovne informacije. Arhitekture, kot sta ViViT [40] in TimeSformer [41], uporabljajo mehanizem samopozornosti tako v prostorski kot v časovni dimenziji. Zaradi tega se model nauči zajeti prostorske informacije iz vsakega okvirja in spremembe skozi čas.

3. Metoda

V tem razdelku nudimo podroben opis vsake arhitekture in izbranih hiperparametrov. Nadalje opisujemo obdelavo podatkov in predlagane oblikovalske odločitve za prilagoditev transformatorjev vida za delo s skeletnimi zaporedji. Nazadnje opisujemo metode inicializacije, protokol vrednotenja in nabore podatkov o vrednotenju.

3.1. Opis arhitekture

Raziskali smo pet različnih variant Vision Transformers (slika 1), ki so bili razviti za bolj optimizirano računanje na slikah v smislu zmogljivosti navzdol in časa sklepanja. Zlasti raziskujemo klasični ViT [24], CaiT [25], Token2Token ViT [28] in Twins-SVT [27].

Na splošno se okusi transformatorjev vida ukvarjajo z izboljšavami "klasičnega" načina obdelave slik s transformatorji, kot je predlagano v ViT: slike so razdeljene na enako velike in neprekrivajoče se zaplate, ki so sploščene in projicirane v nižji dimenzionalni prostor, da nato obravnavati kot "žetone" na podoben način kot aplikacije NLP. V primeru analize hoje kvadratni obliž ustreza skupini sklepov, ki se spreminjajo v majhnem časovnem oknu.

increase brain power

Standardni transformatorski kodirnik vzame kot vhod zaporedje postavk (X ∈ Rn×d, kjer je n—število postavk, d—vdelana dimenzija) in jih projicira na tri različne učljive matrike teže, pri čemer pridobi poizvedbe (Q ∈ Rn×dq), ključe (K ∈ Rn×dk, dk=dq) in vrednosti (V ∈ Rn×dv), kjer so dq, dk in dv dimenzije za poizvedbe, ključe oziroma vrednosti. Pozornost se izračuna kot:

increase memory power

Za večino arhitektur smo popravili število slojev, glav pozornosti in razsežnosti funkcij, kadar koli je bilo to mogoče. Kot take izberemo 4 plasti s 4 pozornostjo headseach, dimenzijo 512 za omrežje s posredovanjem in končno velikostjo vdelave 128.

improve brain

ViT Vision Transformer [24] pridobi vhodno zaporedje žetonov tako, da sliko razdeli na zaplate in jih linearno projicira na dimenzijo vdelave. Nastalo zaporedje skupaj z žetonom dodatnega razreda (CLS) je podano kot vhod v transformatorski kodirnik. Poleg tega kodirnik ViT uporablja prednormo v nasprotju s postnormalizacijo. Rezultat sloja je mogoče izračunati kot:

improve short term memory

kjer so λl, i in λ0l, i naučljivi parametri. Model tudi ločuje izračun interakcij med vhodnimi žetoni od izračunov vdelave razreda, ki združuje vse globalne informacije. To se naredi s pozornostjo razreda, ki uvede žeton CLS v vhodno zaporedje, potem ko so bile pridobljene interakcije, in zamrzne vse druge žetone. Za kodirnik CaiT smo uporabili enako konfiguracijo kot pri ViT, za kodirnik CLS pa smo uporabili globino 2 plasti.

Token2Token ViT Arhitektura Token2Token [28] vsebuje progresivni proces tokenizacije, ki modelira lokalno strukturo slike s kombiniranjem sosednjih žetonov. Postopek tokenizacije najprej zgradi strukturo, podobno sliki, iz vhodnega zaporedja žetonov s pomočjo modula Reshape. Nato je slika razdeljena na prekrivajoče se zaplate žetonov prek modula Soft Split (SS). Končni izhod iz modula za tokenizacijo se izračuna kot:

increase memory

Za Token2Token smo uporabili 2 plasti z velikostmi popravkov {2, 8} in {2, 4} za prvo plast ter {4, 16} za drugo plast.

Twins-SVT Arhitektura Twins-SVT [27] nadomešča klasičen blok samopozornosti z modulom, imenovanim prostorsko ločljiva samopozornost (SA), ki približa operacijo. SSSA je sestavljen iz lokalno združene samopozornosti (LSA), ki izračuna interakcija samo med žetoni znotraj istega lokalnega okna in globalno podvzorčeno pozornostjo (GSA), ki združuje globalne informacije s samoosredotočanjem med vsemi predstavniki posameznega lokalnega okna, izračunanega s konvolucijo sosednjih žetonov. Operacije sloja aTwins lahko zapišemo kot:

ways to improve brain function

Za kodirnik CrossFormer smo uporabili dimenzije {16, 32, 64, 128} za plasti, globalne velikosti oken {4, 2, 2, 1}, lokalno velikost okna 2, korake navzkrižne vdelave 2 in križ -vdelava velikosti jedra {{2, 4, 8, 16}, {2, 4}, {2, 4}, {2, 4}}.

3.2. Predhodna obdelava podatkov

Za nabore podatkov DenseGait in GREW uporabljamo isti postopek predhodne obdelave. Za vsako ekstrahirano in sledeno zaporedje okostja, ki vsebuje 18 sklepov s koordinatama x in y ter dodatnim rezultatom zaupanja, najprej normaliziramo zaporedje s centriranjem na koordinatah medenice (medenica, medenica) in s skaliranjem vodoravno in navpično, glede na proporce človeškega telesa (tj. razdalja med rameni: |xR.ramo − xL.ramo| in razdaljo od vratu do medenice: |yneck − ypelvis|). Za vsako koordinato (sklep, spoj) vsakega od 18 sklepov v formatu poze COCO uporabimo naslednji normalizacijski postopek:

improve your memory

S postopkom normalizacije so odpravljene razlike med ločljivostjo kamere in oddaljenostjo subjekta od kamere. Poleg tega odstranimo podatke o videzu glede višine in širine subjekta, ki se ne nanašajo na informacije o gibanju. Ta korak je podoben koraku poravnave v sodobnih modelih za prepoznavanje obraza [42]. Poleg tega uporabljamo tudi paketno normalizacijsko plast [43] na začetku vsakega modela za nadaljnjo normalizacijo dobljene slike.

Glede na časovno dimenzijo T (tj. število sličic) in prostorsko dimenzijo skeleta J (tj. število sklepov) so zaporedja naivnega skeleta kodirana kot slike oblike (T, J, 3), kjer je v našem primeru T {{ 1}} in J=18.

improve memory

Večina transformatorjev vida pa predpostavlja, da so slike kvadratne. Zato predlagamo več različic spreminjanja velikosti prostorske dimenzije, tako da se slika pretvori v (T, T, 3), kar je enakovredno umetnemu povečanju števila sklepov (glej sliko 2).

improving brain function


For more information:1950477648nn@gmail.com


Morda vam bo všeč tudi