Novo prostorsko-časovno neprekinjeno prepoznavanje znakovnega jezika z uporabo pozornega omrežja z več funkcijami (2)
Jun 01, 2023
3.5. Učenje zaporedja
Učenje zaporedja Ko dobimo rezultate iz ekstraktorja prostorskih in časovnih značilnosti v obliki sijajnega elementa, jih moramo urediti v celoten stavek. Zato moramo uporabiti učenje zaporedja, da zagotovimo, da se sijaj upravlja za oblikovanje dobrega stavka. Najbolj razširjena metoda v trenutni raziskavi se nanaša na dvosmerni dolgoročni kratkoročni spomin (Bi-LSTM) in konekcionistično časovno klasifikacijo (CTC) [17,23] za probleme, ki jih je mogoče rešiti z uporabo CTC, več nedavnih del [17,23] pa predlaga CTC kot proces usposabljanja od konca do konca za CSLR.

Cistanche ekstrakt v prahu
Kliknite tukaj za ogled izdelkov Cistanche
【Vprašajte za več】 E-pošta:cindy.xue@wecistanche.com/Whats App: 0086 18599088692/Wechat: 18599088692
Dolgi kratkoročni spomin (LSTM) [44] je različica ponavljajoče se nevronske mreže (RNN) in se pogosto uporablja pri modeliranju zaporedja. LSTM odlično modelira dolgoročne odvisnosti; lahko obdela celotne sekvence vhodov in uporabi njihovo notranje stanje za modeliranje prehodov stanj. Vendar pa je pomanjkljivost teh naprej RNN-jev ta, da se skrita stanja naučijo samo iz enosmerne smeri. RNN ustvari skrito stanje, kot je opisano v spodnji enačbi, potem ko prejme zaporedje lastnosti kot vhod.
ht=RNN(ht−1,ot),
kjer ht predstavlja skrito stanje, kjer je začetno stanje h0 fiksen vektor z vsemi ničlami, t pa je časovni korak. RNN se uporablja za napovedovanje sijajev znakov glede na vnos zaporedja prostorskih značilnosti.
Poleg tega so naloge SL precej zapletene. Zato ne zahteva samo lastnosti, prejetih iz enosmernega konteksta, ampak potrebuje tudi pomoč pri uporabi dvosmernih informacij, da se nauči pojavljanja besed, ki so pred in za drugimi besedami v stavku. Posledično uporabljamo Bi-LSTM [45] za učenje kompleksnih dinamičnih odvisnosti slikovnih zaporedij tako, da jih pretvorimo z uporabo prostorskih in časovnih predstavitev v zaporedja sijajnih značilnosti. Po prej navedeni razlagi lahko metoda Bi-LSTM izvaja dvosmerno delo z metodo LSTM. To pomeni, da lahko metoda Bi-LSTM bolje razvrsti zaporedne podatke. Izračun Bi-LSTM, ki uporablja dvosmerna skrita stanja, lahko vidimo tudi kot ponavljajoče se izračune LSTM, ki se obdelujejo od spredaj nazaj in nato od zadaj naprej. Nato se skrito stanje vsakega časovnega koraka prenese skozi popolnoma povezano plast in plast softmax [17].

Cistanche v prahu
pri=W(ht plus b),
yt,j=e at,j ∑ke at,j,
kjer je b vektor pristranskosti in y(t,j) predstavlja verjetnost oznake j v časovnem koraku t. V naši nalogi TSL je oznaka j besedišče, ki je pridobljeno iz stavka. V praksi Bi-LSTM bistveno izboljša količino informacij, do katerih lahko dostopa omrežje, kar posledično izboljša kontekst informacij, ki so na voljo v algoritmu. Informacije vsebujejo znanje o tem, katera beseda je za ali pred trenutnim okvirjem v vnosu zaporedja funkcij stavka.
Bi-LSTM pošlje skrita stanja kot izhod v sloj CTC za vsak časovni korak. Ker rezultati tega Bi-LSTM ne upoštevajo razporeditve sijaja, uporabljamo CTC za obdelavo preslikave video zaporedja o={ot} T 0 t=1 za izdelavo znaka sijajno zaporedje `={` i} IL =1 (L Manjše ali enako T) z boljšo razporeditvijo. CTC se uporablja na številnih področjih, vključno s prepoznavanjem rokopisa [46], prepoznavanjem govora [47] in prepoznavanjem znakovnega jezika [17,23]. V tej domeni se uporablja kot funkcija točkovanja brez poravnave vhodnega in izhodnega zaporedja. V CSLR je CTC znan kot modul, razvit za naloge od konca do konca, ki vključujejo klasifikacijo časovnih podatkov brez segmentacije. Z dinamičnim programiranjem lahko CSLR reši težavo s poravnavo z ustvarjanjem prazne oznake (-), ki sistemu omogoča, da ustvari optimalne rezultate za predstavitev podatkov, ki nimajo oznak (kot so podatki o epentezi in segmenti podatkov, ki niso geste). Zlasti CTC ustvari prazno oznako "-" za razširitev besedišča V, kjer je V=Izvor ∪ {-}. Namen te prazne oznake je predstaviti prehod in obvestiti o obstoju praznega sijaja, ki ne zagotavlja informacij za učni proces, kot π={πt} T 0 t{{20 }}, kjer je πt ∈ V. Posledično lahko CTC upravlja izhodne parametre iz prostorskega in časovnega ekstraktorja značilnosti in tudi Bi-LSTM kot modula poravnave s povzemanjem verjetnosti vseh možnih poti. Vse poti poravnave π imajo verjetnost, da je podano vhodno zaporedje, kot sledi [17]:

Poskus Cistanche deserticola
p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt
V naslednjem koraku definiramo operacijo preslikave več proti ena B, ki odstrani vse prazne prostore in podvoji besede s poti poravnave. Na primer B (II-sem- -a- -zdravnik)=jaz, sem, a, zdravnik. Posledično lahko izračunamo pogojno verjetnost zaporedja sijaja znaka l kot vsoto verjetnosti vseh poti, ki se lahko preslikajo v l iz B, na način, opisan spodaj [17]:
p(π|o) = ∑ π∈B−1 p(π|o)
kjer je B −1 (l)={π|B(π)=l} inverzna operacija B. Končno so izgube CTC zaporedja značilnosti definirane kot sledi [17]:
Lctc=− ln p(` |o)
Pogojno verjetnost p(π|X) lahko izračunamo v skladu s predpostavko pogojne neodvisnosti.
4. Eksperimentalni rezultati in razprava

Dodatek Cistanche blizu mene - izboljšanje spomina
V tem razdelku bomo razložili podrobnosti našega poskusa s predlagano konfiguracijo, kot je razloženo v prejšnjem razdelku.
4.1. Nabori podatkov
V tem razdelku razlagamo nabore podatkov, ki smo jih uporabili med tem poskusom. Uporabili smo dva nabora podatkov, prvi je nabor podatkov CSL [8,40,41], drugi pa nabor podatkov RWTH-PHOENIX [33,39]. Oba nabora podatkov sta neprekinjena nabora podatkov znakovnega jezika, ki se uporabljata za prevajanje nekaterih nizov potez v polni stavek.
4.1.1. Nabor podatkov CSL
Nabor podatkov CSL je uporabilo več del [8,40,41]. V tem naboru podatkov je skupaj 100 stavkov in 178 besed, ki se pogosto uporabljajo v vsakodnevni komunikaciji. Ta niz podatkov v povprečju vsebuje 5 besed na stavek. Vsak stavek je 50 podpisnikov izvedlo 5-krat. Tako je skupno število videoposnetkov 25,000, zaradi česar je to eden največjih naborov podatkov. Za usposabljanje našega modela CSL smo nabor podatkov razdelili na podatke za usposabljanje z 20,000 videoposnetki in za testiranje s 5000 videoposnetki istega stavka, vendar z različnimi podpisniki.
4.1.2. Nabor podatkov RWTH-PHOENIX
Nabor podatkov RWTH-PHOENIX [33,39] je nabor podatkov nemškega znakovnega jezika, ki je posnetek javnih vremenskih oddaj televizijskih postaj v Nemčiji. Ta video je obdelan tako, da ima velikost 210 × 260. Obstaja 6841 različnih stavkov, ki jih je podpisalo 9 različnih podpisnikov. Vsi podpisniki so nosili temna oblačila na svetlem ozadju. Skupno je 1232 besed s približno 80,000 glosami. Ta nabor podatkov je razdeljen v skladu z vnaprej določeno obliko, sestavljeno iz 5672 vzorcev za usposabljanje, 540 vzorcev za preverjanje veljavnosti/razvoj in 629 vzorcev za testiranje.
4.2. Predhodna obdelava podatkov
Prva stvar, ki smo jo morali storiti, je bila vnaprejšnja obdelava našega nabora podatkov, da bo ustrezal predlaganemu modelu. Izvedli smo spreminjanje velikosti in obrezovanje, kot je prikazano na sliki 3; na levi strani lahko vidimo, da so bili prvotni podatki velikosti polne visoke ločljivosti ali ločljivosti 1920 × 1080. Morali smo ga obrezati in spremeniti velikost na ločljivost 224 × 224, saj naš prostorski modul prejme vhod, ki je enake velikosti kot vhod ResNet50. Nato smo podatke vnesli v naš prostorski model, ki bi ustvaril tenzor 7 × 7 iz ene same slike.
Vnaprej obdelana slika polnega formata je bila nato uporabljena za ustvarjanje funkcij ključnih točk. Za predvidevanje 133 ključnih točk iz teh RGB slik smo uporabili model HRNet. Vendar pa v predlaganem modelu uporabljamo le 27 ključnih točk zgornjega dela telesa. Velikost vnosa za funkcije ključnih točk je 27 × 3, ker imamo podatke o koordinatah 3-osi (x, y in z) na točko. Vhodna dimenzija modela je N × 224 × 224 × 3 za funkcijo polnega formata in N × 1 × 27 × 3 za vnos ključne točke, kjer je N število okvirjev. Za izboljšanje variacije nabora podatkov sledimo razširitvi iz [12], vključno z naključnim obrezovanjem, vodoravnim obračanjem in naključnim časovnim skaliranjem. Naključno obrezovanje se uporablja tudi kot del koraka predprocesiranja za obrezovanje izvirne slike.

Dodatek Cistanche blizu mene - izboljšanje spomina
4.3. Metrika vrednotenja
Za ovrednotenje uspešnosti prepoznavanja našega predlaganega modela uporabljamo metriko stopnje napak pri besedah (WER), ki je metrika, ki se običajno uporablja v CSLR za oceno natančnosti prepoznavanja predvidenega stavka, kot prikazuje spodnja enačba [17]:
WER=S plus I plus DT=S plus I plus DS plus C plus D
kjer je S število zamenjav izvirne besede, I je število vstavkov, ki jih ni v izvirnem stavku, D je število izbrisov, ki bi morali biti v izvirnem stavku, C je število pravilnih besed, ki se ujemajo prvotni stavek, T pa je skupno število besed v stavku ali ki jih je mogoče dobiti iz skupnega števila zamenjav, izbrisov in pravilnih besed. Za CSL se vsak znak uporablja za predstavitev besede.
4.4. Preizkusite vhodne tokove
Ta poskus se osredotoča predvsem na primerjavo enotokovnega in večtokovnega vnosa na našem modelu. Cilj je najti najboljšo konfiguracijo vhodnega toka. V tem poskusu uporabljamo samo nabor podatkov RWTH-PHOENIX. Naš model bi prejel dva ločena vhoda, celozaslonski in ključni vhod. Vhod z enim tokom uporablja samo funkcijo RGB iz slike polnega formata. Obstajata dva poskusa vnosa z enim tokom. Prvi uporablja samo funkcijo polnega formata iz slike RGB, drugi pa uporablja funkcije ključnih točk iz vnosa ključnih točk. Večtokovni vhod, ki ga predlagamo, je sestavljen iz funkcij RGB in ključnih točk. Rezultat primerjave z uporabo enega toka in večtoka je prikazan v tabeli 1. Tukaj lahko vidimo, da lahko z uporabo funkcije več tokov dosežemo boljši rezultat kot z uporabo enega samega toka. Glavni tok je pridobljen iz funkcije RGB polnega formata, dodatni tok pa uporablja funkcije ključnih točk. Dodatni tok ključnih točk pomaga modelu, da se bolje uči, zlasti pri zajemanju podrobnosti oblike roke.
Tabela 1. Primerjava zmogljivosti WER z uporabo enega in večtokovnega vhoda.

4.5. Preizkusite modul pozornosti
Cilj tega poskusa je bil izbrati najboljšo konfiguracijo modula pozornosti. V tem poskusu uporabljamo konfiguracijo najboljšega rezultata iz prejšnjega rezultata poskusa in istega nabora podatkov. Prostorsko pozornost označujemo kot model s plastjo samopozornosti na koncu prostorskega modula za vsako funkcijo. Zgodnja časovna pozornost je plast samopozornosti po prvem časovnem združevanju, pozna časovna pozornost pa je plast samopozornosti po drugem časovnem združevanju. Tukaj bomo primerjali vse zgornje konfiguracije in kombinacijo prostorske in časovne pozornosti. Rezultat je prikazan v tabeli 2. Rezultat prostorske pozornosti je slabši od časovne pozornosti. Prostorski nivo vsebuje zaporedje funkcij za vsak okvir. Kot je omenjeno v [20], se sloj samopozornosti lažje nauči krajše poti med dolgimi odvisnostmi. Zato prostorska pozornost ne uspe zmanjšati WER zaradi dolgega zaporedja. Po drugi strani pa smo lahko dobili izboljšan rezultat z uporabo časovne pozornosti, tako da smo jo postavili po združevanju, da bi dobila krajšo dolžino zaporedja. Pozna pozornost, ki ima najkrajšo dolžino zaporedja, doseže najboljši rezultat. Še več, kombinacija modula pozornosti v prostorskem in časovnem je slabša od uporabe samo posamezne pozornosti. Na podlagi teh rezultatov uporabimo najboljšo konfiguracijo za nadaljnje poskuse.
Tabela 2. Primerjava zmogljivosti WER z uporabo različnih konfiguracij pozornosti

4.6. Eksperiment ablacije na omrežju STAMF
Poleg tega izvedemo poskus ablacije z istim naborom podatkov in najboljšo konfiguracijo vhodnega toka in modula pozornosti. Tabela 3 o eksperimentu z uporabo pozne časovne pozornosti brez združevanja dokazuje, da dolžina zaporedja vpliva na zmogljivost pozornosti. Poskusi, ki uporabljajo združevanje plasti s krajšimi dolžinami zaporedja, dajejo boljše rezultate. Izvajamo tudi poskus ablacije, da ugotovimo učinkovitost z uporabo različnih modelov za učenje zaporedja. Rezultat v tabeli 4 kaže, da ima uporaba LSTM, ki ima samo enosmerne informacije, nižjo zmogljivost kot uporaba Bi-LSTM, ki ima dvosmerne informacije.
Tabela 3. Primerjava zmogljivosti WER z uporabo različnih konfiguracij pozne časovne pozornosti.

Tabela 4. Primerjava zmogljivosti WER z uporabo različnih konfiguracij učenja zaporedja.

4.7. Eksperiment na omrežju STAMF
V tem razdelku razložimo celoten proces usposabljanja za naš predlagani model, imenovan prostorsko-časovno pozoren več funkcij (STAMF). To bo zajemalo, kako korak za korakom prilagodimo naše vhodne podatke prostorskemu modulu, časovnemu modulu in modulu učenja zaporedja. V tem razdelku uporabljamo večtočni vnos in konfiguracijo pozne časovne pozornosti.
4.7.1. Podrobnosti izvedbe
Izvajamo usposabljanje in testiranje od konca do konca z uporabo vhodnih okvirjev z velikostmi 224 × 224. Za optimizator uporabljamo optimizator Adam z 10-4 kot stopnjo učenja in jo delimo z 2 v epohah 10 in 15 za CSL in epohe 30, 40 in 60 za RWTH PHOENIX. Velikost serije nastavimo na 4 in izvedemo 80 epoh za RWTH-PHOENIX in 20 epoh za CSL. Usposabljanje in testiranje sta potekala na NVIDIA Tesla V100 in 128G RAM-u.
Sprva smo funkcijo ekstrahirali iz tokov RGB z uporabo ResNet50 in uporabili HRNet za pridobitev ključne točke ter nato ekstrahirali funkcije ključne točke z uporabo ResNet50. Upoštevajte, da smo imeli opravka z zaporednimi podatki ali videoposnetkom. Zato smo morali velikost vnosa konfigurirati glede na dolžino videa. Zaradi tehničnih razlogov je morala biti velikost vnosa za vse podatke med seboj enaka. Zato moramo poznati najdaljši videoposnetek v našem naboru podatkov, nato pa smo našo vhodno dolžino okvirja dopolnili, da se ujema z največjo številko okvirja
Te zaporedno ekstrahirane lastnosti je uporabil časovni modul. Vsak zaporedni tok je šel skozi dvoskladno časovno združevanje. Vsako časovno združevanje je bilo sestavljeno iz 1-dimenzionalne konvolucijske mreže in največjega združevalnega sloja, ki je zmanjšal dolžino zaporedja za polovico. Izhod časovnega združevanja iz obeh tokov je bil nato povezan s plastjo pozornosti in za zadnje časovno združevanje, za plastjo pozornosti, je bil na koncu združen kot izhod časovnega modula.
Časovni izhod je obdelal modul za učenje zaporedja. Postopek je uporabil sloj Bi-LSTM, povezan s CTC, da bi dosegel končno poravnavo in sestavil sijaj v končni stavek.
4.7.2. Kvantitativni rezultat
Končne stavke so primerjali z osnovno resnico, da bi izračunali oceno WER kot kvantitativni rezultat. Za CSL smo nabor podatkov razdelili na 80 odstotkov za podatke o usposabljanju in 20 odstotka za podatke o testiranju. Kot je prikazano v tabeli 5, lahko naš predlagani model z več funkcijami (STMF), ki uporablja funkcije polnega formata in ključne točke, doseže boljši rezultat in zmanjša WER na 0,8 v primerjavi z modelom, ki uporablja samo funkcijo polnega formata [23]. Naš najboljši rezultat je bil dosežen s predlaganim modelom z več funkcijami z uporabo mehanizma pozornosti (STAMF), ki je dosegel 0,7 za WER. Plast pozornosti je vseeno nekoliko izboljšala rezultat, čeprav nabor podatkov CSL ni imel okvarjenih okvirjev. To dokazuje, da plast pozornosti vpliva na model. Sam predlagani model z več funkcijami je boljši od najsodobnejših metod in plast pozornosti prispeva k znižanju ocene WER na naboru podatkov CSL. Ključna točka na CSL daje pomemben vpliv, ker lahko daje učinkovite informacije v primerjavi z drugo metodo z več funkcijami [17], ki uporablja roke, obraz in položaj telesa.
Za nabor podatkov RWTH-PHOENIX smo uporabili umetno konfiguracijo za razdelitev podatkov o usposabljanju in testiranju. Nabor podatkov je bil razdeljen na 5672 vzorčnih videoposnetkov za usposabljanje, 540 vzorčnih videoposnetkov za samopreverjanje in 629 vzorčnih videoposnetkov za testiranje. Kot je prikazano v tabeli 6, je imel naš predlagani model z več funkcijami (STMF) rezultat z uporabo celotne slike in funkcij ključnih točk 24 odstotkov WER, naš najboljši rezultat pa je bil 20,5 odstotka, pridobljen s predlaganim modelom z uporabo modula pozornosti (STAMF). v rezultatu treninga. Rezultati testa so drugi najboljši v primerjavi z [17], saj kot vhod uporabljajo več funkcij. Vendar se je izkazalo, da modul pozornosti pomembno prispeva k znižanju ocene WER za nabor podatkov RWTHPHOENIX. Za razliko od našega rezultata za nabor podatkov CSL naš predlagani model z večtokovnim tokom ni dosegel optimalnega rezultata. To je zato, ker ima nabor podatkov RWTH-PHOENIX veliko okvarjenih okvirjev; imajo zamegljen del, zlasti v predelu rok. Ta okvir daje nedosledne informacije o ključnih točkah zaradi manjkajočega ali nepravilnega položaja ključnih točk in naredi model manj optimalen. To težavo rešimo tako, da našemu predlaganemu modelu z več funkcijami dodamo plast pozornosti, ki pomaga izbrati pravilne informacije in povzroči znatno izboljšanje v primerjavi s predlaganim modelom z več funkcijami brez pozornosti.
Tabela 5. Primerjava zmogljivosti WER na naboru podatkov CSL.

Tabela 6. Primerjava zmogljivosti WER na naboru podatkov RWTH-PHOENIX.

4.7.3. Kvalitativni rezultat
Izvedli smo tudi kvalitativno vrednotenje našega modela z vizualizacijo rezultata prepoznavanja. Slika 8 prikazuje podrobnosti našega kvalitativnega vrednotenja z uporabo treh vzorcev stavkov. Prvi stavek je sestavljen iz 10 besed in skupno število okvirjev je 220. Drugi stavek je sestavljen iz 12 besed in skupno število okvirjev je 168. Tretji stavek je sestavljen iz 9 besed in skupno število okvirjev je 135.
Rezultat vzorca kaže, da nekateri sijaji niso pravilno predvideni z modeli, kar označujemo z rdečo oznako. Še vedno pa lahko predvidi večino pravilnih besed. Največ napak je v prvem stavku, ki ima najdaljšo številko okvirja. V tem stavku ima začetek stavka več napak, zaradi več potez za zgodnje besede, ki se le malo razlikujejo, zato je težko razlikovati meje. Predlagani model z več značilnostmi in pozornostjo (STAMF) pa bi lahko identificiral več besed, vendar so bile napačno označene. Poleg tega konfiguracija modela s pozornostjo doseže boljši rezultat prepoznave za druga dva vzorca v primerjavi s predlaganim modelom brez pozornosti.

Slika 8. Kvalitativno vrednotenje rezultata prepoznavanja z uporabo drugačne konfiguracije nabora podatkov RWTH-PHOENIX [33,39]. Napačno predvideni sijaji so označeni z rdečo barvo.
5. Sklepi
V tem prispevku predstavljamo novo prostorsko-časovno pozorno večfunkcijsko funkcijo (STAMF) za CSLR, katere cilj je naučiti se prostorsko-časovnih korelacije in pomembnih informacij iz zaporedja vizualnih značilnosti in funkcij ključnih točk v pristopu od konca do konca. V našem okviru je bil razvit prostorski modul s funkcijo polnega formata iz podatkov RGB in ključnimi točkami iz ključnih točk telesa, vključno z rokami kot več funkcijami. Te kombinacije, ki so bile uporabljene kot vnos funkcij večtokov, so zagotovile vrhunsko zmogljivost v primerjavi z najsodobnejšim pristopom, ki uporablja samo polno sliko, ali v primerjavi z metodo Slika 8. Kvalitativno vrednotenje rezultata prepoznavanja z uporabo drugačne konfiguracije RWTH - Nabor podatkov PHOENIX [33,39]. Napačno predvideni sijaji so označeni z rdečo barvo. 5. Zaključki V tem prispevku predstavljamo novo prostorsko-časovno pozorno večfunkcijsko funkcijo (STAMF) za CSLR, katere cilj je naučiti se prostorsko-časovnih korelacij in pomembnih informacij iz zaporedja vizualnih značilnosti in funkcij ključnih točk v končni fazi. končni pristop. V našem okviru je bil razvit prostorski modul s funkcijo polnega formata iz podatkov RGB in ključnimi točkami iz ključnih točk telesa, vključno z rokami kot več funkcijami. Te kombinacije, uporabljene kot vhod funkcij z več tokov, so zagotovile vrhunsko zmogljivost v primerjavi z najsodobnejšim pristopom, ki uporablja samo polno sliko, ali v primerjavi z metodo, ki uporablja drugo kombinacijo več funkcij, zlasti za nabor podatkov CSL. Nato predlagamo časovni modul, sestavljen iz časovnega združevanja in časovne pozornosti za zajemanje pomembnih informacij v časovni domeni. Dodatek pozne časovne pozornosti je sposoben pridobiti pomembno značilnost iz zaporedja, ki ima napačne informacije, in daje znatno izboljšanje v primerjavi z našim predlaganim modelom z več funkcijami. Pomaga tudi pri učenju zaporedja, da se bolje uči, in izboljša učinkovitost kot v poskusu nabora podatkov CSL. Obsežni poskusi na pogosto uporabljenih naborih podatkov dokazujejo superiornost našega predlaganega modela v primerjavi z najsodobnejšim modelom z rezultati WER, ki so se zmanjšali za več kot 50 odstotkov za nabor podatkov CSL in zmanjšali za 5 odstotkov za nabor podatkov RWTH-PHOENIX. V prihodnosti nameravamo implementirati tehniko prenosnega učenja z našim trenutnim modelom in uporabiti svoje tekoče delo v resnični industriji.
Reference
1. Dreuw, P.; Rybach, D.; Deselaers, T.; Zahedi, M.; Ney, H. Tehnike prepoznavanja govora za sistem za prepoznavanje znakovnega jezika. V zborniku INTERSPEECH 2007, 8. letna konferenca Mednarodnega združenja za govorno komunikacijo, Antwerpen, Belgija, 27.–31. avgust 2007; str. 2513–2516.
2. Ong, SCW; Ranganath, S. Samodejna analiza znakovnega jezika: Anketa in prihodnost onstran leksikalnega pomena. IEEE Trans. Vzorec analnega. Mach. Intell. 2005, 27, 873–891. [CrossRef] [PubMed]
3. Vogler, C.; Metaxas, D. Okvir za prepoznavanje simultanih vidikov ameriškega znakovnega jezika. Računalništvo. Vis. Razumevanje slike 2001, 81, 358–384. [CrossRef]
4. Bowden, R.; Windridge, D.; Kadir, T.; Zisserman, A.; Brady, M. Vektor jezikovnih značilnosti za vizualno interpretacijo znakovnega jezika. V zborniku Evropske konference o računalniškem vidu (ECCV), Praga, Češka, 11.–14. maj 2004; strani 390–401.
5. Kasukurthi, N.; Rokad, B.; Bidani, S.; Dennisan, DA Prepoznavanje abecede ameriškega znakovnega jezika z uporabo globokega učenja. arXiv 2019, arXiv:1905.05487.
6. Koller, O.; Zargaran, S.; Ney, H.; Bowden, R. Deep Sign: Omogočanje robustnega statističnega neprekinjenega prepoznavanja znakovnega jezika prek hibridnih CNN-HMM. Int. J. Računalništvo. Vis. 2018, 126, 1311–1325. [CrossRef]
7. Pu, J.; Zhou, W.; Li, H. Razširjeno konvolucijsko omrežje z iterativno optimizacijo za neprekinjeno prepoznavanje znakovnega jezika. V zborniku sedemindvajsete mednarodne skupne konference o umetni inteligenci, Stockholm, Švedska, 13.–19. julij 2018; str. 885–891.
8. Pu, J.; Zhou, W.; Li, H. Iterativno usklajevalno omrežje za neprekinjeno prepoznavanje znakovnega jezika. V zborniku konference IEEE Computer Society o računalniškem vidu in prepoznavanju vzorcev, Long Beach, CA, ZDA, 15.–20. junij 2019; str. 4160–4169.
9. Kumar, N. Sledenje človeškega obraza in rok za prepoznavanje znakovnega jezika na podlagi poti gibanja. V zborniku 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, Indija, 26.–28. oktober 2017; strani 211–216.
10. Bhuyan, MK; Ghoah, D.; Bora, PK Ogrodje za prepoznavanje kretenj rok z aplikacijami za znakovni jezik. V zborniku letne indijske konference 2006, INDICON, New Delhi, Indija, 15.–17. september 2006; str. 1–6.
11. Das, SP; Talukdar, AK; Sarma, KK Prepoznavanje znakovnega jezika z obrazno ekspresijo. V zborniku Procedia Computer Science, Kerala, Indija, 10.–13. avgust 2015; strani 210–216.
12. Rastgoo, R.; Kiani, K.; Escalera, S.; Sabokrou, M. Produkcija znakovnega jezika: pregled. V zborniku konference IEEE/CVF 2021 o delavnicah računalniškega vida in prepoznavanja vzorcev (CVPRW), Nashville, TN, ZDA, 19.–25. junij 2021; str. 3446–3456.
13. Dong, S.; Wang, P.; Abbas, K. Anketa o poglobljenem učenju in njegovih aplikacijah. Računalništvo. Sci. Rev. 2021, 40, 100379. [CrossRef]
14. Athitsos, V.; Neidle, C.; Sclaroff, S.; Nash, J.; Štefan, A.; Yuan, Q.; Thangali, A. Nabor video podatkov leksikona ameriškega znakovnega jezika. V zborniku konference IEEE Computer Society 2008 o delavnicah računalniškega vida in prepoznavanja vzorcev, delavnice CVPR, Anchorage, Aljaska, 23.–28. junij 2008; str. 1–8.
15. Bungeroth, J.; Stein, D.; Dreuw, P.; Ney, H.; Morrissey, S.; Way, A.; Zijl, LV Korpus znakovnega jezika ATIS. V zborniku 6. mednarodne konference o jezikovnih virih in vrednotenju, LREC 2008, Marakeš, Maroko, 28.–30. maj 2008; str. 2943–2946.
16. Papastratis, I.; Chatzikonstantinou, C.; Konstantinidis, D.; Dimitropulos, K.; Daras, P. Tehnologije umetne inteligence za znakovni jezik. Senzorji 2021, 21, 5843. [CrossRef] [PubMed]
17. Zhou, H.; Zhou, W.; Zhou, Y.; Li, H. Prostorsko-časovno omrežje z več iztočnicami za neprekinjeno prepoznavanje znakovnega jezika. V zborniku AAAI 2020 – Štiriintrideseta konferenca AAAI o umetni inteligenci, New York, NY, ZDA, 7.–12. februar 2020; str. 13009–13016.
18. Gündüz, C.; Polat, H. Prepoznavanje turškega znakovnega jezika, ki temelji na zlitju večtočnih podatkov. Turški J. Electr. inž. Računalništvo. Sci. 2021, 29, 1171–1186. [CrossRef]
19. Bohaček, M.; Hruz, M. Transformer na podlagi znakovne poze za prepoznavanje znakovnega jezika na ravni besed. V zborniku zimske konference IEEE/CVF o aplikacijah delavnic računalniškega vida 2022, WACVW, Waikoloa, HI, ZDA, 4.–8. januar 2022; strani 182–191.
20. Vaswani, A. Pozornost je vse, kar potrebujete. V zborniku konference o sistemih za obdelavo nevronskih informacij, Long Beach, CA, ZDA, 4.–9. december 2017; str. 1–11.
21. Zhou, M.; Ng, M.; Cai, Z.; Cheung, KC Popolnoma začetna omrežja, ki temeljijo na samopozornosti, za neprekinjeno prepoznavanje znakovnega jezika. Spredaj. Artif. Intell. Appl. 2020, 325, 2832–2839.
22. Camgöz, NC; Koller, O.; Hadfifield, S.; Bowden, R. Transformatorji znakovnega jezika: skupno prepoznavanje in prevajanje znakovnega jezika od konca do konca. V zborniku konference IEEE Computer Society o računalniškem vidu in prepoznavanju vzorcev, Seattle, WA, ZDA, 14.–19. junij 2020; str. 10020–10030.
23. Min, Y.; Hao, A.; Čaj, X.; Chen, X. Omejitev vizualne poravnave za neprekinjeno prepoznavanje znakovnega jezika. V zborniku Mednarodne konference IEEE o računalniškem vidu (ICCV), Montreal, BC, Kanada, 10.–17. oktober 2021; str. 11542–11551.
24. Guo, D.; Zhou, W.; Wang, M.; Li, H. Prepoznavanje znakovnega jezika na podlagi prilagodljivih HMM z razširitvijo podatkov. V zborniku mednarodnih konferenc IEEE o obdelavi slik (ICIP), Phoenix, AZ, ZDA, 25.–28. september 2016; str. 2876–2880.
25. Huang, J.; Zhou, W.; Li, H.; Li, W. Prepoznavanje znakovnega jezika z uporabo 3D konvolucijskih nevronskih mrež. V zborniku IEEE International Conference on Multimedia and Expo (ICME), Torino, Italija, 29. junij–3. julij 2015; str. 1–6.
26. Guo, D.; Zhou, W.; Li, H.; Wang, M. Spletna zgodnja-pozna fuzija, ki temelji na prilagodljivem HMM za prepoznavanje znakovnega jezika. ACM Trans. Multimed. Računalništvo. Komun. Appl. 2017, 14, 1–18. [CrossRef]
27. Al-hammadi, M.; Muhammad, G.; Član, S. Prepoznavanje kretenj rok za znakovni jezik z uporabo 3DCNN. IEEE Access 2020, 8, 79491–79509. [CrossRef]
28. Reza, H.; Jože, V. MS-ASL: Obsežen nabor podatkov in merilo za razumevanje ameriškega znakovnega jezika. arXiv 2019, arXiv:1812.01053.
29. Li, D.; Opazo, CR; Ju, X.; Li, H. Globoko prepoznavanje znakovnega jezika na ravni besed iz videa: nov nabor podatkov v velikem obsegu in primerjava metod. V zborniku zimske konference IEEE 2020 o aplikacijah računalniškega vida, WACV, Snowmass Village, CO, ZDA, 1.–5. marec 2020; str. 1448–1458.
30. Pu, J.; Zhou, W.; Li, H. Prepoznavanje znakovnega jezika z večmodalnimi funkcijami. V zborniku konference o multimediji Pacifiškega obroča, Xi'an, Kitajska, 15.–16. september 2016; strani 252–261.
31. Jiang, S.; Sonce, B.; Wang, L.; Bai, Y.; Li, K.; Fu, Y. Skeleton Aware Multi-modal Sign Language Recognition. V zborniku konference IEEE Computer Society o delavnicah računalniškega vida in prepoznavanja vzorcev, Nashville, TN, ZDA, 19.–25. junij 2021; str. 3408–3418.
32. Sidig, AAI; Luqman, H.; Mahmud, S.; Mohandes, M. KArSL: Zbirka podatkov o arabskem znakovnem jeziku. ACM Trans. Asian Low-Resour. Lang. Inf. Obdelava 2021, 20, 1–19. [CrossRef]
33. Koller, O.; Forster, J.; Ney, H. Neprekinjeno prepoznavanje znakovnega jezika: K sistemom za statistično prepoznavanje velikega besedišča, ki obravnavajo več podpisnikov. Računalništvo. Vis. Razumevanje slike 2015, 141, 108–125. [CrossRef]
34. Koller, O.; Camgoz, NC; Ney, H. Šibko nadzorovano učenje z večtoki CNN-LSTM-HMM za odkrivanje zaporednega paralelizma v videoposnetkih znakovnega jezika. IEEE Trans. Vzorec analnega. Mach. Intell. 2020, 42, 2306–2320. [CrossRef] [PubMed]
35. Camgoz, NC; Hadfifield, S.; Koller, O.; Bowden, R. SubUNets: Hand Shape od konca do konca in neprekinjeno prepoznavanje znakovnega jezika. V zborniku mednarodnih konferenc IEEE o računalniškem vidu (ICCV) 2017, Benetke, Italija, 22.–29. oktober 2017; str. 3075–3084.
36. Dong, C.; Loy, CC; On, K.; Tang, X. Super-ločljivost slike z uporabo globokih konvolucijskih omrežij. IEEE Trans. Vzorec analnega. Mach. Intell. 2014, 38, 295–307. [CrossRef] [PubMed]
37. Bressem, KK; Adams, LC; Erxleben, C.; Hamm, B.; Niehues, SM; Vahldiek, JL Primerjava različnih arhitektur globokega učenja za klasifikacijo radiografij prsnega koša. Sci. Rep. 2020, 10, 13590. [CrossRef]
38. Sonce, K.; Xiao, B.; Liu, D.; Wang, J. Deep High-resolution Representation Learning for Human Položaj Estimation. V zborniku konference IEEE Computer Society o računalniškem vidu in prepoznavanju vzorcev, Long Beach, CA, ZDA, 15.–20. junij 2019; str. 5686–5696.
39. Koller, O.; Zargaran, S.; Ney, H. Re-Sign: Ponovno poravnano modeliranje zaporedja od konca do konca z globokimi ponavljajočimi se CNN-HMM. V zborniku konference IEEE 2017 o računalniškem vidu in prepoznavanju vzorcev (CVPR), Honululu, HI, ZDA, 21.–26. julij 2017; str. 3416–3424.
40. Zhou, H.; Zhou, W.; Li, H. Dinamično dekodiranje psevdo oznak za neprekinjeno prepoznavanje znakovnega jezika. V zborniku 2019 IEEE International Conference on Multimedia and Expo (ICME), Šanghaj, Kitajska, 18.–21. julij 2019; str. 1282–1287.
41. Xiao, Q.; Chang, X.; Zhang, X.; Liu, X. Prepoznavanje znakovnega jezika na podlagi videa brez časovne segmentacije. V zborniku dvaintridesete konference AAAI o umetni inteligenci, New Orleans, LA, ZDA, 2.–7. februar 2018; str. 2257–2264.
42. Graves, A.; Fernández, S.; Gomez, F.; Schmidhuber, J. Konekcionistična časovna klasifikacija: označevanje nesegmentiranih zaporednih podatkov s ponavljajočimi se nevronskimi mrežami. V zborniku ICML '06: zbornik 23. mednarodne konference o strojnem učenju, Pittsburgh, PA, ZDA, 25.–29. junij 2006; str. 369–376.
43. Graves, A.; Liwicki, M.; Fernández, S.; Bertolami, R.; Bunke, H.; Schmidhuber, J. Nov konekcionistični sistem za neomejeno prepoznavanje rokopisa. IEEE Trans. Vzorec analnega. Mach. Intell. 2009, 31, 855–868. [CrossRef]
44. Guo, D.; Zhou, W.; Li, H.; Wang, M. Hierarhični LSTM za prevajanje v znakovni jezik. V zborniku konference AAAI o umetni inteligenci, New Orleans, LA, ZDA, 2.–7. februar 2018; str. 6845–6852.
45. Rahman, MM; Watanobe, Y.; Nakamura, K. Dvosmerni jezikovni model LSTM za vrednotenje in popravilo kode. Symmetry 2021, 13, 247. [CrossRef]
46. Hu, W.; Cai, M.; Chen, K.; Ding, H.; Sonce, L.; Liang, S.; Mo, X.; Huo, Q. Sequence Discriminative Training for Offlfline Handwriting Recognition by an Interpolated CTC and Lattice-Free MMI Objective Function. V zborniku Mednarodne konference o analizi in prepoznavanju dokumentov, ICDAR, Kjoto, Japonska, 9.–15. november 2017; 1. zvezek, str. 61–66.
47. Yoshimura, T.; Hayashi, T.; Takeda, K.; Watanabe, S. Samodejno prepoznavanje govora od konca do konca, integrirano z zaznavanjem glasovne dejavnosti na osnovi CTC. V zborniku ICASSP, mednarodne konference IEEE o akustiki, govoru in obdelavi signalov, Barcelona, Španija, 4.–8. maj 2020; str. 6999–7003.
48. Guo, D.; Wang, S.; Tian, Q.; Wang, M. Gosto časovno konvolucijsko omrežje za prevajanje znakovnega jezika. V zborniku osemindvajsete mednarodne skupne konference o umetni inteligenci (IJCAI-19), Macao, Kitajska, 10.–16. avgust 2017; strani 744–750.
49. Wang, S.; Guo, D.; Zhou, W.; Ža, Z.; Wang, M. Konekcionistična časovna fuzija za prevajanje znakovnega jezika. V zborniku 26. mednarodne konference ACM o multimediji, Seul, Koreja, 22.–26. oktober 2018; str. 1483–1491.
50. Jang, Z.; Shi, Z. SF-Net: Omrežje s strukturiranimi funkcijami za neprekinjeno prepoznavanje znakovnega jezika. arXiv 2019, arXiv:1908.01341.
51. Cheng, KL; Yang, Z.; Chen, Q.; Tai, Y. Popolnoma konvolucijska omrežja za neprekinjeno prepoznavanje znakovnega jezika. V zborniku Evropske konference o računalniškem vidu, Glasgow, Združeno kraljestvo, 23.–28. avgust 2020; str. 697–714.
52. Koller, O.; Ney, H.; Bowden, R. Deep Hand: Kako usposobiti CNN za 1 milijon ročnih slik, ko so vaši podatki neprekinjeni in šibko označeni. V zborniku 2016 IEEE konference o računalniškem vidu in prepoznavanju vzorcev (CVPR), Las Vegas, NV, ZDA, 27.–30. junij 2016; str. 3793–3802.
53. Slimane, FB Kontekst je pomemben: samopozornost za prepoznavanje znakovnega jezika. arXiv 2021, arXiv:2101.04632.
54. Niu, Z.; Mak, B. Stohastično drobnozrnato označevanje znakovnih glosov z več stanji za neprekinjeno prepoznavanje znakovnega jezika. V zborniku Evropske konference o računalniškem vidu, Glasgow, Združeno kraljestvo, 23.–28. avgust 2020; str. 1–16.
55. Cui, R.; Liu, H.; Zhang, C. Globoko nevronsko ogrodje za neprekinjeno prepoznavanje znakovnega jezika s ponavljajočim se usposabljanjem. IEEE Trans. Multimed. 2019, 21, 1880–1891. [CrossRef]
56. Pu, J.; Zhou, W.; Hu, H.; Li, H. Spodbujanje neprekinjenega prepoznavanja znakovnega jezika prek razširitve navzkrižne modalnosti. V zborniku 28. mednarodne konference ACM o multimediji, Seattle, WA, ZDA, 12.–16. oktober 2020; str. 1497–1505.






