Prepoznavanje govora samoglasnikov iz podganje elektroencefalografije z uporabo nevronske mreže dolgega kratkoročnega spomina 1. del

Dec 27, 2023

Povzetek

V preteklih letih je bilo izvedenih veliko raziskav za preučevanje mehanizmov zaznavanja in prepoznavanja govora.

Med zaznavanjem govora in spominom obstaja neločljiva povezava. Zaznavanje govora je pomembna sposobnost, da se zavedamo zvočnih signalov, spomin pa je pomemben način, ki ga uporabljamo za shranjevanje in pridobivanje informacij. Ko bolje zaznavamo govor, si tudi bolje zapomnimo informacije, ki jih slišimo.

Raziskave kažejo, da je odnos med zaznavanjem govora in spominom dvosmeren. Po eni strani lahko slabo zaznavanje govora povzroči motnje spomina. To je zato, ker ko govora ne slišimo jasno, se ne moremo natančno spomniti informacij, ki smo jih slišali. Po drugi strani pa lahko močno zaznavanje govora izboljša naš spomin. Ko pravilno zaznavamo in razumemo govor, si tudi lažje zapomnimo slišano.

Zato bi se morali osredotočiti na negovanje naših sposobnosti zaznavanja govora, da bi izboljšali svoj spomin. To lahko dosežemo z urjenjem naših sposobnosti poslušanja in razumevanja govora. Svojo zaznavo govora in spomin lahko izboljšamo z dejavnostmi, kot so poslušanje posnetkov, gledanje filmov in obiskovanje jezikovnih tečajev.

Skratka, obstaja tesna povezava med zaznavanjem govora in spominom, zato bi se morali osredotočiti na negovanje svojih sposobnosti zaznavanja govora, da bi izboljšali svoj spomin. Z aktivnim treningom in vadbo lahko nenehno izboljšujemo stopnjo zaznave govora ter bolje razumemo in si zapomnimo, kar slišimo. Vidi se, da moramo izboljšati spomin, in Cistanche deserticola lahko bistveno izboljša spomin, saj lahko Cistanche deserticola uravnava tudi ravnovesje nevrotransmiterjev, kot je povečanje ravni acetilholina in rastnih faktorjev. Te snovi so zelo pomembne za spomin in učenje. Poleg tega lahko meso izboljša pretok krvi in ​​spodbuja dostavo kisika, kar lahko zagotovi, da možgani prejmejo dovolj hranilnih snovi in ​​energije, s čimer se izboljša vitalnost in vzdržljivost možganov.

increase brain power

Kliknite Know za izboljšanje kratkoročnega spomina

Elektroencefalografija (EEG) je močno orodje za prepoznavanje možganske aktivnosti; zato se pogosto uporablja za določanje nevronske osnove prepoznavanja govora.

Zlasti pri klasifikaciji prepoznavanja govora so v središču pozornosti pristopi, ki temeljijo na globokem učenju, ker se lahko samodejno učijo in izločijo reprezentativne značilnosti z učenjem od konca do konca.

Namen te študije je bil identificirati posebne komponente, ki so potencialno povezane s predstavitvijo fonemov v podganjih možganih, in razlikovati možgansko aktivnost za vsak samoglasniški dražljaj na podlagi enega samega poskusa z uporabo omrežja dvosmernega kratkoročnega spomina (BiLSTM) in klasičnih metod strojnega učenja.

Uporabili smo 19 samcev podgan Sprague-Dawley, ki so bili podvrženi operaciji implantacije mikroelektrod za snemanje EEG signalov iz dvostranskih sprednjih slušnih polj. Izbranih je bilo pet različnih glasovnih dražljajev, /a/, /e/, /i/, /o/ in /u/, ki imajo zelo različne formantne frekvence. EEG, posnet pod naključno danimi samoglasniškimi dražljaji, je bil minimalno predhodno obdelan in normaliziran s transformacijo z-rezultatov, da se uporabi kot vhodni podatek za klasifikacijo prepoznavanja govora.

Omrežje BiLSTM je pokazalo najboljšo uspešnost med klasifikatorji z doseganjem splošne natančnosti, ocene f{{0}}in vrednosti Cohenovega κ 75,18%, 0,75 oziroma 0,68, z uporabo pristopa 10-fold cross-validation.

Ti rezultati kažejo, da lahko plasti LSTM učinkovito modelirajo zaporedne podatke, kot je EEG; zato je mogoče informativne funkcije izpeljati prek BiLSTM, usposobljenega z učenjem od konca do konca, brez dodatnih ročno izdelanih metod ekstrakcije funkcij.

Uvod

Govor prenaša ogromne količine informacij v možgane in ena od tipičnih lastnosti možganov je prepoznavanje in kategoriziranje zvokov vedenja živali.

Glede na njegov pomen poskusi raziskovanja mehanizmov prepoznavanja zvoka govora potekajo že več kot 100 let. Eno prvih nevrolingvističnih študij prepoznavanja govora je v sedemdesetih letih 19. stoletja z opazovalno študijo izvedel nemški nevropsihiater, ki je ugotovil ključno vlogo zgornje temporalne vijuge pri zaznavanju govora in ugotovil, da so pomanjkljivosti v prepoznavanju govora povezane s poškodbo leve zgornje temporalne vijuge [ 1].

Znano je, da se prepoznavanje govora opira predvsem na dorzolateralne temporalne režnje, vključno z zgornjim temporalnim vijugom, ki vsebuje primarno slušno skorjo (A1) in sprednje slušno polje (AAF) [2].

increase memory

Čeprav je način, kako so fonemi kodirani in razloženi v možganih, še vedno sporen, je bilo splošno sprejeto, da je prepoznavanje zvoka kategorično. To pomeni, da je diskriminacija boljša za dražljaje, ki pripadajo različnim fonetskim kategorijam, kot za dražljaje, ki pripadajo isti kategoriji, tudi če so akustične razlike enakovredne [3, 4].

Ne le ljudje, ampak tudi živalski zaznavni sistemi razvrščajo nenehno spreminjajoče se zvočne dražljaje v nabor ločenih kategorij [5].

Z napredkom v nevrofizioloških študijah se elektroencefalografija (EEG) pogosto uporablja v raziskavah, ki vključujejo nevroznanost in nevronski inženiring [6].

Zaradi visoke časovne ločljivosti in občutljivosti na različna funkcionalna stanja možganov je EEG močno orodje za raziskovanje možganske aktivnosti v realnem času, zato se povečuje zanimanje za osvetlitev nevralne osnove za kategorično zaznavanje. Tradicionalno se signali EEG v študijah na ljudeh neinvazivno snemajo z lasišča. Na ravni zaznavanja zvoka ali govora se negativnost neusklajenosti (MMN), komponenta slušnega evociranega potenciala (AEP), ki jo izzovejo čudni zvoki, pogosto uporablja za preučevanje nevronskih korelatov kategoričnega zaznavanja [7, 8]. Naatanen et al. našel dokaze za od jezika odvisne predstavitve samoglasnikov v človeških možganih [9].

Druga študija je preučevala kategorično zaznavanje leksikalnih tonov in ugotovila, da je kontrast med kategorijami izzval večji MMN kot razlikovanje znotraj kategorije [10]. V poskusih na živalih so bili z invazivnimi postopki pridobljeni natančnejši signali EEG.

Na primer, nevronske korelate kategoričnega zaznavanja in živčne reprezentacije različnih zvokov so proučevali z uporabo zunajceličnega snemanja akcijskega potenciala.

Nevroni ptic pevk, ki projicirajo striatum, kažejo kategorične slušne odzive in so zelo občutljivi na spremembe v trajanju not [11]. Poleg tega so Kilgard et al.preučevali različne nevronske reprezentacije soglasnikov in samoglasnikov z uporabo intraparenhimskega zapisa v možganih podgan. S snemanjem več- in enoenotnih odzivov iz spodnjega kolikulusa in A1 so predlagali, da števec konice kodira samoglasnike, medtem ko števec konice kodira soglasnike [12, 13].

Učinke treninga zvočne diskriminacije pri podganjem modelu avtizma so raziskali tudi na podlagi predhodnih ugotovitev, ki povezujejo živčne odzive na zvočne dražljaje s sposobnostjo zaznavanja zvoka [14].

Poleg tega je nedavna študija pokazala, da elektrokortikografija, posneta z večkanalnim nizom, korelira s pasivno izpostavljenostjo določenemu zvoku celo v slušni skorji anesteziranih podgan [15].

Pristopi strojnega učenja so bili uporabljeni za praktično uporabo EEG v številnih študijah. Uporaba metod strojnega učenja omogoča raziskovanje bogatih informacij, ki so neločljivo povezane in jih je težko odkriti iz signalov EEG [6].

Zato je mogoče klasifikacijo na podlagi EEG izvesti na naslednjih področjih prek običajnih algoritmov strojnega učenja (npr. stroj podpornih vektorjev (SVM), k-nearest neighbours (KNN) in naivni Bayes (NB)): motorične slike, prepoznavanje čustev, odkrivanje duševnih bolezni, odkrivanje z dogodki povezanih potencialov (ERP) in tako naprej [16, 17].

improve your memory

Poleg tega je v zadnjih letih zaradi vse večjega napredka grafičnih procesnih enot in razpoložljivosti velikih naborov podatkov postalo mogoče izvajati klasifikacijo na podlagi EEG z uporabo različnih omrežij globokega učenja [6, 18, 19]. V primerjavi z običajnimi metodami strojnega učenja , lahko omrežja globokega učenja samodejno zaznajo in izvlečejo ustrezne predstavitve iz vhodnih podatkov [20, 21].

Zato je mogoče tudi z nezadostnim predhodnim strokovnim znanjem pridobiti obetavne rezultate z algoritmi poglobljenega učenja, ki ne zahtevajo dodatnega ročno izdelanega procesa ekstrakcije funkcij [22, 23].

Na primer, na področju govora, slik in videa so bili rezultati bistveno izboljšani z uporabo algoritmov globokega učenja [24–26]. Vendar ni jasno, ali taki boljši rezultati vedno spremljajo domeno klasifikacije, ki temelji na EEG, kadar se uporabljajo pristopi globokega učenja namesto tradicionalnih metod strojnega učenja [27].

Roy in drugi so pokazali, da je v večini študij (razen štirih od 102 študij) pristop globokega učenja vodil do višje učinkovitosti kot tradicionalni pristop strojnega učenja, največje izboljšanje natančnosti pa je bilo 35,3 % [18, 28].

Poleg tega se med različnimi področji klasifikacijskih študij, ki temeljijo na EEG, študije klasifikacije ERP aktivno izvajajo z uporabo običajnega strojnega učenja in metod poglobljenega učenja.

V zgodnji študiji je bila tradicionalna metoda velikega povprečenja uporabljena za izboljšanje nizkega razmerja med signalom in šumom (SNR), ki je ena od omejitev signalov EEG, in za pridobitev signalov ERP.

V teh študijah je bilo več komponent ERP obravnavanih kot nizi funkcij za klasifikacijo [29, 30]. V študijah na živalih se za razlikovanje signalov ERP uporabljajo tudi značilnosti ERP, kot sta najvišja amplituda in zakasnitev [31, 32].

Vendar je bila veliko pozornosti deležna tudi klasifikacija na podlagi EEG na podlagi enega poskusa, saj je znano, da imajo podatki EEG na ravni enega poskusa več funkcionalnih in bogatih informacij kot signali ERP, pridobljeni s tradicionalno metodo velikega povprečenja [33, 34].

Zato so v poznejših študijah funkcije, ekstrahirane z različnimi algoritmi, kot so algoritmi na osnovi valov [35], modeli Gaussove mešanice [36] in prostorsko filtriranje [37] za klasifikacijo z uporabo običajnih metod strojnega učenja [38, 39]. Vendar ekstrahiranje optimalnega ročno izdelanih funkcij iz EEG z enim poskusom je dolgotrajen in delovno intenziven, ker je treba izvesti dodatne korake obdelave. V tem kontekstu lahko metode globokega učenja ublažijo to težavo, tako da omogočijo učenje od konca do konca.

Najbolj razširjena arhitektura globokega učenja je konvolucijska nevronska mreža (CNN), ki ji sledi ponavljajoča se nevronska mreža (RNN). CNN je posebna vrsta arhitekture globokega učenja, ki se pogosto uporablja za klasifikacijo na podlagi EEG v enem poskusu [6]. Vhodni podatki CNN izhajajo iz neobdelanih ali predhodno obdelanih podatkov EEG, predvsem v naslednji obliki: število kanalov × število časovnih točk v enem poskusu.

Poleg tega so bili prikazani precejšnji rezultati klasifikacije in znano je, da se najbolje obnese pri uporabi slik spektrogramov kot vhodnih podatkov [40–44]. V nasprotju s CNN je RNN zelo prednostna arhitektura, zlasti pri obdelavi zaporednih podatkov (kot v aplikacijah za obdelavo naravnega jezika), ker ponavljajoča se povezava učne arhitekture RNN omogoča rekurzivno uporabo prejšnjih informacij omrežja kot trenutnih vhodnih podatkov [45]. ].

Dolgotrajni kratkoročni spomin (LSTM) je nekakšna arhitektura RNN, ki sta jo predlagala Hochreiter in Schmidhuber za premagovanje težav z eksplozivnim in izginjajočim gradientom RNN [46]. Dvosmerni LSTM (BiLSTM) je nadaljnji razvoj LSTM, ki združuje skrite plasti naprej in nazaj za dostop do predhodnih in naslednjih informacij.

Čeprav je model BiLSTM veliko bolj zapleten in morda potrebuje dodatno računalniško moč, se pričakuje, da bo bolje rešil nalogo zaporednega modeliranja in klasifikacije kot LSTM [47].

Prej smo poskušali razvrstiti signale EEG na podlagi enega poskusa za tri samoglasnike, /a/,/o/ in /u/, z uporabo tehnik strojnega učenja za človeške možgane.

Po uporabi ustreznih algoritmov za obdelavo signalov, vključno z razgradnjo večvariantnega empiričnega načina (MEMD), so bili odzivi EEG učinkovito razvrščeni glede na vsak samoglasniški zvok z uporabo klasifikatorja linearne diskriminantne analize (LDA). Iz časovno-frekvenčne predstavitve (TFR) signalov EEG je bilo tudi ugotovljeno, da so komponente pasu alfa najbolj povezani nevronski odzivi zaznavanja zvoka samoglasnika [48].
Vendar pa je treba zaradi nizkega SNR človeških signalov EEG predstavitev fonemov v možganih dodatno oceniti z bolj invazivno tehniko snemanja, ki omogoča pridobitev bolj zanesljivih signalov EEG.

Poleg tega je treba izvesti nadaljnje študije o učinkovitosti klasifikacije vsakega algoritma strojnega učenja pri klasifikaciji odzivov EEG na različne foneme.

Primarni namen te študije je bil določiti specifične komponente EEG, ki bi lahko bile povezane z govorno predstavitvijo v možganih podgan, da bi dodatno osvetlili odzive možganov na prepoznavanje zvoka govora.

Za pridobitev natančnejših signalov EEG so bili epiduralni signali EEG kot odziv na slušne dražljaje zabeleženi v AAF, za katerega je znano, da igra bistveno vlogo pri slušnem zaznavanju in kategorizaciji [2]. Poleg tega je ta študija poskušala razločiti različne odzive možganov za vsak govorni zvok na podlagi enega poskusa z uporabo omrežij LSTM in drugih običajnih tehnik strojnega učenja.

Domnevali so, da bi bilo omrežje BiLSTM primerno za razvrščanje odzivov EEG na samoglasniške dražljaje in bi preseglo druge klasične klasifikatorje, ker lahko omrežje deluje robustno pri modeliranju dolgoročnih odvisnosti zaporednih podatkov, kot je EEG. Kolikor je avtorju znano, omrežja LSTM niso bila uporabljena za klasifikacijo odzivov EEG na slušne dražljaje, in to je prva študija, ki uporablja algoritem globokega učenja za analizo epiduralnih EEG signalov iz AAF.

improving brain function

Poleg tega so bili z uporabo algoritma globokega učenja odzivi EEG razvrščeni kot slušni dražljaji z uporabo učenja od konca do konca z minimalno vnaprej obdelanimi signali EEG brez dodatnih metod ekstrakcije značilnosti.


For more information:1950477648nn@gmail.com


Morda vam bo všeč tudi