Izboljšano pridobivanje parametrov funkcij iz govornih signalov z uporabo algoritma strojnega učenja (1)
May 30, 2023
Povzetek: Prepoznavanje govora se nanaša na zmožnost programske ali strojne opreme, da sprejme govorni signal, identificira govorčeve lastnosti v govornem signalu in nato prepozna govorca. Na splošno postopek prepoznavanja govora vključuje tri glavne korake: akustično obdelavo, ekstrakcijo značilnosti in klasifikacijo/prepoznavanje. Namen ekstrakcije značilnosti je ponazoriti govorni signal z uporabo vnaprej določenega števila komponent signala. To je zato, ker so vse informacije v akustičnem signalu preveč okorne za obdelavo in nekatere informacije so nepomembne pri nalogi identifikacije. Ta študija predlaga pristop, ki temelji na strojnem učenju, ki izvaja ekstrakcijo parametrov funkcij iz govornih signalov za izboljšanje delovanja aplikacij za prepoznavanje govora v okoljih pametnih mest v realnem času. Poleg tega se načelo preslikave bloka glavnega pomnilnika v predpomnilnik učinkovito uporablja za zmanjšanje računalniškega časa. Velikost bloka predpomnilnika je parameter, ki močno vpliva na zmogljivost predpomnilnika. Predvsem izvajanje takih procesov v sistemih v realnem času zahteva visoko računsko hitrost. Hitrost obdelave igra pomembno vlogo pri prepoznavanju govora v sistemih v realnem času. Zahteva uporabo sodobnih tehnologij in hitrih algoritmov, ki povečajo pospešek pri pridobivanju parametrov lastnosti iz govornih signalov. Težave s overclockingom med digitalno obdelavo govornih signalov še niso popolnoma odpravljene. Eksperimentalni rezultati kažejo, da predlagana metoda uspešno izlušči značilnosti signala in doseže brezhibno učinkovitost klasifikacije v primerjavi z drugimi običajnimi algoritmi za prepoznavanje govora.

Cistanche deserticola
Ključne besede: prepoznavanje govora; vzporedno računalništvo; porazdeljeno računalništvo; večjedrni procesor; ekstrakcija funkcij; spektralna analiza
1. Uvod
Vzpostavitev komunikacijskih pristopov med človekom in računalniško tehnologijo je kritična naloga sodobne umetne inteligence. Eden najpreprostejših načinov za uporabnike, da vnesejo informacije, so z govornimi signali. Zato so tehnologija obdelave govornih signalov in njena orodja postala nujen del informacijske družbe. Prepoznavanje govora je bistven raziskovalni vidik obdelave govornega signala in pomembna tehnika interakcije med človekom in računalnikom. Govorni signali vsebujejo semantične, osebne in okoljske informacije [1]. Splošni pristop k obdelavi govornega signala je uporaba kratkoročne analize, pri kateri je signal razdeljen na časovna okna fiksne velikosti ob predpostavki, da se parametri signala ne spreminjajo. Med okni je postavljeno prekrivanje, da se zagotovi natančnejša predstavitev signala. Algoritmi ekstrakcije funkcij, kot sta spektralna analiza in linearna napoved, se uporabijo za vsako okno. Vendar morajo ti postopki upoštevati tudi hitrost in čas.

Puščavski ginseng
Čas je pomembna skrb na več področjih obdelave signalov v realnem času. Razmerje hitrosti obdelave je mogoče povečati z učinkovito uporabo virov procesorja in razvojem novih in hitrih algoritmov za skrajšanje časa digitalne obdelave. Vendar težave z visoko zmogljivim računalništvom še niso v celoti rešene [2]. Poleg tega je bil z razvojem strojne in programske opreme za digitalno obdelavo signalov dosežen znaten napredek pri samodejnem prepoznavanju govora. Kljub temu napredku pa se stroji ne morejo kosati z zmogljivostjo svojih človeških primerkov v smislu natančnosti in hitrosti prepoznavanja, zlasti pri prepoznavanju govora, neodvisnem od govorca. Tako se je veliko raziskav o prepoznavanju govora osredotočilo na težave s prepoznavanjem govora, ki so neodvisne od govorca, zaradi širokega nabora aplikacij in omejitev razpoložljivih tehnik prepoznavanja govora [3].
Če povzamemo, so glavni prispevki študije naslednji:

Čistančev čaj
Kliknite tukaj za ogled izdelkov čaja Cistanche deserticola
【Vprašajte za več】 E-pošta:cindy.xue@wecistanche.com/Whats App: 0086 18599088692/Wechat: 18599088692
Postopek identifikacije osebe z govornimi signali je sestavljen iz več stopenj. Med njimi nekateri koraki zahtevajo več časa za izračun. To je spektralna analiza. Eden od parametrov, ki je še posebej pomemben pri algoritmih strojnega učenja, je čas usposabljanja. V tem delu smo ugotovili, da je postopek ekstrakcije značilnosti pomemben za identifikacijo govornih signalov. Poleg tega strojno učenje zahteva veliko časa. Ugotovljeno je, da je proces spektralne analize sestavljen iz neodvisnih operacij, možna pa je paralelizacija.
Eksperimenti so pokazali, da spektralne transformacije FFT in DCT dajejo dobre rezultate pri spektralni analizi. Postopek spektralne analize velja za vsak segment govornega signala. To nam omogoča jasno razlikovanje teh lastnosti od govornega signala. S pomočjo orodij OpenMP in TBB je bil razvit vzporedni računalniški algoritem, ki je omogočil pohitritev izračunov.
Velikost segmenta je pomembna pri razdelitvi govornega signala na segmente. Med poskusi je bilo ugotovljeno, da je velikost segmenta govornega signala odvisna od predpomnilnika centralnega procesorja. Zlasti je bilo ugotovljeno, da ujemanje segmenta z velikostjo predpomnilnika v večjedrnih procesorjih pozitivno vpliva na računsko hitrost pri strojnem učenju.
Predlagana je nova metoda vzporedne implementacije za spektralne transformacije signalov za ekstrakcijo parametrov lastnosti iz govornih signalov z uporabo algoritma strojnega učenja na večjedrnih procesorjih z uporabo TBB in OpenMP.
Ugotovljeno je bilo tudi, da lahko učinkovita uporaba načela preslikave glavnega pomnilniškega bloka v predpomnilnik in velikosti bloka predpomnilniškega pomnilnika poveča hitrost obdelave.

Cistanche dodatek blizu mene-izboljšanje spomina
Preostanek tega dokumenta je organiziran na naslednji način. Razdelek 2 pregleduje obstoječe študije za ekstrakcijo specifičnih lastnosti govornega signala. Razdelek 3 opisuje korake ekstrakcije funkcij s poskusi. Razdelek 4 podrobno predstavlja predlagani visoko zmogljiv računalniški algoritem za ekstrahiranje parametrov lastnosti iz govornih signalov. Eksperimentalni rezultati, ki temeljijo na naši izvedbi, so obravnavani v razdelku 5. Razdelek 6 poudarja omejitve predlagane metode. Na koncu 7. razdelek zaključuje študijo s povzemanjem ugotovitev in ugotavljanjem prihodnjih raziskovalnih usmeritev.
2. Sorodna dela
Trenutno se razvijajo in izboljšujejo nove metode, algoritmi in sodobnejše aplikacije za segmentacijo govornih signalov in izračun parametričnih indikatorjev izbranih fragmentov, s čimer se ustvari spektrogram govornih signalov s spektralno analizo [4–7]. Identifikacija govorca z raznolikimi glasovnimi posnetki po vsem svetu je ključna in zahtevna naloga, zlasti pri pridobivanju močnih in diskriminativnih značilnosti [8]. Nov sistem za ekstrakcijo Mel Frequency Cepstral Coefficients (MFCC), ki je hitrejši in energetsko učinkovitejši od tradicionalne realizacije MFCC, so predlagali Korkmaz et al. [9]. Namesto visokoprepustnega filtra za predhodno poudarjanje so uporabili nizkopasovni filter. Implementirali so pasovni filter z visokofrekvenčnim filtrom, ker je za povečanje energije signala v visokih frekvencah potrebno predhodno poudarjanje. V našem prejšnjem delu [10] smo predstavili novo metodo za identifikacijo govorcev, ki temelji na MFCC. Namesto običajnih MFCC uporabljamo slikovne pike iz spektrograma Mel kot nabor funkcij. Spektrogram je bil preoblikovan v matriko 2-D za ustvarjanje novega nabora podatkov. Za identifikacijo govorca je bilo uporabljenih več učnih algoritmov s tehniko 10-kratnega navzkrižnega preverjanja. S pomočjo večslojnega perceptrona (MLP) s funkcijo aktivacije tanh je bila dosežena najboljša natančnost 90,2 odstotka.
Ekstrakcija značilnosti se doseže s spreminjanjem valovne oblike govora v obliko parametrične predstavitve pri relativno nižji hitrosti prenosa podatkov za kasnejšo obdelavo in analizo [11–14]. Pristopi ekstrakcije značilnosti običajno dajejo večdimenzionalni vektor značilnosti za vsak govorni signal. Ekstrakcija funkcij je najpomembnejši del prepoznavanja govorca. Značilnosti govora imajo ključno vlogo pri ločevanju govorca od drugih. Ekstrakcija funkcij zmanjša velikost govornega signala, ne da bi pri tem poškodovala moč govornega signala [15–17]. V [18] so avtorji uvedli nov pristop, ki izkorišča natančno nastavitev parametrov velikosti in premika okna za spektralno analizo, ki se uporablja za izračun začetne kratkočasovne Fourierjeve transformacije, da bi izboljšali zmogljivost samodejnega prepoznavanja govora, odvisnega od govorca. (ASR) sistem. V odsotnosti zdravnikov lahko laiki uporabljajo sisteme za pomoč pri odločanju, ki so bili ustvarjeni s pristopi umetne inteligence. Zgodnje in neinvazivno odkrivanje stanja srca je mogoče doseči z uporabo signalov fonokardiograma (PCG) [19–21].
Dokazano je, da konvolucijske nevronske mreže (CNN) uspešno simulirajo strukturno lokalnost v prostoru značilnosti, kot tudi uporabljajo združevanje znotraj pristranskega frekvenčnega območja za zmanjšanje translacijske variacije in prilagajanje motnjam in majhnim spremembam v prostoru značilnosti [22]. Mukhamadiyev et al. predlagal globoko nevronsko mrežo, skrito od konca do konca, model prepoznavanja govora po Markovljevem modelu in hibridno povezovalno časovno klasifikacijsko (CTC) omrežje pozornosti za uzbeški jezik in njegova narečja. Predlagani pristop skrajša čas usposabljanja in izboljša natančnost prepoznavanja govora z učinkovito uporabo funkcije cilja CTC pri usposabljanju modela pozornosti [23]. Ekstrakcija značilnosti in klasifikacija z uporabo modela enodimenzionalne konvolucijske nevronske mreže (CNN), ki deli signale srčnega zvoka na normalne in nenormalne neposredno neodvisno od elektrokardiograma (EKG), je bila predlagana v [24]. Trdijo, da je natančnost klasifikacije višja v 1D CNN kot v 2D CNN za signale srčnega zvoka, uporabljene v tej študiji, ko je konvolucijsko jedro manjše od 52, ker lahko veliko konvolucijsko jedro povzroči računsko kompleksnost in je vse bolj zamudno. . V [25] je bila globoka nevronska mreža usposobljena za maksimiranje posteriorne natančnosti zaporedij stanj akustičnih modelov v zvezi s sekvencami govornih značilnosti z uporabo baze podatkov TIMIT (TIMIT Acoustic-Phonetic Continuous Speech Corpus).
3. Predhodna obdelava: Pregled materiala

Cistanche dodatek blizu mene-izboljšanje spomina
V ta namen je nepogrešljiv razvoj hitrih algoritmov za ekstrakcijo značilnih parametrov iz govornih signalov in parametričnih predstavitev, ekstrakcija koristnih in informativnih vzorcev za obdelavo ter razvoj programov za izvedbo spektrogramov izbranih akustičnih segmentov.
Sistemi za prepoznavanje govora so sestavljeni iz dveh glavnih podsistemov:
Primarna obdelava govornih signalov (fonogram);
Klasifikacija akustičnih simbolov z uporabo inteligentnega algoritma (spektrogram).
Prvi podsistem generira akustične simbole kot niz informativnih akustičnih lastnosti signalov in karakteristik signalov. Drugi podsistem pretvori govorni signal v parametrično obliko na podlagi pridobljenih akustičnih karakteristik. Obdelava govornega signala je sestavljena iz naslednjih stopenj:
Ločevanje meja govornega signala;
Digitalno filtriranje;
Segmentacija;
Uporaba gladilnega okna;
Spektralna transformacija in normalizacija spektralnih frekvenc.
Ti koraki se v veliki meri uporabljajo za pridobivanje parametrov funkcij iz govornih signalov, njihove glavne značilnosti pa so obravnavane v nadaljevanju.
3.1. Ločitev meja
Izločanje samo delov govora iz dohodnega signala ali določanje začetnih in končnih trenutkov stavka v hrupnem okolju je bistvena naloga pri obdelavi govora. Za rešitev tega problema se uporabljajo naslednje lastnosti govornega signala: kratkotrajna energija govornega signala, število točk, ki se sekajo v ničli, gostota porazdelitve vrednosti polja tišine znotraj signala in spektralna entropija. Tradicionalni sistemi za prepoznavanje govora uporabljajo tehnike, ki temeljijo na prehodnih in spektralnih energijah signala (npr. zaznavanje glasovne aktivnosti), da določijo govorne meje iz dohodnih govornih signalov [26–28].
Glavna parametra govornega signala sta kratkotrajna energija govornega signala in število točk, ki gredo skozi nič. Praviloma se parametri govornega signala skozi čas hitro spreminjajo; zato je običajno govorni signal obdelati v fragmente dolžine od 10 do 30 ms, ki se ne prekrivajo. Govorni signal znotraj tega območja miruje, območja tišine v govornem signalu pa se odstranijo z izračunom prehodne energije. Algoritem za rešitev tega problema je razdeljen na N zaporedij po 256 kratkotrajnih energijskih vrednosti naslednjega govornega signala.
Izračun energije posameznega fragmenta z delitvijo govornega signala je primeren za vzporedno in porazdeljeno računalništvo. Vsak fragment je neodvisno obdelan. Če obdelavo uporabimo v n-jedrnem večprocesorju, bo mogoče hkrati izračunati energijo n fragmentov. Zato je mogoče v tej fazi povečati učinkovitost vzporedne obdelave [29–32].
3.2. Število ničelnih prehodov
Prečkanje ničle je točka, v kateri se predznak matematične funkcije spremeni (npr. iz pozitivnega v negativnega), kar je predstavljeno s presekom osi (ničelna vrednost) v grafu funkcije [33]. Frekvenca prečkanja ničle v signalu je lahko najbolj preprost pokazatelj njegovih spektralnih lastnosti. Na primer, število točk, ki gredo skozi nič v govornem signalu, je mogoče določiti z naslednjo enačbo:

Slika 1. Metoda ločevanja govora na podlagi spektralne entropijske analize.
3.3. Digitalno filtriranje
Poleg tipičnega uporabnega signala so prisotne različne vrste šuma. Ker hrup negativno vpliva na kakovost sistemov za prepoznavanje govora, je spopadanje s hrupom pereč problem. Za zmanjšanje ravni hrupa v sistemu se uporabljata dve vrsti digitalnih filtrov: linijski filter in začetni filter. Linearni filter lahko štejemo za kombinacijo nizko- in visokofrekvenčnih filtrov, saj zajame vse nizke in visoke frekvence. Začetno filtriranje se uporabi za zmanjšanje vpliva lokalnih motenj na značilne oznake, ki se uporabljajo za kasnejšo identifikacijo. Govorni signal je treba prenesti skozi nizkopasovni filter za spektralno poravnavo [35].
3.4. Segmentacija
Segmentacija je postopek delitve govornega signala na diskretne fragmente, ki se ne prekrivajo. Signal je običajno razdeljen na govorne enote, kot so stavki, besede, zlogi, fonemi ali celo manjše fonetične enote. Segmentacija posnetkov, ki vsebujejo izjave številnih govorcev, je lahko sestavljena iz pripisovanja delov izjav določenim govorcem. Izraz "segmentne postaje" se včasih uporablja za razdelitev govornega signala v okvirje pred njegovo parametrizacijo [36,37].
3.5. Spektralna transformacija
Treba je razlikovati glavne značilnosti govornih signalov, ki se uporabljajo v kasnejših fazah procesa prepoznavanja govora. Začetne značilnosti so določene z analizo spektralnih lastnosti govornih signalov. Za pridobitev spektralne frekvence govornega signala se pogosto uporablja algoritem hitre Fourierove transformacije [38,39].
3.6. Normalizacija spektralnih frekvenc
Celoten računski proces v inteligentnih algoritmih temelji na premikanju decimalnih števil. Zato so parametri predmetov, ki so razvrščeni z uporabo nevronskih mrež, omejeni na obseg [{{0}}.0, 1.0]. Nastali spekter se normalizira med 0 in 1, da se uporabi spektralna obdelava z uporabo nevronske mreže. Da bi to dosegli, je vsaka vektorska komponenta razdeljena na največje komponente.
Metode spektralne obdelave omogočajo uporabo vseh vzorcev podatkov, ki jih pridobimo iz govornega signala. Mnogi govorni signali imajo specifično frekvenčno strukturo in spektralne lastnosti. Spektralne metode zagotavljajo visoko natančno obdelavo govornih signalov. Slabosti spektralne obdelave vključujejo nizko prilagodljivost lokalnih značilnosti signalov, pomanjkanje spektralnih dimenzij in relativno visoke računske stroške.
Fourierjeva transformacija, valovna analiza in številni drugi algoritmi se v veliki meri uporabljajo pri spektralni obdelavi govornih signalov. Fourierjeva transformacija se uporablja na številnih področjih znanosti, vključno z obdelavo govora. Pri obdelavi govornega signala Fourierjeva transformacija pretvori signal iz časovnega polja v spektralno polje kot frekvenčno komponento [40].
V prejšnjih študijah so bile za spektralno analizo uporabljene diskretna Fourierjeva transformacija (DFT), diskretna kosinusna transformacija (DCT), kratkoročna Fourierjeva transformacija in valovna transformacija. Te metode so bile uporabljene za transformacijo fragmentov govornega signala v frekvenčno domeno in izračun spektra. Za ustvarjanje vzporednih algoritmov za spektralne transformacije sta bila uporabljena paketa TBB in OpenMP. Pri teh metodah ukaz razdeli signal na okvirje; na primer N=16, 32, … ali 4096 za vsak okvir [4]. Velikost vsakega ustvarjenega okvirja je enaka velikosti bloka predpomnilnika, ker je predpomnilnik dejavnik, ki vpliva na učinkovitost vzporedne obdelave. Rezultati pospeševanja so prikazani na sliki 2.

Slika 2. Rezultati pospeševanja za (a) štiri- in (b) osemjedrne procesorje.
Za programsko izvedbo algoritmov vzporednega procesiranja je bilo izvedeno serijsko in vzporedno procesiranje na štiri- in osemjedrnih procesorjih, ki so bili uporabljeni s pomočjo osebnih računalnikov in strežnikov, kot je navedeno v tabeli 1.
Tabela 1. Značilnosti procesorjev Intel.

Glavna značilnost algoritma DCT je periodičnost. Prednost DCT je, da večino energije signala osredotoči na majhno število dejavnikov. Naslednje enačbe zagotavljajo elemente matrike koeficientov:


kjer je L(k) vrednost DCT, k je indeks koeficientov, x(n) predstavlja podatkovne postavke in N je velikost okvirja.
Parametri Fourierjeve analize so osnova metod, ki se uporabljajo za generiranje značilnih vektorjev v večini sistemov za prepoznavanje govora pri digitalni obdelavi govornih signalov znotraj spektralne domene. Mel-frekvenčni kepstralni koeficienti (MFCC) [41] in tehnike linearnega prediktivnega kodiranja (LPC) [42,43] se uporabljajo v Fourierjevi analizi za ustvarjanje slik spektrogramov iz govornih signalov. Spektri, dobljeni s Fourierjevo analizo, zagotavljajo jedrnate in natančne informacije o govornem signalu, kot je prikazano na sliki 3.

Slika 3. DFT: (a) sprememba frekvenčnega območja znotraj časovne domene in (b) spektrogram.
V poskusih so bili za spektralno analizo uporabljeni dvodimenzionalni (2D) signali. Značilnosti 2D spektralne analize, ki se uporabljajo v algoritmih vzporedne obdelave slik, so primerne za vzporedno obdelavo v večjedrnih procesorjih [38]. Predvsem vektorji in matrike pretvorbe naprej in obratno imajo binarne dimenzije, združljivost te večjedrne procesorske arhitekture pa lahko učinkovito poveča hitrost računanja. Zato smo za strojno izvedbo algoritmov, ki smo jih uporabljali za obdelavo 2D signalov, uporabili sekvenčno in vzporedno procesiranje na računalniku z različnimi procesorskimi karakteristikami (Tabela 2)
Tabela 2. Značilnosti uporabe procesorjev Intel.

Celoten 2D signal je bil na vsaki stopnji razdeljen na enake fragmente različnih velikosti [44]. Vrednosti izbranih fragmentov so bile med ločljivostmi slikovnih pik 16 × 16 in 1024 × 1024. Hitrost vzporednega algoritma DCT z uporabo paketa OpenMP v primerjavi s hitrostjo zaporednega algoritma je prikazana na sliki 4. Uporaba vzporedne 2D spektralne analize algoritem na večjedrnih procesorjih daje rezultat overclockinga, ki je blizu številu jeder.

Slika 4. Rezultati pospeška za 2D vzporedno spektralno analizo.






