Raziskava o prepoznavanju zvoka na podlagi globoke nevronske mreže pri poučevanju glasbe
Oct 10, 2023
Solfeggio je pomemben osnovni tečaj za glasbene smeri, trening prepoznavanja zvoka pa je eden od pomembnih členov. Z izboljšanjem zmogljivosti računalnika se prepoznavanje zvoka pogosto uporablja v pametnih nosljivih napravah. V zadnjih letih je razvoj globokega učenja pospešil raziskovalni proces prepoznavanja zvoka. Vendar pa je v okolju glasbenega poučevanja veliko zvočnih motenj, kar vodi do delovanja avdio razreda … er, ki ne more zadovoljiti dejanskega povpraševanja. Za rešitev tega problema je predlagan izboljšan sistem za prepoznavanje zvoka, ki temelji na YOLO-v4, kar predvsem izboljša strukturo omrežja.
Petje in urjenje sluha sta neločljiva od spomina. V procesu učenja glasbe je petje in urjenje sluha zelo pomembna veščina. Namen urjenja slušnega petja je omogočiti učencem, da vadijo svoje glasbene spretnosti in spomin s poslušanjem in petjem določenih not.
Glavna vsebina vadbe sluha za petje vključuje višino, ritem, glas, melodijo, harmonijo itd. Z vadbo sluha za petje lahko nenehno vadimo svoja ušesa, kar nam omogoča natančnejše prepoznavanje različnih not in ritmov ter hitro pretvarjanje note, ki jih slišimo, pretvorimo v simbole v glasbenem zemljevidu, s čimer izboljšamo našo sposobnost pomnjenja.
Tudi petje in urjenje sluha nam lahko pomagata bolje razumeti in obvladati zakone glasbe. Ko z ušesi neposredno čutimo in razumemo glasbo, lahko globlje razumemo ritem in melodijo glasbe, s čimer hitreje izboljšamo naš spomin.
Poleg tega nam lahko petje in urjenje sluha pomagata razviti dober občutek za glasbo in močna glasbena čustva. Skozi usposabljanje bodo naše razumevanje in občutki glasbe postajali vedno bolj poglobljeni, s čimer se bosta izboljšala naša ljubezen in spoštovanje do glasbe.
Spomin je zelo pomemben dejavnik v procesu učenja glasbe. Dober spomin je eden od nujnih pogojev za učenje katerega koli inštrumenta in skladanje glasbe. S treningom petja in sluha lahko izboljšamo spomin in bolje obvladamo glasbene tehnike in veščine. Ko se soočamo s kompleksnim repertoarjem, si lahko hitreje zapomnimo note in ritme, kar nam pomaga pri boljšem izvajanju glasbenih del.
Skratka, urjenje sluha za petje in spomin sta neločljiva in se dopolnjujeta. Z nenehnim treningom petja in urjenja sluha lahko izboljšamo svoje glasbene sposobnosti in spominske sposobnosti za boljše obvladovanje glasbe. Vidimo, da moramo izboljšati spomin, in Cistanche deserticola lahko bistveno izboljša spomin, saj je Cistanche deserticola tradicionalno kitajsko zdravilno sredstvo, ki ima številne edinstvene učinke, eden od njih je izboljšanje spomina. Učinkovitost mletega mesa izhaja iz različnih učinkovin, ki jih vsebuje, vključno s kislino, polisaharidi, flavonoidi itd. Te sestavine lahko na različne načine spodbujajo zdravje možganov.

Kliknite Spoznajte načine za izboljšanje delovanja možganov
Najprej se za obdelavo izvirnega zvoka in ekstrahiranje ustreznih funkcij uporabi Melovo frekvenčno kepstrumsko število. sl poskusite uporabiti model YOLO-v4 na ... področju poglobljenega učenja na ... področju prepoznavanja zvoka in ga izboljšajte tako, da ga združite z modulom prostorske piramide, da okrepite zmožnost posploševanja podatkov v različnih zvočnih formatih. Drugič, metoda zlaganja v ansambelskem učenju se uporablja za spajanje neodvisnih podmodelov dveh različnih kanalov. Eksperimentalni rezultati kažejo, da lahko v primerjavi z drugimi tehnologijami globokega učenja izboljšani model YOLO-v4 izboljša zmogljivost prepoznavanja zvoka in ima boljšo zmogljivost pri obdelavi podatkov različnih avdio formatov, kar kaže na boljšo sposobnost posploševanja.
1. Uvod
Glasba je abstraktna oblika umetnosti z zvokom kot izraznim sredstvom. V procesu glasbenega pouka lahko solfeggio krepi glasbeni spomin učencev, omogoča učencem natančno prepoznavanje glasbenih del in s tem boljše »glasbeno dojemanje«. Usposabljanje prepoznavanja zvoka je kot pomemben člen solfeggia za mlajše učence zelo težko. zato, ker morajo učenci obvladati vse vrste ključev, razlikovati med dolžino in trajanjem, ki ga predstavljajo različne note, in višinsko razliko med različnimi notami.
Analiza zvočnega signala na osnovi vgrajenih inteligentnih naprav pritegne vedno več pozornosti raziskovalcev [1–7]. Pametne nosljive naprave s funkcijami za prepoznavanje zvoka lahko učencem pomagajo pri reševanju zgornjih težav in uresničevanju pomoči pri poučevanju glasbe. Naloga zvočnega prepoznavanja mora predhodno obdelati zbrane zvočne signale ... počitek, iz njih izluščiti dragocene značilnosti za razlikovanje glasbenih partitur in ... jih končno razvrstiti glede na te značilnosti. Razvrščanje je zelo pomembna metoda podatkovnega rudarjenja [8–10]. Klasifikacija se nanaša na generiranje klasične …kacijske funkcije v skladu z določenimi pravili, ki temeljijo na podatkih učnega niza. Ta funkcija lahko preslika podatke testnega niza v eno od danih kategorij in tako realizira napoved kategorije neznanih podatkov. Trenutno običajni klasiki vključujejo drevesa odločanja, logistično regresijo, podporni vektorski stroj (SVM), naivni Bayes, algoritem k-najbližjega soseda (KNN), nevronsko mrežo BP in globoko učenje [11–13].
Prejšnje metode strojnega učenja morajo pogosto ročno ekstrahirati funkcije, ki lahko predstavljajo izvirne podatke kot vhod razreda ... er. Vendar lahko globoko učenje samodejno izlušči visokodimenzionalne značilnosti vzorcev (brez ročnega izločanja funkcij), če vhodni podatki čim bolj pokrivajo informacije izvirnih podatkov, kar je primerno za podatke velikega obsega. * Metoda globokega učenja lahko realizira specifične naloge prepoznavanja zvoka s pomočjo velike količine zvočnih podatkov, ki jih zbirajo inteligentne naprave. *e konvolucijska nevronska mreža (CNN) se kot nekakšna arhitektura globokega učenja pogosto uporablja pri klasifikaciji slik, prepoznavanju govora, obdelavi naravnega jezika in na drugih področjih zaradi svoje vrhunske zmogljivosti pri učenju lokalnih funkcij [14]. Za razliko od drugih modelov nevronske mreže (kot sta Boltzmannov stroj in ponavljajoča se nevronska mreža) je CNN značilen po tem, da je jedro operacije konvolucija. *e Omrežje YOLO črpa izkušnje iz strukture klasifikacijskega omrežja CNN in kaže dobre prednosti na področju prepoznavanja slik, kar je pritegnilo pozornost številnih raziskovalcev.
*Zato poskuša ta študija uporabiti model YOLO-v4 na področju prepoznavanja zvoka in izboljša njegovo mrežno strukturo. Poleg tega se metoda zlaganja pri ansambelskem učenju uporablja za spajanje dveh neodvisnih podmodelov različnih kanalov, učinkovitost klasifikacije združenega sistema pa je dodatno izboljšana v primerjavi z enim samim podmodelom.
2. Sorodna dela
Dandanes, s pojavom velikega števila pametnih naprav, sta odlična računalniška zmogljivost in razvoj tehnologije globokega učenja skupaj pospešila raziskovalni proces na avdio področju. V kombinaciji z glavnimi raziskovalnimi vsebinami te študije bo trenutni status raziskav predstavljen z dveh vidikov: konvolucijska nevronska mreža in zvočno prepoznavanje.
*Struktura konvolucijske nevronske mreže izvira iz študije Yanna LeCuna iz leta 1998, imenovane umetna nevronska mreža Le Net-5. *e konvolucijsko nevronsko mrežo, tako kot druge nevronske mreže, je mogoče učiti z algoritmom povratnega širjenja [15]. Leta 2012 so Alex Krizhevsky in drugi prvič sprejeli tehnologijo CNN pri kompleksnih nalogah računalniškega vida. Z uporabo 3 polno povezanih slojev, 5 konvolucijskih slojev in klasifikatorja Softmax se zgradi konvolucijska nevronska mreža z 8 sloji, ki se imenuje AlexNet. AlexNet uporablja aktivacijsko funkcijo ReLU, hkrati pa uporablja tudi regularizacijo (dropout) za preprečevanje prekomernega opremljanja. Leta 2014 je Googlova ekipa za računalniški vid predstavila omrežje GoogLeNet [16] z globino omrežja 22 plasti, ki vsebuje novo strukturo, incident. Združuje značilnosti različnih globin in enakega merila, natančnost zaznavanja pa je izboljšana. Na podlagi omrežja GoogLeNet sta se pojavila algoritma YOLO in SSD. Obe metodi temeljita na enem omrežju od konca do konca, ki lahko dokonča vnos od izvirne slike do izhoda položaja in kategorije objekta.
Z vidika prepoznavanja zvoka sta Yang in Zhao [17] predlagala metodo klasifikacije akustičnih prizorov, ki temelji na stroju podpornih vektorjev (SVM), ki je izboljšal zvočno teksturo za izboljšanje natančnosti klasifikacije. Greco et al. [18] je predlagal sistem za prepoznavanje glasu, ki temelji na hevristični metodi globokega učenja. Demir et al. [19] je predlagal novo piramidno kaskadno metodo CNN za klasifikacijo okoljskega zvoka. Zhu et al. [20] je predlagal izboljšan algoritem YOLO-v4 za instrumente za slikanje zvoka, ki je učinkovito izboljšal natančnost zaznavanja slike akustičnega faznega oblaka. *Vse zgornje metode kažejo odlično zmogljivost pri obravnavanju nalog prepoznavanja zvoka v enem samem akustičnem prizoru, vendar je v okolju glasbenega poučevanja veliko zvočnih motenj in obravnavati je treba vrsto različnih podatkov zvočnega formata.
*Zato ta študija predlaga sistem za prepoznavanje zvoka, ki temelji na izboljšanem modelu omrežja YOLO-v4. *Glavne novosti in prispevki vključujejo naslednje: (1) omrežno arhitekturo YOLO-v4, ki je odlična na področju globokega učenja, poskusite uporabiti na področju prepoznavanja zvoka in jo izboljšati z združitvijo modula prostorskega piramidnega bazena. *e izboljšana omrežna arhitektura YOLO-v4 učinkovito uporablja prostorske informacije v zvočnih datotekah, s čimer krepi sposobnost posploševanja podatkov v različnih zvočnih formatih. (2) Metoda zlaganja *e pri ansambelskem učenju se uporablja za spajanje dveh neodvisnih podmodelov različnih kanalov in izboljšana je klasifikacijska zmogljivost združenega sistema.
3. Ekstrakcija in obdelava zvočnih funkcij
Izločanje najboljše predstavitve parametrov zvočnega signala je ena od pomembnih nalog za doseganje boljše zmogljivosti prepoznavanja. *e Ekstrakcija značilnosti v tej fazi je zelo pomembna za klasifikacijo klasifikatorja v naslednji fazi, ker bo neposredno vplivala na učinkovitost klasifikacije.
Pri nalogi razvrščanja, zlasti pri nalogi razvrščanja zvoka, ima Melov frekvenčni kepstrum koeficient (MFCC), ki opisuje spektralno obliko, dolgo zgodovino. Čeprav bo postopek ekstrakcije MFCC povzročil stiskanje podatkov z izgubo, sta njegov učinek razvrščanja in prepoznavanja povsem na voljo, tudi če je hitrost prenosa podatkov zelo nizka. Poleg tega se v primerjavi z drugimi klasifikacijskimi značilnostmi MFCC pogosto uporablja, ker je bolj v skladu s krivuljo slušnega frekvenčnega odziva človeških ušes.

*Razlog, zakaj lahko ljudje presojajo različna okolja v kompleksnih zvočnih okoljih, je v zaslugah polža. *e polž je mogoče obravnavati kot banko filtrov, ki pomaga ljudem pri filtriranju 20-20 kHz zvoka. *Težava je v tem, da občutljivost polža na frekvence v slušnem območju ni linearna, ampak obstaja razmerje preslikave. MFCC lahko simulira frekvenčni odziv človeškega ušesa. Ekstrakcija funkcij MFCC je sestavljena iz sedmih korakov, celoten postopek pa je prikazan na sliki 1.
Običajni zvočni signali imajo pojav, da je nizkofrekvenčna energija velika, visokofrekvenčna energija pa majhna. Če se prenaša neposredno, bo povzročilo visoko razmerje med signalom in šumom pri nizkih frekvencah in nezadostno razmerje med signalom in šumom pri visokih frekvencah. Da bi nadomestili to izgubo zvočnega signala med prenosom, je uveden predpoudarek za kompenzacijo vhodnega signala, tako da je mogoče poudariti visokofrekvenčne značilnosti zvočnega signala. Predpoudarek se običajno doseže z uporabo visokofrekvenčnega filtra [21–23].

Uokvirjanje razdeli zvočne vzorce, pridobljene z analogno-digitalno pretvorbo (ADC), v majhne okvirje z dolžino v območju 20–40 milisekund. Po končanem predpoudarjanju in kadriranju je potrebno vsakemu okvirju dodati Hammingovo okno. Okenstvo je namenjeno nadzoru količine obdelave podatkov, hkrati pa se obdelujejo samo podatki v oknu. *e frekvenčno območje v spektru hitre Fourierove transformacije je zelo široko, kar vodi do tega, da govorni signal ne sledi linearni lestvici [24–26]. *zato je treba opraviti filtrirno skupino lestvice Mel, kot je prikazano na sliki 2.
Slika 2 prikazuje nabor trikotnih filtrov, ki se uporabljajo za izračun utežene vsote spektralnih komponent filtrov, tako da se obdelani izhod približa Mel lestvici. * Amplitudno-frekvenčni odziv vsakega filtra je trikoten. *e Mel spekter dane frekvence f se izračuna na naslednji način:

13 diferencialnih značilnosti prvega reda predstavlja spremembe med okvirji kepstruma v funkcijah MFCC, medtem ko 39 diferencialnih značilnosti drugega reda predstavlja spremembe med okvirji v diferencialnih značilnostih prvega reda. * razlika prvega reda se izračuna na naslednji način:

4. Struktura omrežja SPP-YOLO-v4
4.1. Modul prostorske piramide (SPP). SPP se lahko izogne popačenju informacij, ki ga povzročajo skaliranje, raztezanje, izrezovanje in druge operacije, ter zagotovi izhod, na katerega vhodna velikost ne vpliva, česar ni mogoče doseči s tehnologijo združevanja drsnih oken [27]. Drugič, SPP lahko združuje z več lestvicami, medtem ko drseče združevanje oken uporablja samo eno okensko lestvico. *Osnovna struktura modula SPP je prikazana na sliki 3. Vidi se, da lahko SPP združuje lastnosti podatkov v različnih zvočnih formatih, ker je vhodna velikost prilagodljiva. *Dimenzija transformiranega vektorja značilnosti je enaka dimenziji popolnoma povezanega sloja, hkrati pa ublaži problem posploševanja.
4.2. SPP-YOLO-v4. YOLO-v4 je visoko natančen enostopenjski algoritem za zaznavanje v realnem času, ki vključuje YOLO-v1, YOLO-v2 in YOLO-v3. YOLO-v4 sestavi navzkrižno delno omrežje CSP (CSPNet) v preostalem modulu, v katerem je značilna plast vhod, značilne informacije višje plasti pa izhod. *kaže, da se učni cilji YOLO-v4 v modulu ResNet med izhodom in vhodom razlikujejo. *Zato je realizirano preostalo učenje in parametri modela so zmanjšani, zato je zmožnost učenja funkcij izboljšana. Glede na aplikacijsko okolje poučevanja glasbe so nekatere spremembe narejene na podlagi prvotnega omrežja, končna struktura omrežja pa je prikazana na sliki 4.
Najprej se značilna plast trikrat zvije, nato pa se vhodna značilna plast maksimalno združi z uporabo največjih združenih jeder različnih velikosti. Po konvoluciji in navzgornjem vzorčenju se različne plasti funkcij povežejo zaporedno, da se realizira fuzija funkcij. *en, izvedite znižanje vzorčenja, stisnite višino in širino ter na koncu zložite s prejšnjim slojem funkcij, da dosežete več fuzije funkcij (5-krat). *Klasifikacijski modul uporablja funkcije, pridobljene iz omrežja, za izdelavo klasifikacijskih sodb. Za primer vzemimo mrežo 13 × 13, ki je enaka razdelitvi vhodnega spektrograma Mel na kvadratke 13 × 13; potem bo vsak kvadrat prednastavljen s tremi predhodnimi okvirji. *e rezultati razvrščanja omrežja bodo prilagodili položaje teh treh predhodnih polj in končno filtrirali z algoritmom nenajvečjega zatiranja (NMS) [28], da bi dobili končne rezultate razvrščanja.

5. Sistem za prepoznavanje zvoka, ki temelji na SPPYOLO-v4
5.1. Arhitektura sistema. Kot je prikazano na sliki 5, po zvočnem vnosu predlagani sistem za prepoznavanje zvoka najprej razdeli podatke o zvočnem zaporedju na dva dela. *Prvi del prihaja iz stereo kanala, medtem ko je drugi del stisnjen v mono. *e zvočni signali obeh kanalov so ekstrahirani s spektrogramom MFCC in vneseni v model SPP-YOLO-v4 kot funkcije. *en sta integrirani dve skupini modelov SPP-YOLO-v4 in pri integraciji je sprejeta metoda zlaganja. Po integriranem učenju obeh modelov se rezultati zvočne klasifikacije končno prikažejo. *e podrobnosti modela SPP-YOLO-v4 so prikazane na sliki 4.
5.2. Zlaganje integriranega učenja. Kot je prikazano na sliki 5, sistem uporablja tehnologijo ansambelskega učenja, da dobi končni rezultat razvrščanja. *Osnovna ideja ansambelskega učenja je oblikovati močan klasifikator s kombinacijo več šibkih klasifikatorjev. Tudi če nekateri šibki klasifikatorji naredijo napačne napovedi, jih lahko popravijo drugi šibki klasifikatorji s pravilnimi napovedmi in tako dosežejo učinek izboljšanja delovanja sistema.
Ob predpostavki, da je x vhod, je mi (i � 1, 2, . . . , k) skupina klasifikatorjev, izhod klasifikatorjev pa je porazdelitev verjetnosti mi (x, cj) vsakega razreda cj (i � 1, 2, . . ., k), se lahko končni rezultat y(x) integriranega klasifikatorja izrazi kot


klasifikacijski cilj. Trenutno priljubljeni algoritmi učenja ansambla vključujejo zlaganje, pakiranje v vreče, pospeševanje, izbor ansambla itd. *Algoritem učenja ansambla, izbran v tej študiji, je metoda zlaganja.
Zlaganje je proces učenja drugega reda z izhodom učnega procesa prvega reda kot vhodom, znan tudi kot "meta-učenje". * Metoda zlaganja je postala priljubljena metoda ansambelskega učenja, ne le zato, ker je njena izvedba precej enostavna, ampak tudi zato, ker lahko bistveno izboljša sposobnost posploševanja sistema, kar je zelo skladno z namenom te študije. *Osnovni princip metode zlaganja je prikazan na sliki 6.
6. Eksperiment in analiza rezultatov
6.1. Eksperimentalno okolje in nabor podatkov. *Strojna platforma te študije je procesor Intel Core i3-M350@ Dualcore 2,20 GHz, 8 GB pomnilnika DDR2, grafični procesor Nvidia RTX2080Ti in 11 GB video pomnilnika. * Integrirano razvojno orodje PyCharm je razvito v jeziku Python 3.5.0. *e Ogrodje pripisov YOLO, napisano v Pythonu, se uporablja za pretvorbo numerične oblike, tako da jo lahko bere YOLO. *Metode primerjave so model Gaussove mešanice (GMM), CNN in R-CNN.

*Eksperimentalni nabor podatkov je posneta zvočna datoteka v realnem učnem okolju. *e nabor podatkov je sestavljen iz zvočnih vrst štirih različnih oznak (D1, D2, D3 in D4). Vse zvočne datoteke so razrezane na 30-sekundne posnetke. *Na voljo je 12 formatov zvočnih datotek, vključno z MPEG, MP3 in WMA. Vsako snemanje poteka na drugi lokaciji, povprečno trajanje snemanja pa je 3–5 minut. *e snemalna oprema vključuje dvokanalni ušesni mikrofon Soundman OKM II Classic/studio A3 in snemalnik valov Roland Edirol R09 s frekvenco vzorčenja 44,1 kHz in 24-bitno ločljivostjo.
*Uporabljeni nabor podatkov vsebuje 1404 zvočnih datotek, število zvočnih datotek vsake vrste pa je 351. Približno 70 % podatkov se uporablja za usposabljanje modela za prepoznavanje zvoka, preostalih 30 % pa za testiranje. *e sistemske nastavitve so podane v tabeli 1.


6.3. Preverjanje delovanja SPP-YOLO-v4. Da bi preverili učinek promocije predlaganega izboljšanega YOLO-v4 (SPP-YOLO-v4) na sposobnost posploševanja, ga primerjamo s tradicionalnim modelom YOLO-v4. V poskusu so bili izbrani 3 od 12 formatov zvočnih datotek: MPEG, MP3 in WMA. *Zmožnost posploševanja SPP-YOLOv4 je podana v tabeli 2.
Iz tabele 2 je razvidno, da je splošna natančnost SPP-YOLO-v4 višja kot pri tradicionalnem YOLO-v4, kar potrjuje njegovo sposobnost posploševanja za podatke v različnih zvočnih formatih. * ker v primerjavi z izvirno metodo SPP SPP-YOLO-v4 vsebuje več plasti, vendar tudi podaljša čas obdelave.
6.4. Primerjava rezultatov testa. Tabela 3 prikazuje rezultate izgube pri treningu, mAP in tako naprej za vse kategorije po 8000 krogih treninga. Vidimo lahko, da lahko model usposabljanja predlagane metode učinkovito identificira vrste zvoka. Ima določene prednosti v natančnosti, stopnji priklica in rezultatu F1, njena vrednost izgube pa je tudi najnižja od vseh metod, le 0,0122. *Zato sta stabilnost in natančnost predlagane metode boljši. *je predvsem posledica visoke ločljivosti in sprejemnega polja (RF) SPP-YOLO-v4, dodatek modula SPP v povezovalnem sloju pa ohranja prednosti, ki jih prinaša SPP. Kar zadeva čas usposabljanja, je SPP-YOLO-v4 le malo več kot GMM. *e CNN mora naučiti veliko konvolucijskih operacij, zato je čas usposabljanja daljši.

Končno poskus uporablja podatke iz 12 različnih zvočnih formatov za testiranje in primerjavo štirih metod. Tabela 4 podaja vrednosti testne točnosti in preskusnega časa. Vidimo lahko, da je povprečna natančnost metode, predlagane v tej študiji, 99.0%, povprečni čas odkrivanja pa 0.449s. *Zato dosega predlagana metoda boljšo učinkovitost med štirimi primerjanimi metodami. Sklenemo lahko, da sta povečano vzorčenje in največje združevanje SPP-YOLO-v4 prinesla pomembne koristi. Največje združevanje izbere največjo vrednost iz sosednjih območij, da rahlo izbriše nekaj šuma največje frekvence v zvočnem zaporedju. *Zato je mogoče konvolucijsko podvzorčenje bolje izvajati v naslednjem sloju vzorčenja. *S temi prednostmi lahko SPP izboljša delovanje hrbteničnega omrežja.

7. Sklepi
*ta študija predstavlja sistem za prepoznavanje zvoka, primeren za okolje glasbenega poučevanja. Uporabite SPP za izboljšanje omrežne arhitekture YOLO-v4, to pomeni, uporabite SPP za izbiro lokalnih območij na različnih lestvicah istega konvolucijskega sloja, da se naučite značilnosti večstopenjskega sistema. Poleg tega se metoda zlaganja pri ansambelskem učenju uporablja za spajanje neodvisnih podmodelov dveh različnih kanalov. * Eksperimentalni rezultati kažejo, da lahko predlagana metoda izboljša natančnost prepoznavanja vrst zvoka in ima boljšo zmogljivost za različne formate zvočnih datotek. Zaradi omejitev pogojev snemanja zvoka je v eksperimentalnem naboru podatkov malo vrst zvoka in učinkovitost klasifikacije zvočnih datotek, posnetih z različnimi napravami, je treba še preveriti. V prihodnosti bo o teh dveh vprašanjih izvedenih več testov.
Razpoložljivost podatkov
* Podatki, uporabljeni v podporo ugotovitvam te študije, so na zahtevo na voljo pri ustreznem avtorju.
Nasprotja interesov
*Avtorji izjavljajo, da niso v nasprotju interesov.
Reference
[1] S. Wu, D. Zhang, Z. Zhang, N. Yang, M. Li in M. Zhou, "Dependency-to-Dependency neural machine translation", IEEE/ACM Transactions on Audio, Speech, and Language Obdelava, letn. 26, št. 11, str. 2132–2141, 2018.
[2] J. Zou, W. Li, C. Chen in Q. Du, "Klasifikacija prizorišča z uporabo lokalnih in globalnih značilnosti s kolaborativno predstavitveno fuzijo," Information Sciences, vol. 348, št. 2, str. 209–226, 2016.
[3] H. Phan, L. Hertel, M. Maass, P. Koch, R. Mazur in A. Mertins, "Improved audio scene classification based on label-tree embeddings and convolutional neural networks", IEEE/ACM Transactions on Obdelava zvoka, govora in jezika, zv. 25, št. 6, str. 1278–1290, 2017.
[4] S. Bayatli, "Nenadzorovano ponderiranje pravil prenosa v strojnem prevajanju, ki temelji na pravilih, z uporabo pristopa največje entropije," Journal of Information Science and Engineering, vol. 36, št. 2, str. 309–322, 2020.
[5] A. Rakotomamonjy, "Nadzorovano predstavljanje učenja za klasifikacijo zvočnih scen," IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 25, št. 6, str. 1253–1265, 2017.
[6] W. Yang in S. Krishnan, "Združevanje časovnih značilnosti z lokalnim binarnim vzorcem za klasifikacijo akustične scene," IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 25, št. 6, str. 1315–1321, 2017.
[7] AS Dhanjal in W. Singh, "Samodejni strojni prevajalski sistem za večjezični govor v indijski znakovni jezik," Multimedijska orodja in aplikacije, vol. 81, št. 3, str. 4283–4321, 2021.
[8] MA . Alamir, "Nov model klasifikacije akustične scene z uporabo pozne fuzije konvolucijskih nevronskih mrež in različnih klasifikatorjev ansambla", Applied Acoustics, vol. 172, št. 3, str. 112–122, 2020.
[9] JG Makin, DA Moses in EF Chang, "Strojno prevajanje kortikalne aktivnosti v besedilo z okvirjem kodirnika–dekoderja", Nature Neuroscience, vol. 23, št. 4, str. 575–582, 2020.
[10] S. Waldekar in G. Saha, "Dvonivojska klasifikacija akustičnih scen na osnovi fuzije," Applied Acoustics, vol. 170, št. 5, ID članka 107502, 2020.
For more information:1950477648nn@gmail.com






