Microsoft Word – globoko učenje proti tradicionalnim modelom_Abdel Hai_Final. 2. del

Jan 03, 2024

Za pripravo podatkov za modele strojnega učenja so bile izvedene naslednje tehnike predprocesiranja podatkov.

Podatki in pomnilnik sta tesno povezana. V sodobni družbi vsak dan prejmemo veliko količino informacij in podatkov, vključno z besedili, slikami, videoposnetki itd. Da bi te podatke učinkovito obdelali in organizirali, moramo imeti močan spomin.

Po eni strani nam lahko podatki nudijo pomnilniško podporo. Na primer, ko se učimo novega znanja, lahko točke znanja hitreje in bolje razumemo in obvladamo tako, da si zapomnimo ustrezne podatke in dejstva. Tovrstna metoda učenja nam lahko pomaga zgraditi močan spomin in ohraniti sposobnost nadzora znanja za dolgo časa.

Po drugi strani pa nam lahko podatki pomagajo tudi pri urjenju in izboljšanju spomina. Z različnimi metodami urjenja spomina lahko fleksibilno uporabljamo podatke za urjenje spomina, do določene mere izboljšamo svojo spominsko sposobnost in se tako bolje prilagodimo razvoju družbe ter potrebam dela in življenja.

Vidimo lahko, da je razmerje med podatki in pomnilnikom zelo tesno in pomembno. Samo z aktivno in učinkovito obdelavo in uporabo podatkov lahko bolje izkoristimo svoje spominske zmogljivosti in dosežemo boljše rezultate. Zato bi morali aktivno obravnavati odnos med podatki in spominom, izvajati ustrezne treninge in aplikacije ter nenehno izboljševati svoje sposobnosti. Vidi se, da moramo izboljšati spomin in Cistanche deserticola lahko bistveno izboljša spomin, saj lahko Cistanche deserticola uravnava tudi ravnovesje nevrotransmiterjev, kot je povečanje ravni acetilholina in rastnih faktorjev. Te snovi so zelo pomembne za spomin in učenje. Poleg tega lahko meso izboljša pretok krvi in ​​spodbuja dostavo kisika, kar lahko zagotovi, da možgani prejmejo dovolj hranilnih snovi in ​​energije, s čimer se izboljša vitalnost in vzdržljivost možganov.

improve short term memory

Kliknite Spoznajte načine za izboljšanje delovanja možganov

Kategorične značilnosti so bile vroče kodirane; zvezne in diskretne značilnosti so bile normalizirane z uporabo minimalno-max normalizacijskih tehnik,32 opredeljenih kot:

increase brain power

V vsakem srečanju je bilo za vsako od naslednjih značilnosti različno število posnetkov. Tako so bile namesto tega izračunane naslednje statistične vrednosti. Za diastolični in sistolični krvni tlak smo izračunali minimalne, maksimalne in srednje vrednosti.

Za BMI so bili uporabljeni najmanjši, največji, srednji in koeficient variance. Te statistične vrednosti so bile normalizirane in uporabljene kot funkcije. Poleg tega se je število lastnosti pri srečanjih razlikovalo zaradi različnega števila laboratorijskih testov, diagnoz in postopkov. Srečanje ima lahko več diagnoz in/ali kod postopkov ali nobeno.

Da bi to odpravili in poenotili dimenzionalnost vektorjev značilnosti, so bile za izboljšanje učenja modelov uporabljene naslednje tehnike predstavitve podatkov. Za kode diagnoze in postopkov smo uporabili predstavitev kodiranja z enim sprožitvijo, kjer je bila vsaka vrednost nastavljena na 0 ali 1, kar kaže, ali koda diagnoze/postopka obstaja ali ne za vsako srečanje. To tehniko predstavitve podatkov smo nekoliko spremenili za laboratorijske teste, ker je imel vsak test povezan rezultat.

Zato smo 1, ki nakazuje obstoj kode, zamenjali z laboratorijskim rezultatom. Laboratorijski rezultati so bili normalizirani z uporabo enačbe 1. Ker so bili rezultati različnih enot in mer, smo pri normalizaciji laboratorijskih rezultatov upoštevali minimum in maksimum za vsako laboratorijsko kodo posebej. Ta tehnika je zaradi številnih edinstvenih kod ustvarila visokodimenzionalni redki niz.
Nato smo uporabili algoritem Singular Value Decomposition (SVD), da smo se naučili vdelave in zmanjšane dimenzionalnosti. SVD je bil uporabljen, ker ne predvideva kvadratne matrike kot vhoda in je boljši za redke podatke.33 Laboratorijski testi so bili zmanjšani na 50 komponent, postopek kode so bile zmanjšane na 45 komponent, kode diagnoze pa na 25 komponent.

Raziskane so bile različne komponente in opazovana je bila vsota razmerja variance, da bi se določilo optimalno število komponent za zmanjšanje dimenzionalnosti. Vse funkcije so bile povezane v vektor značilnosti za vsako srečanje. SVD je bil uporabljen pri vsakem srečanju posebej za zmanjšanje in poenotenje dimenzij; dimenzija srečanj je bila zmanjšana na 50 funkcij na srečanje.

help with memory

Nato smo vsa srečanja za danega pacienta združili v vektor značilnosti, razvrščen po vrsti glede na datum sprejema. Porazdelitev po razredih je bila 27.511 bolnikov brez ponovnega sprejema (negativni razred) in 9.130 bolnikov, ki so bili ponovno sprejeti (pozitivni razred).

Eksperimentalni pristopi

Izvedli smo obsežne poskuse z uporabo podatkov EHR, da bi dosegli naslednje cilje:

- Predvidite, ali bodo bolniki s sladkorno boleznijo ponovno sprejeti v 30 dneh

- Primerjajte učinkovitost uporabljenih metod DL z več tradicionalnimi modeli

- Analizirajte, koliko predhodnih srečanj (tj. zgodovinskih podatkov) v 2 letih je optimalno za napoved ponovnega sprejema

- Ocenite učinke vključitve vseh laboratorijskih testov v podatke v primerjavi z učenjem iz podmnožice testov, ki jih izbere strokovnjak za področje

V tej študiji modeli DL vzamejo kot vhod 3-3-dimenzionalni tenzor � x � x � za predstavitev f značilnosti za vsako od e srečanj za p pacientov. Nasprotno pa so v tradicionalnih modelih podatki običajno predstavljeni kot 2-dimenzionalna matrika, pri čemer so vse značilnosti vseh srečanj, ki ustrezajo enemu pacientu, povezane v dolg vektor značilnosti.

Dimenzionalnost vsakega srečanja je bila zmanjšana in poenotena na 50 značilnosti, zato je v globokem modelu � velikosti 50. V tradicionalnem modelu je vektor značilnosti sestavljen iz vseh srečanj in je zato velikosti � x 50.

Pacienti imajo različno število srečanj, kar ima za posledico neenotne dimenzije; zato so bili vektorji funkcij obloženi z 0, da bi dosegli enotno obliko. Predstavitev podatkov, ki se uporablja kot vhod za DL in tradicionalne modele, je prikazana na levi oziroma desni plošči slike 1.
Za modeliranje heterogenih zaporednih podatkov smo razvili 2 različici modelov DL in oba primerjali z več tradicionalnimi modeli, uporabljenimi kot izhodišča. Modeli DL, uporabljeni v naši študiji, so bili: 1) omrežja 1-way Long Short-Term Memory (LSTM), ki so različica ponavljajoče se nevronske mreže (RNN), ki je sposobna učenja odvisnosti od vrstnega reda nezaporednih podatkov32; in 2) Bidirectional Gated Recurrent Unit (GRU), ki je druga različica RNN.

Tradicionalni modeli, uporabljeni kot izhodišča, so bili: 1) Naključni gozd (RF), ansambelska metoda za klasifikacijo in regresijo; med usposabljanjem sestavi več odločitvenih dreves;30 RF pogosto doseže najsodobnejšo zmogljivost v obstoječi literaturi o napovedih z uporabo medicinskih podatkov. 2) Večplastni perceptron (MLP), preprost model nevronske mreže, ki ne upošteva časovnih informacij.

MLP je sestavljen iz več plasti perceptrona, izvaja učenje povratnega širjenja in uporablja nelinearno aktivacijsko funkcijo.31 3) Logistična regresija (LR), interpretabilni model, ki se pogosto uporablja v obstoječi literaturi napovedi ponovnega sprejema in uporablja za medicinske podatke; in 4) AdaBoost, ki je manj nagnjen k prekomernemu opremljanju, saj njegovi vhodni parametri niso skupaj optimizirani.

help with memory


Modeli DL so bili implementirani z uporabo knjižnic Python "Keras", API-ja na visoki ravni "TensorFlow". Knjižnica "Scikit-learn" je bila uporabljena za implementacijo tradicionalnih modelov v Python.

Arhitektura predlaganega modela, LSTM, obsega 128 nevronov, zaporedno plast, plast za preoblikovanje, ki je bila uporabljena za preoblikovanje vnosa v 3-dimenzionalni tenzor, in maskirno plast z vrednostjo maske 0 uporabljen za preskok časovnih korakov, za katere manjkajo podatki.

Ker je bilo oblazinjenje z 0 izvedeno za poenotenje dimenzij, je bil uporabljen maskirni sloj, da bi se izognili kakršnemu koli izračunu z manjkajočimi vrednostmi v vseh plasteh, ki sledijo maskirnemu sloju, zato manjkajoče vrednosti med učenjem niso bile upoštevane.

Poleg tega je bil dodan izpad med skrito in izhodno plastjo. Uporaba te tehnike za naključno izbiro danega odstotka, ki ga želite znižati, je običajna tehnika urejanja, ki pomaga modelu pri učenju splošnih vzorcev v podatkih.

RNN je različica nevronskih mrež, ki so sestavljene iz skritih nevronov, ki so sposobni analizirati časovne podatke EHR.32 RNN obsega enako strukturo kot osnovna nevronska mreža, vendar so nevroni v isti plasti povezani, kar omogoča nevronu, da se uči iz istega sosednje plasti, poleg učenja iz rezultatov prejšnjih plasti in vhodnih podatkov. Tako nevroni RNN vključujejo dva vira vnosov, sedanjost in nedavno preteklost. Proces učenja je opredeljen kot:

increase memory power

Za izračun vrednosti �" skritega nevrona, �, se nelinearna transformacijska funkcija, ReLU, uporabi za uteženo �vrednost njegovega levega skritega nevrona �"#$ in uteženo � vrednost njegovega vhoda �.

Napovedi so izračunane z uporabo asigmoidne funkcije utežene � vsote vseh skritih nevronov z dodano pristranskostjo �. Pomanjkljivost RNN je, da trpi zaradi težave z izginjajočim gradientom, kar pomeni, da uteži ostanejo nespremenjene, kar otežuje konvergenco modela, zato se model težko uči.

Da bi to rešili, je bila uvedena plast LSTM, v kateri so sigmoidnevroni RNN nadomeščeni s kompleksnejšo strukturo kratkoročnega spomina. LSTM ima enake uteži v vseh slojih, kar zmanjša število parametrov, ki jih izračuna omrežje.

supplements to improve memory

GRU je alternativna rešitev za izginjajoč problem gradienta. Nadomešča preprost nevron z zaprto enoto, ki ima manj parametrov kot nevroni LSTM, ker nima izhodnih vrat.33


For more information:1950477648nn@gmail.com

Morda vam bo všeč tudi