Klasifikacijska napoved raka dojke na podlagi strojnega učenja

Sep 12, 2023

Rak dojk je najpogostejša in najsmrtonosnejša vrsta raka na svetu. Na podlagi algoritmov strojnega učenja, kot so XGBoost, naključni gozd, logistična regresija in K-najbližji sosed, ta članek vzpostavlja različne modele za razvrščanje in napovedovanje raka dojke, da zagotovi referenco za zgodnjo diagnozo raka dojke. Odpoklic označuje verjetnost odkrivanja rakavih celic v medicinski diagnozi, kar je zelo pomembno za klasifikacijo raka dojke, zato ta članek odpoklic kot primarni ocenjevalni indeks upošteva natančnost, točnost in F1-rezultat. kazalnike za oceno in primerjavo učinka napovedi vsakega modela. Da bi odpravili vpliv različnih dimenzijskih konceptov na učinek modela, so podatki standardizirani.

Algoritem najbližjega soseda K je eden najosnovnejših algoritmov na področju strojnega učenja. Njegova glavna ideja je najti vzorce K, ki so najbližje ciljnemu vzorcu, in nato na podlagi oznak teh vzorcev K napovedati oznako ciljnega vzorca. V človeškem vsakdanjem življenju pogosto uporabljamo podobne metode za sprejemanje odločitev. Na primer, ko se soočimo z določeno težavo, se spomnimo podobnih situacij, s katerimi smo se že srečali, nato poiščemo najbolj podobne situacije in se odločimo na podlagi njihovih rezultatov. Razvijte rešitve. Zato je algoritem K najbližjega soseda tesno povezan s človeškim spominom.

Prvič, algoritem K najbližjega soseda zahteva veliko število učnih nizov za učenje in vzpostavitev podatkovne strukture grafa najbližjega soseda. Podobno moramo ljudje nenehno doživljati različne stvari in te izkušnje shranjevati v spomin. Le z veliko količino izkušenj in znanja lahko sprejemamo natančnejše odločitve in presoje.

Drugič, algoritem najbližjega soseda K poudarja vpliv podobnosti na napovedovanje. Podobno ljudje pri sprejemanju odločitev pogosto najprej upoštevajo pretekle izkušnje in poskušajo najti izkušnje, podobne trenutni situaciji, za referenco. Ta proces iskanja podobnosti je tudi ena od pomembnih značilnosti spomina.

Nazadnje, v algoritmu K najbližjega soseda ima vrednost K velik vpliv na rezultate napovedi. Različne vrednosti K vodijo do različnih rezultatov napovedi. Podobno morajo ljudje, ko se spominjajo preteklih izkušenj, izbrati različne referenčne točke in metode glede na trenutno situacijo. Ta prožnost in prilagodljivost je tudi pomembna značilnost spomina. Vidi se, da moramo izboljšati spomin. Cistanche deserticola lahko občutno izboljša spomin, saj je Cistanche deserticola tradicionalno kitajsko zdravilno sredstvo s številnimi edinstvenimi učinki, med katerimi je tudi izboljšanje spomina. Učinkovitost mletega mesa izhaja iz različnih učinkovin, ki jih vsebuje, vključno s kislino, polisaharidi, flavonoidi itd. Te sestavine lahko na različne načine spodbujajo zdravje možganov.

increase memory power

Kliknite Know za izboljšanje kratkoročnega spomina

Za iskanje optimalne podmnožice in izboljšanje natančnosti modela je bilo s Pearsonovim korelacijskim testom pregledanih 15 funkcij kot vnos v model. Model K-najbližjega soseda uporablja metodo navzkrižne validacije za izbiro optimalne vrednosti k z uporabo odpoklica kot indeksa vrednotenja. Za problem neravnovesja pozitivnega in negativnega vzorca se uporablja hierarhična metoda vzorčenja za izločanje učnega niza in testnega niza sorazmerno glede na različne kategorije. Eksperimentalni rezultati kažejo, da se bo pri različnih delitvah nabora podatkov (8 : 2 in 7 : 3) učinek napovedovanja istega modela spreminjal drugače. Primerjalna analiza kaže, da ima model XGBoost, vzpostavljen v tem prispevku (ki deli vadbeni niz in testni niz z 8:2), boljše učinke, njegov priklic, natančnost, točnost in F1-rezultat pa so 1.{{ 11}}, 0.960, 0.974 oziroma 0,980.

1. Uvod

V zadnjih desetih letih se je incidenca raka dojke na Kitajskem povečala za 47%, incidenca narašča iz leta v leto, incidenca raka dojke pa je postopoma mlajša [1]. Patogeneza raka dojke je povezana z osebnimi hormoni, družinsko zgodovino, poroko in zgodovino rojstva [2]. Raka dojke ni enostavno odkriti v zgodnji fazi in ima značilnosti zgodnjega pojava, vendar pozne predstavitve [3, 4]. Trenutno glavna diagnoza raka dojke temelji na treh metodah: punkcijska citologija [5], ultrazvok [6] in rentgenski mamograf [7]. Če bolnico zgodaj odkrijejo za rakom dojke, je večja verjetnost, da bo ozdravljena, in boljša je prognoza. Za preprečevanje in pravočasno odkrivanje raka dojk sta zato redni pregled in zgodnja diagnoza zelo potrebna.

Na medicinskem področju lahko vzpostavitev modelov z metodami strojnega učenja pomaga zdravnikom pri izboljšanju stopnje odkrivanja raka, da se doseže namen zgodnjega odkrivanja in zgodnjega zdravljenja. Metode strojnega učenja so dale dobre rezultate pri diagnosticiranju raka [8, 9]. Wu et al. [10] so opazovali celično morfologijo pod mikroskopom in ugotovili, da obstajajo očitne razlike med celicami raka dojke in parametri normalnih zdravih celic. Ta ugotovitev je teoretična podlaga za številne študije. Čeprav se trenutno uporablja veliko metod strojnega učenja za klasifikacijo celic raka dojke, ni mogoče uporabiti enega samega algoritma za vse težave. Vsaka vrsta algoritma strojnega učenja ima svoja strokovna področja, zato je izbira algoritma v različnih scenarijih različna.

Shen et al. [11] so uporabili model XGBoost za razvrščanje in napovedovanje raka dojke, natančnost pa je dosegla 97.86%, priklic pa 95,83%. Deng et al. [12] so uporabili algoritem XGBoost za razvrščanje in napoved raka dojke z natančnostjo 0.96 in priklicem 0.97. Monirujjaman Khan et al. [13] je uporabil več modelov strojnega učenja za prepoznavanje raka dojke, algoritmi z višjim rezultatom F1-, 96 %, 95 %, 90 %, pa so bili algoritmi naključnega gozda, odločitvenega drevesa, K-najbližjega soseda in logistične regresije. in 98 %. Bhardwaj et al. [14] so uporabili večplastni perceptron (MLP), K-najbližji sosed (KNN), genetski algoritem (GP) in naključni gozd (RF) za razvrščanje benignih in malignih celic raka dojke, eksperimentalni rezultati pa so pokazali, da je optimalni klasifikator RF s točnostjo klasifikacije 96,24 %. Dong in Ma [15] sta preučevala možne označevalce trojno negativnega raka dojke, algoritme strojnega učenja pa so uporabili za napovedovanje, ali imajo ljudje trojno negativnega raka dojke. Rezultati kažejo, da natančnost napovednega modela klasifikacijskega stroja podpornih vektorjev (SVM) doseže 97,8 %.

Da bi izboljšali natančnost metod identifikacije raka dojke in izboljšali algoritme strojnega učenja, Wang et al. [16] je predlagal uteženi model učenja ansambla AUC, ki temelji na SVM za diagnozo raka dojke, z uporabo C-SVM in V-SVM s 6 funkcijami jedra za povečanje raznolikosti nabora osnovnih modelov in primerjavo različnih rezultatov odločanja z območno integracijo (WAUCE). ) model pod krivuljo utežene sprejemne delovne karakteristike. Rezultati kažejo, da na majhnem naboru podatkov predlagana struktura WAUCE zmanjša varianco diagnostične natančnosti za do 69,23 % in izboljša natančnost za 0,94 %. Zheng et al. [17] je testiral nabor podatkov Wisconsin Breast Cancer (WDBC) v skladu s K-means in hibridnim algoritmom podpornega vektorskega stroja izloči značilnosti tumorja in diagnosticira raka dojke, rezultati pa kažejo, da hibridni algoritem izboljša natančnost na 97,38 %. Jia et al. [18] je predlagal nov algoritem za optimizacijo populacije Whale Optimization Algorithm (WOA), ki inteligentno prilagaja parametre modela SVM, eksperimentalni rezultati pa kažejo, da je zmogljivost modela WOA-SVM bistveno boljša od zmogljivosti tradicionalnega modela. model za prepoznavanje raka dojke, z natančnostjo 97,5 %.

Da bi rešili problem prekomernega prilagajanja tehnik strojnega učenja pri klasifikaciji raka dojke, so Singh et al. [19] so predlagali funkcionalno povezano umetno nevronsko mrežo (FLANN) in eksperimentalno ugotovili, da ima model visoko natančnost za zgodnjo diagnozo raka dojke. Mahesh et al. [20] predlagajo ansambelsko tehniko XGBoost za napovedovanje raka na dojki, ki temelji na znanih vzorcih funkcij, najprej z uporabo tehnologije sintetičnega manjšinskega nadvzorčenja (SMOTE) za obravnavo neravnovesja podatkov in težav s šumom, nato pa z uporabo Bayesovega klasifikatorja, klasifikatorja odločitvenega drevesa in naključnega gozda. , v kombinaciji z XGBoostom in razvrščanjem podatkov. Po eksperimentalni analizi ima klasifikator skupine XGBoost-Random Forest stopnjo natančnosti 98,20 % pri zgodnjem odkrivanju raka dojke.

Na podlagi XGBoost, naključnega gozda, logistične regresije, K-najbližjega soseda in drugih metod strojnega učenja ta članek vzpostavlja različne modele za razvrščanje in napovedovanje raka dojke, kar zagotavlja referenco za zgodnjo diagnozo raka dojke. Ko večina študij uporablja modele strojnega učenja za diagnozo celic raka dojke, se osredotočajo na uporabo natančnosti, točnosti in F1-ocene modela kot indikatorjev za oceno kakovosti modela, medtem ko ignorirajo medicinski diagnostični pomen odpoklic modela, ki kaže delež napovedanih malignih celic raka dojke, in višji kot je priklic, večja je verjetnost napovedi malignih celic v celicah raka dojke. Zato ta članek vzame odpoklic kot primarni indeks in upošteva natančnost, točnost in F1-oceno za oceno uporabljenega modela.

V procesu modeliranja je predprocesiranje podatkov zelo pomemben del, učinek napovednega modela pa je različen glede na metodo obdelave. Da bi odpravili vpliv različnih dimenzijskih konceptov na učinek modela, so podatki standardizirani. Da bi našli optimalno podmnožico in izboljšali natančnost modela, je bil izbor značilnosti narejen v skladu s Pearsonovim korelacijskim koeficientom med spremenljivko značilnosti in ciljno spremenljivko. Za problem neravnovesja pozitivnega in negativnega vzorca se uporablja hierarhična metoda vzorčenja za izločanje učnega niza in testnega niza sorazmerno glede na različne kategorije. Glede na to, da se učinek napovedi modelov strojnega učenja razlikuje glede na različne delitve nabora podatkov, bo ta članek uporabil različne delitve nabora podatkov (8: 2 in 7: 3) kot dva niza poskusov za opazovanje učinka napovedovanja modela, vzpostavljenega v tem dokumentu.

2. Predhodna obdelava podatkov

2.1. Predstavitev podatkov. Nabor podatkov, uporabljen v tem prispevku, je podatek o raku dojke v naboru podatkov UCI, ki ga je zagotovil slavni dr. William z Raziskovalnega inštituta za klinično medicino Univerze v Wisconsinu [21]. Značilnosti so izračunane iz digitalizirane slike aspirata s fino iglo (FNA) mase dojke. Opisujejo značilnosti celičnih jeder, prisotnih na sliki. Nabor podatkov je vseboval 569 eksperimentalnih vzorcev, od tega 357 benignih vzorcev in 212 malignih vzorcev raka dojke. Za celice, ekstrahirane iz vsakega eksperimentalnega predmeta, se v glavnem zbere naslednjih deset značilnosti njegovega jedra: polmer (srednja vrednost razdalje od središča do točk na obodu), obseg, gladkost (lokalne razlike v dolžinah polmera), površina, kompaktnost ( obod ∗ ∗ 2/območje-1.0), konkavnost (resnost konkavnih delov konture), simetrija, tekstura (standardna deviacija vrednosti sivine), konkavne točke (število konkavnih delov konture) in fraktalno_dimenzijo (»približevanje obale«-1). Srednja vrednost, standardna napaka in "najslabša" ali največja (srednja vrednost treh največjih vrednosti) teh značilnosti so bile izračunane za vsako sliko, kar je povzročilo 30 funkcij. Klasifikacijska oznaka predstavlja vrsto raka dojke. Zato nabor vzorčnih podatkov vsebuje skupaj 30 značilnosti in eno značilnost vzorčne oznake (maligne in benigne).

2.2. Standardizacija podatkov.

Z opazovanjem razpona vrednosti posamezne lastnosti ugotovimo, da se podatkovne vrednosti različnih lastnosti zelo razlikujejo. Pri nekaterih modelih imajo različne dimenzije velik vpliv na napovedni učinek. Na primer, algoritem k-najbližjega soseda, ki temelji na delitvi razdalje, mora ohraniti konsistentnost dimenzije podatkov, zato je treba podatke pred modeliranjem standardizirati. Vendar na nekatere modele dimenzionalnost manj vpliva, kot je algoritem naključnega gozda. Da bi bil poskus primerljiv, so podatki različnih modelov obravnavani na enak način.

Za težave z različnimi dimenzijami vzorčnih podatkov običajno uporabljene metode brezdimenzijske obdelave vključujejo standardizacijo podatkov, metode standardizacije podatkov pa vključujejo standardizacijo Min-max in standardizacijo Z-score. Med njimi, kadar imajo uporabljeni podatki izstopajoče vrednosti izven razpona vrednosti ali če največje in najmanjše vrednosti nekaterih kazalnikov niso znani, se lahko uporabi standardizacija z rezultatom Z.

increase memory

V tem dokumentu je bila glede na značilnosti nabora podatkov o raku dojke WDBC za obdelavo podatkov izbrana standardizacija Z-score. Podatki, obdelani s standardizacijo Zscore [22], sledijo standardni normalni porazdelitvi, kar pomeni, da je povprečje 0 in varianca 1. Formula za standardizacijo Z-score je naslednja:

improve memory

2.3. Izbira funkcije. Kot pomemben del postopka predhodne obdelave podatkov je izbira funkcij iskanje optimalne podnabora. Izbira funkcij lahko zmanjša odvečne in neuporabne funkcije za izboljšanje natančnosti modela. Metoda izbire funkcij je na splošno razdeljena na metodo premišljevanja, metodo enkapsulacije in metodo vdelave. Metoda filtriranja je lahko neodvisna od algoritma, uporabljenega pozneje v študiji, in ima visoko računalniško učinkovitost ter močno sposobnost posploševanja [23], zato metoda izbire značilnosti v tem prispevku uporablja metodo filtra, splošni povzetek metode v metodi filtriranja pa je prikazano v tabeli 2.

Podatki o raku dojke po 0 povprečni normalizaciji izpolnjujejo zahteve Pearsonovega testa korelacijskega koeficienta pri metodi filtriranja; zato je v tem dokumentu Pearsonov korelacijski koeficient [24] uporabljen za testiranje korelacije med vsako značilnostjo in ciljno spremenljivko. Pearsonova formula korelacijskega koeficienta je naslednja:

boost memory


3. Izdelava modela
V tem prispevku so kategorije raka dojke predvidene na podlagi modela XGBoost, naključnega gozda, logistične regresije in modela K-najbližjega soseda. Maligni rak dojke se obravnava kot pozitiven vzorec, benigni rak dojke pa kot negativen vzorec

Za rešitev problema neuravnoteženosti vzorca ta članek uporablja metodo stratificiranega vzorčenja [25] za ekstrahiranje učnega niza in testnega niza sorazmerno z vsemi vrstami vzorčnih podatkov. Stratificirano vzorčenje imenujemo tudi tipsko vzorčenje. Vzorčna populacija je razdeljena na subpopulacije, ki so druga od druge neodvisne. Naključno vzorčenje je bilo izvedeno sorazmerno z vsako subpopulacijo. Stratificirano vzorčenje črpa bolj reprezentativen vzorec in je primernejše za neuravnotežene vzorce.

Različna particija nabora podatkov lahko povzroči različne učinke modela. Zato ta članek izvaja dve skupini poskusov glede na različno delitev nabora vzorčnih podatkov. Prva skupina je nabor podatkov razdelila na učni niz in testni niz v razmerju 8 : 2, druga skupina pa je nabor podatkov razdelila na učni niz in testni niz v razmerju 7 : 3. Opazujte delovanje modela štirje algoritmi pri različnih particijah nabora podatkov.

3.1. Indikatorji vrednotenja. V tej študiji so bili za ovrednotenje napovednega učinka modela uporabljeni točnost, natančnost, priklic in F1-rezultat [26, 27]. Glede na specifičnost medicinske diagnoze je pričakovati, da je vse maligne oblike raka dojke mogoče predvideti. Zato je priklic tukaj vzet kot pomemben indeks vrednotenja. Večji kot je priklic, večji je delež malignega raka dojke, ki ga je mogoče predvideti. Rezultati klasifikacije modela lahko ustvarijo matriko zmede [28], kot je prikazano v tabeli 4

Tu je TP pravi pozitiven, kar kaže na število pozitivnih vzorcev, ki so predvideni kot pozitivni vzorci. TN je pravi negativ, ki označuje število negativnih vzorcev, predvidenih kot negativni vzorci. FP je lažno pozitiven, kar kaže število pozitivnih vzorcev, predvidenih iz negativnih vzorcev, kar se imenuje napaka tipa 1. FN je lažno negativen in označuje število pozitivnih vzorcev, predvidenih kot negativni vzorci, kar se imenuje napaka tipa 2

Natančnost, skrajšano kot P. Pri predvidenih rezultatih natančnost predstavlja, koliko pozitivnih predvidenih vzorcev je pozitivnih vzorcev, formula pa je:

10 ways to improve memory

short term memory how to improve

3.2. Model napovedovanja raka dojke na podlagi XGBoost. XGBoost, okrajšava za extreme gradient boosting, je algoritem Boosting [29]. Tako XGBoost kot naključni gozd sta integracijska algoritma, ki temeljita na odločitvenem drevesu. Za razliko od algoritma Bagging, algoritem Boosting gradi šibke učence enega za drugim, pri čemer kopiči več šibkih učencev z neprekinjenim ponavljanjem [30]. Ciljna funkcija je

ways to improve memory

. (9) Dodatek pravilnih členov lahko zmanjša varianco modela in naredi model, pridobljen z učnim nizom, enostavnejši, da se prepreči pojav overtinga. Algoritem XGBoost se uporablja za usposabljanje modela na naboru podatkov o usposabljanju. V procesu šolanja modela se parametri prilagodijo tako, da se pridobi boljši nabor parametrov, na koncu pa se pridobi optimalen napovedni model. Model je bil uporabljen za napovedovanje kategorij raka dojke v

nastavitev. Ko je bil nabor podatkov razdeljen na niz za usposabljanje in testni niz v razmerju 8:2, so bili točnost, natančnost, priklic in F1-rezultat modela XGBoost 0.974, {{5} }.960, 1.00 oziroma 0.980. Ko je bil model XGBoost razdeljen na niz za usposabljanje in testni niz v razmerju 7 : 3, so bili točnost, natančnost, priklic in F1-rezultat modela XGBoost 0,959, {{20} },946, 0,991 oziroma 0,968. Rezultati kažejo, da ima model XGBoost boljšo napovedno zmogljivost, ko je niz podatkov deljen z 8:2. Stopnja priklica 1 pomeni, da je model XGBoost pravilno napovedal vse maligne oblike raka dojke v vzorcu, kar je zelo pomembno za medicinsko diagnostiko

osis. 3.3. Model napovedovanja raka dojke na podlagi naključnega gozda. Naključni gozd je nadzorovan učni algoritem, ki združuje več dreves prek ideje Bagging [31–33]. Metoda bootstrap se uporablja za ekstrahiranje učnega vzorčnega niza iz izvirnih vzorčnih podatkov, ustrezen model odločitvenega drevesa pa se usposobi za vsak učni niz. Na koncu se glasuje o vseh osnovnih klasifikatorjih in tisti z največ glasovi je zadnja kategorija.

ways to improve brain function

krvav. Ko je bil nabor podatkov razdeljen na niz za usposabljanje in testni niz v razmerju 8:2, so bili točnost, natančnost, priklic in F1-rezultat naključnega gozdnega modela 0.965, {{5 }}.947, 1.00 oziroma 0.973. Ko je bil nabor podatkov razdeljen na niz za usposabljanje in niz za testiranje v razmerju 7 : 3, so bili točnost, natančnost, priklic in rezultat F1- 0.953, 0.946, { {18}}.981 oziroma 0.963. Rezultati kažejo, da ima naključni gozdni model boljšo zmogljivost napovedovanja, ko je nabor podatkov deljen z 8:2. Stopnja priklica tega modela je bila prav tako 1, kar kaže, da je naključni gozdni model tudi pravilno napovedal vse maligne dojke.

memory enhancement

ampak l. Trije osnovni elementi algoritma k najbližjega soseda so merjenje razdalje, izbira vrednosti k, odločitev o klasifikaciji. Trije osnovni elementi algoritma k najbližjega soseda so merjenje razdalje, izbira vrednosti k in pravilo odločitve o klasifikaciji.

Za problem izbire vrednosti K v algoritmu k najbližjega soseda ta dokument uporablja metodo desetkratne navzkrižne validacije (38, 39) in vzame stopnjo priklica kot indeks vrednotenja modela za izbiro ustrezne vrednosti k. Naj bo obseg vrednosti k 1–40 in za vsak k se izvede desetkratna navzkrižna validacija. Vrednost k z največjo stopnjo priklica je optimalna vrednost k. Priklic različnih vrednosti k pri desetkratnem navzkrižnem preverjanju je prikazan na sliki 1.

Iz slike 1 je razvidno, da ko se vrednost k poveča, se priklic zmanjša. Ko je k � 3 in k � 5, je odpoklic največji. Ker je vrednost k nastavljena premajhno, jo je enostavno premagati, zato je vrednost k tukaj nastavljena na 5.

Ko je bil nabor podatkov razdeljen na učni niz in testni niz z 8:2, so bili točnost, natančnost, priklic in F1-rezultat k-najbližjega sosednjega modela 0.912, { {6}}.888, 0.986 oziroma {{10}}.934. Ko je bil nabor podatkov razdeljen na nabor za usposabljanje in nabor za testiranje v razmerju 7 : 3, so bili točnost, natančnost, priklic in F1-ocena 0.930, {{21} },906, 0,991 oziroma 0,946. Rezultati kažejo, da ima model k-najbližjega soseda boljšo zmogljivost napovedovanja, ko je niz podatkov deljen s 7 : 3.

4. Primerjava in analiza

Da bi bolje razumeli delovanje modela, vzpostavljenega v tem dokumentu, ta dokument temelji na razvojnem okolju Python 3.9.7 in uporablja podatke o raku dojke, ki jih je za poskuse zagotovil dr. William z inštituta za klinične medicinske raziskave Univerze v Wisconsinu.

Eksperimentalno okolje je operacijski sistem Windows 11, procesor je Intel(R) Core(TM) i5-1155G7@ 2,50 GHz 2,50 GHz, pomnilnik pa 8.00 GB.

Eksperimentalni parametri vsakega modela so prikazani v tabeli 5 in izvedeni bodo naslednji trije rezultati primerjalne analize: (1) primerjava zmogljivosti vsakega modela v tem dokumentu, ko je nabor podatkov razdeljen na niz za usposabljanje in niz za testiranje v 8 : 2. (2) Primerjava zmogljivosti vsakega modela v tem prispevku, ko je niz podatkov razdeljen na niz za usposabljanje in testni niz v 7 : 3. (3) Primerjava z nekaterimi modeli v literaturi [11–14].

(1) Ko je niz podatkov razdeljen na niz za usposabljanje in niz za testiranje v razmerju 8:2, je zmogljivost vsakega modela prikazana v tabeli 6.

Kot je razvidno iz tabele 4, je pri razdelitvi nabora za usposabljanje in nabora za testiranje v razmerju 8:2 natančnost štirih metod strojnega učenja nad 0.9, med katerimi sta XGBoost in RF nad { {5}}.95. Natančnost napovedi XGBoost je 0.974, kar kaže na visoko natančnost napovedi. Kar zadeva natančnost, natančnost modela KNN ni visoka, pod 0.9, samo 0.888. XGBoost ima najvišjo natančnost, ki je 0.960. Kar zadeva priklic, so vsi priklici algoritmov XGBoost, naključnega gozda in logistične regresije 1. Algoritem k-najbližjega soseda ima najmanjši priklic, vendar je tudi nad 0,95. Za to študijo stopnje odpoklica predstavljajo delež vzorcev malignega raka dojke, ki so bili pravilno diagnosticirani. V medicini je treba bolezen diagnosticirati. Posledica nepostavljene diagnoze je zapoznelo zdravljenje, zaradi česar lahko bolnik zamudi najboljši čas za zdravljenje. To je veliko resnejše, kot če vam diagnosticirajo bolezen, ne da bi jo imeli. Zato je stopnja odpoklica zelo pomemben pokazatelj na področju diagnostike bolezni. Tukaj so odpoklic XGBoost, naključni gozd in algoritem logistične regresije vsi 1, kar kaže, da so bili vsi maligni raki dojke v vzorcih diagnosticirani. Za rezultat F{{20}} je razvidno, da so rezultati F1- XGBoost, naključni gozd in logistična regresija nad 0,95. F1-rezultat algoritma XGBoost je najvišji in dosega 0.980. Model K-najbližjega soseda ima najnižjo F1-rezultat 0,934. Ob upoštevanju štirih indikatorjev lahko rečemo, da je skupni učinek modela algoritma XGBoost boljši od ostalih treh modelov, ko je nabor podatkov razdeljen na nabor za usposabljanje in nabor za testiranje v razmerju 8:2. XGBoost ni le dosegel priklica 1, ampak je dosegel tudi priklic 0,95 ali več za ostale tri metrike.

(2) Ko je niz podatkov razdeljen na niz za usposabljanje in niz za testiranje v razmerju 7 : 3, je zmogljivost vsakega modela prikazana v tabeli 7.

Kot je razvidno iz tabele 7, ko sta vadbeni niz in testni niz razdeljena s 7 : 3, učinek modela XGBoost in RF ni tako dober kot učinek 8 : 2. Najprej, kar zadeva pomemben indeks odpoklic, ko nabor podatkov delimo z 8:2, sta bila odpoklica XGBoost in RF oba 1, zdaj pa sta se zmanjšala na 0.991 oziroma {{10}}.981 . Modela sta se nekoliko znižala tudi pri ostalih treh indeksih. Vendar se sprememba učinka napovedovanja logistične regresije in modela K-najbližjega soseda razlikuje od teh dveh algoritmov. Pri logističnem regresijskem modelu so se štirje kazalniki komajda spremenili, ko sta bila vadbeni in testni niz razdeljena s 7 : 3 oziroma 8 : 2. To kaže, da na model logistične regresije skoraj ne vplivajo različne particije nabora podatkov. V primeru delitve 7 : 3 med nizom za usposabljanje in testnim nizom je logistična regresija pokazala nižjo točnost, natančnost in rezultat F1- kot XGBoost in naključni gozd. Vendar pa je odpoklic modela logistične regresije 1, kar kaže, da je bil predviden ves maligni rak dojke, kar je zelo pomembno za diagnozo bolezni. Zato lahko rečemo, da je napovedni učinek modela logistične regresije boljši od ostalih treh algoritmov. Pri modelu KNN so se vsi štirje indeksi zvišali, ko sta vadbeni in testni niz razdeljena s 7 : 3. Odpoklic se je povečal na 0.991, kar je bilo višje kot pri naključnem gozdu. Natančnost, natančnost in F1-rezultat so se povečali s 0.912, {{30}}.887 in 0.934 na 0 0,930, 0,906 oziroma 0,946. Zato se model KNN obnese bolje v primeru vadbenega in testnega niza, deljenega s 7 : 3, kot model, deljen z 8 : 2. Analiza kaže, da delitev podatkovnih nizov ni fiksna. Za različne modele različne delitve prinašajo različne spremembe v učinku napovedi modela.
(3) Glede na primerjalno analizo tabel 6 in 7 ima model XGBoost, vzpostavljen v tem prispevku (deljenje vadbenega niza in testnega niza z 8:2), najboljši učinek, v nadaljevanju pa ga primerjamo z zmogljivostjo modela v literature [11–14], specifični rezultati pa so prikazani v tabeli 8.

Kot je razvidno iz tabele 8, sta uspešnejša modela od petih modelov logistični regresijski model iz literature [13] in model XGBoost, uveden v tem dokumentu. Priklic in natančnost modela v literaturi [13] sta 0.99 oziroma 0.98, priklic in natančnost modela v tem članku pa 1.{{8} } oziroma 0.974, v primerjavi z literaturo [13] je priklic modela visok, priklic v medicinski diagnozi pa kaže na verjetnost odkrivanja rakavih celic, kar je zelo pomembno za klasifikacijo celic raka dojke, zato ima model XGBoost, vzpostavljen v tem dokumentu, boljši učinek napovedovanja in se lahko uporablja kot medicinsko orodje za pomoč zdravnikom pri pripravi načrtov zdravljenja za bolnike z rakom dojke.

increase brain power

5. Zaključek

Ta članek je v glavnem predvidel kategorije raka dojke, od predhodne obdelave podatkov do izbire funkcij in nato do vzpostavitve modela. Nazadnje so bili rezultati napovedi primerjani in analizirani z več vidikov.

V tem dokumentu je odpoklic pomemben indeks za čim natančnejše napovedovanje vzorcev malignega raka dojke. Izvirni nabor podatkov je vseboval 30 funkcij, 15 funkcij pa je bilo izbranih kot vnos modela s Pearsonovim korelacijskim testom. Pred izdelavo modela so bili podatki standardizirani, da bi odpravili vpliv različnih dimenzij na učinke modela. Za problem neuravnoteženih pozitivnih in negativnih vzorcev se uporablja metoda stratificiranega vzorčenja za sorazmerno ekstrakcijo vadbenih in testnih nizov glede na različne kategorije podatkov. Pri izbiri optimalne vrednosti k pri k-najbližjem sosedu se priklic uporabi kot indeks vrednotenja modela, tako da je vrednost k z najvišjo stopnjo priklica optimalna vrednost.

Modele primerjamo in analiziramo s treh vidikov. Rezultati so prikazani takole:

pecti. Rezultati so prikazani na naslednji način: (1) V primeru delitve niza za usposabljanje in niza testov z 8 : 2 je priklic XGBoost, naključnega gozda in logistične regresije 1, kar lahko napove vse maligne raka dojke K - odpoklic najbližjega soseda je nekoliko nižji od 0.986 v primerjavi z drugimi tremi modeli. Za točnost napovedi, natančnost in oceno F1- modela so rezultati modela XGBoost boljši od rezultatov naključne gozdne in logistične regresije, ki so 0.974, {{1 0}}.96 oziroma 0,98, zato je model XGboost izbran kot končni model napovedi pod pogojem delitve vadbenega in testnega niza 8:2.

(2) V primeru delitve vadbenega in testnega niza v razmerju 7 : 3 so se vrednosti štirih indikatorjev ocenjevanja za XGBoost in naključni gozd znižale, vrednosti štirih indikatorjev ocenjevanja za model K-najbližjega soseda pa so bile. izboljšan, vendar je bil pri priklicu samo priklic modela logistične regresije 1, drugi modeli pa so bili nad 0.98, tako da je bil učinek napovedi modela logistične regresije najboljši, natančnost napovedi, natančnost in F1-rezultat logistične regresije je bil 0.947, {{10}}.922 oziroma 0,96.

improve your memory

(3) Iz poskusov je razvidno, da se pri različnih razdelitvah napovedni učinek modela razlikuje. Če primerjamo optimalne modele v dveh nizih različnih poskusov, lahko vidimo, da natančnost napovedi, natančnost in F1-rezultat modela XGBoost (ki deli vadbeni niz in testni niz z 8:2) so višje kot pri logističnem regresijskem modelu (ki vadbeni in testni niz deli s 7 : 3), ko je priklic 1, zato model XGBoost (ki vadbeni in testni niz deli z 8 : 2) deluje najboljši v modelu, vzpostavljenem v tem dokumentu. Poleg tega ima model XGBoost, vzpostavljen v tem dokumentu, v primerjavi z modeli v literaturi [11–14] boljši učinek in lahko natančno identificira maligne celice raka dojke. Vendar je ta raziskava omejena na numerične nabore podatkov in v prihodnosti bomo poskušali uporabiti algoritme globokega učenja za uporabo različnih tehnik ekstrakcije značilnosti slikovnih podatkov (kot so rentgenske slike), da bi dobili boljše rezultate klasifikacije.

Razpoložljivost podatkov

Podatki, ki podpirajo ugotovitve te študije, so javno dostopni v UCI Machine Learning Repository na https://archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+ %28Diagnostic%29.

Nasprotja interesov

Avtorji izjavljajo, da niso v nasprotju interesov.

Zahvala

To delo so podprli Kitajska nacionalna naravoslovna fundacija (dotacija št. 61502156), projekt poučevanja in raziskovanja odbora za izobraževanje Hubei (dotacija št. 282) in doktorska fundacija tehnološke univerze Hubei (dotacija št. BSQD13051).


Reference

[1] V. Fotedar, S. Fotedar, P. Takur, S. Vats, A. Negi in L. Chanderkant, "Poznavanje dejavnikov tveganja za raka dojke in metod za njegovo zgodnje odkrivanje med primarnimi zdravstvenimi delavci v Shimli, Himachal Pradesh," Journal of Education and Health Promotion, vol. 8, str. 265, 2019.

[2] MS Simon, TA Hastert, A. Barac, et al., "Kardiometabolični dejavniki tveganja in preživetje po raku v pobudi za zdravje žensk," Rak, vol. 127, št. 4, strani 598–608, 2021.

[3] HF Pasha, RH Mohamed, MM Toam in AM Yehia, "Genetske in epigenetske modifikacije gena za adiponektin: p," The Journal of Gene Medicine, vol. 21, št. 10, str. e3120, 2019.

[4] D. Hong, AJ Fritz, SK Zaidi et al., "Epitelijski v mezenhimski prehod in matične celice raka prispevajo k heterogenosti raka dojke," Journal of Cellular Physiology, vol. 233, št. 12, str. 9136–9144, 2018.

[5] J. Zhong, D. Sun, W. Wei et al., "Ultrazvočno vodena aspiracija s tanko iglo s kontrastom za biopsijo kontrolne bezgavke pri zgodnjem stadiju raka dojke", Ultrazvok v medicini in biologiji, vol. . 44, št. 7, str. 1371–1378, 2018.

[6] K. Babic, C. Siguan-Bell, M. Hee in SC Lin, "Očesni g: ultrazvočna ocena B-skena zadržane kirurške gobice po operaciji Ahmedove zaklopke: primer r," Journal of Glaucoma, vol. 26, št. 10, str. e239–e241, 2017.

[7] A. Yala, PG Mikhael, F. Strand, et al., "K robustnim modelom, ki temeljijo na mamografiji, za tveganje za raka dojke", Science Translational Medicine, vol. 13, št. 578, ID članka eaba4373, 2021.

[8] G. Zheng, X. Liu in G. Han, "Računalniško podprto odkrivanje in diagnostični sistem medicinske slike," Journal of Software, vol. 29, št. 5, str. 1471–1514, 2018.

[9] EY Huang, S. Knight, CR Guetter et al., "Telemedicina in telementorstvo v kirurških specialitetah: narativni pregled", The American Journal of Surgery, letnik 218, št. 4, str. 760–766, 2019.

[10] Q. Wu, BT Wang, HR Rao, Y. Jiang in C. Liu, "Celice raka dojke in benigne bolezni tvorijo meroslovne raziskave," Journal of Anhui Medical University, vol. 31, št. 02, str. 91–93, 1996.

[11] Q. Shen, F. Shao in R. Sun, "Model napovedi raka dojke, ki temelji na xgboost", Journal of Qingdao University (Natural Science Edition), vol. 32, št. 1. 2019.

[12] Z. Deng, B. Su in K. Zhan. g, "Razvrstitev raka dojke na podlagi skupnega učenja," China Medical Devices, vol. 35, št. 12. 2020.

[13] M. Monirujjaman Khan, S. Islam, S. Sarkar et al., "Primerjalna analiza, ki temelji na strojnem učenju, za napoved raka dojke", Journal of Healthcare Engineering, vol. 2022, ID artikla 4365855, 15 strani, 2022.

[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle in W. Ibrahim, "Drevesna analiza algoritmov in strojnega učenja za klasifikacijo raka dojke", Computational Intelligence and Neuroscience, vol. 2022, ID artikla 6715406, 6 strani, 2022.

[15] H. Dong in L. Ma, "Model napovedi trojno negativnega raka dojke na podlagi strojnega učenja," Journal of Yunnan University, vol. 39, št. 1, str. 111–115, 2017.


For more information:1950477648nn@gmail.com


Morda vam bo všeč tudi