Prepoznavanje prometnih znakov na podlagi algoritma YOLOv3 2. del
Jan 19, 2024
2. Osnove algoritma
2.1. Algoritem YOLOv3
YOLOv3 [14] je Redmonov izboljšan enostopenjski algoritem za odkrivanje ciljev, ki temelji na YOLOv2, ki ima izboljšano natančnost odkrivanja in zmogljivost v realnem času ter prekaša druge algoritme v smislu hitrosti in natančnosti.
V zadnjih letih je hiter razvoj tehnologije umetne inteligence omogočil uporabo različnih inteligentnih sistemov zaznavanja na različnih področjih. Natančnost zaznavanja je pomemben kazalec za ocenjevanje kakovosti inteligentnega sistema, pomnilnik pa je ena izmed temeljnih zmogljivosti, ki podpira delovanje inteligentnega sistema. Torej, kakšen je odnos med obema?
Najprej moramo pojasniti, da natančnost zaznavanja in spomin nista preprosta "pozitivna korelacija" ali "negativna korelacija". Med njimi obstaja visoka stopnja interakcije in koordinacije. V mnogih primerih je natančnost zaznavanja inteligentnega sistema odvisna od njegovega spomina, to je njegove sposobnosti razumevanja in učenja vzorčnih podatkov.
Na primer, na področju prepoznavanja obrazov mora biti dober sistem za prepoznavanje obrazov sposoben natančno prepoznati različne obraze in jih povezati s podatki o osebi v zbirki podatkov o znanih obrazih. To zahteva, da ima inteligentni sistem močan pomnilnik, da lahko shrani informacije o znanih obrazih v bazo podatkov in jih prilagodljivo uporablja pri naslednjih nalogah prepoznavanja.
Podobno morajo inteligentni sistemi na medicinskem področju razumeti in si zapomniti veliko količino medicinskega znanja, da pomagajo zdravnikom pri diagnosticiranju bolezni in oblikovanju načrta zdravljenja. To tudi zahteva, da ima inteligentni sistem močan spomin in učne sposobnosti, da nenehno absorbira novo medicinsko znanje ter navzkrižno preverja in nadgrajuje obstoječo bazo znanja.
Seveda razmerje med natančnostjo zaznavanja in spominom ni enosmerno. Ravno nasprotno, dobra natančnost zaznavanja lahko spodbuja tudi izboljšanje pomnilnika inteligentnih sistemov. Na primer, pri nekaterih nalogah razvrščanja in prepoznavanja morajo inteligentni sistemi nenehno zagotavljati povratne informacije in optimizacijo, da nenehno izboljšujejo svojo točnost in natančnost, s čimer dodatno krepijo sposobnost razumevanja in pomnjenja vzorčnih podatkov.
Na splošno sta natančnost zaznavanja in spomin dva nepogrešljiva elementa za delovanje inteligentnih sistemov. Imajo zapletene interakcije in odnose, ki jih je treba v celoti upoštevati in uskladiti. Samo z nenehnim izboljševanjem natančnosti zaznavanja in nenehnim krepitvijo spominskih in učnih zmogljivosti inteligentnega sistema je mogoče resnično uresničiti celovit razvoj in uporabo inteligentnega sistema. Vidi se, da moramo izboljšati spomin, in Cistanche deserticola lahko bistveno izboljša spomin, saj lahko Cistanche deserticola uravnava tudi ravnovesje nevrotransmiterjev, kot je povečanje ravni acetilholina in rastnih faktorjev. Te snovi so zelo pomembne za spomin in učenje. Poleg tega lahko meso izboljša pretok krvi in spodbuja dostavo kisika, kar lahko zagotovi, da možgani prejmejo dovolj hranilnih snovi in energije, s čimer se izboljša vitalnost in vzdržljivost možganov.

Kliknite poznajte dodatke za povečanje spomina
YOLOv3 je trenutno najbolj priljubljen algoritem v družini YOLO in se pogosto uporablja v realnih scenarijih zaznavanja [15]; struktura omrežja YOLOv3 je prikazana na sliki 1.

Celotna konvolucijska struktura, ki jo uporablja YOLOv3, ni omejena z velikostjo vhodne slike.
Plasti združevanja in popolnoma povezane plasti so odstranjene iz celotne omrežne strukture in namesto plasti združevanja se za operacijo zmanjševanja vzorčenja uporabi konvolucijska plast z velikostjo koraka 2, kar preprečuje izgubo ciljnih informacij med združevanjem in olajša odkrivanje majhnih tarč [ 16].
Poleg tega YOLOv3 nadomešča omrežno strukturo DarkNet-19 YOLOv2 s plastjo ekstrakcije funkcij DarkNet-53.
Omrežje DarkNet-53, ki uspešno rešuje problem gradienta globokega omrežja in izgubo izvirnih informacij med večslojnim konvolucijskim delovanjem za boljše izločanje funkcij ter izboljšanje odkrivanja in razvrščanja [17], si sposodi strukturo preostalega omrežja ResNet [ 18] in uporablja izvirni izhod prejšnje plasti kot del vhoda v zadnji plasti omrežja.
Kot je prikazano na sliki 2, je preostali modul v YOLOv3 sestavljen iz dveh konvolucijskih plasti in plasti bližnjice.

Poleg tega YOLOv3 uporablja pojem značilnega piramidnega omrežja (FPN) (19] in uvaja značilno piramidno omrežje za napovedovanje zemljevidov funkcij v treh lestvicah z lestvicami zaznavanja 13 x 13, 26 x 26 in 52 x 52.
Metoda ekstrakcije funkcij s konvolucijsko nevronsko mrežo je v omrežju FPN od spodaj navzgor, postopek povečanja vzorčenja zemljevidov funkcij konvolucijske plasti pa je od zgoraj navzdol, kot je prikazano na sliki 3.
2.2. Prostorska piramidalna združna struktura
Struktura prostorskega piramidnega združevanja (SPP) (20] rešuje problem ponovnega pridobivanja slikovnih značilnosti s konvolucijskimi nevronskimi mrežami in močno izboljša učinkovitost zaznavanja; struktura omrežja SPPNet je prikazana na sliki 4.

Za zagotovitev, da se ločljivost vhodne slike ujema z dimenzijo funkcije popolnoma povezane plasti v nevronski mreži s popolnoma povezano plastjo, so potrebne operacije obrezovanja regije in skaliranja na vhodni sliki.
Postopki spreminjanja velikosti in obrezovanja bodo povzročili izgubo informacij o značilnostih slike, zmanjšali natančnost zaznavanja in vplivali na rezultate zaznavanja: vendar bodo postopki spreminjanja velikosti in obrezovanja povzročili izgubo natančnosti zaznavanja informacij o funkcijah slike in vplivali na rezultate zaznavanja, medtem ko lahko SPPNet premaga omejitve fiksna velikost vhodne slike, prihranek pri računskih stroških 21.

3. Izboljšan YOLOv3
3.1. Izboljšana omrežna struktura YOLOv3
V osnovnem omrežju ekstrakcije značilnosti se običajno zmanjša petkratno vzorčenje, s stopnjo znižanja vzorčenja 2, večkratnost petkratnega znižanja vzorčenja pa je 32 na peto potenco dveh, glede na opis nabora podatkov COCO.
Če se zmanjševanje vzorčenja nadaljuje, bo pridobljeni zemljevid funkcij ena in ciljne informacije bodo izgubljene. Majhne tarče so manjše od 32 × 32 slikovnih pik, srednje tarče so 32 × 32–96 × 96 slikovnih pik, velikanske tarče pa večje od 96 × 96 slikovnih pik [22].
Kot je prikazano na sliki 5, je bil nabor podatkov o prometnih znakih TT100K, uporabljen v tem delu, večinoma sestavljen iz majhnih in srednjih ciljev, pri čemer so veliki cilji predstavljali le 7,4 % celotnega nabora podatkov, majhni cilji pa 42,5 % [23].

Nabor podatkov TT100K ima visoko ločljivost, pri čemer ima vsaka slika ločljivost 2048 × 2048 slikovnih pik, največji prometni znaki med majhnimi cilji pa predstavljajo manj kot 0,1 % celotne slike, kar predstavlja velik izziv za cilj detekcijski algoritem.
Majhne tarče imajo omejene lastnosti in zahtevajo veliko natančnost lokalizacije.
Kljub uvedbi strukture FPN v YOLOv3 za izkoriščanje fuzije funkcij v več merilih za izdelavo napovedi z združevanjem ugotovitev različnih slojev funkcij, kar je kritično za identifikacijo majhnih ciljev, so bili rezultati še vedno nezadovoljivi.
V omrežju YOLOv3 plitka plast vsebuje manj semantičnih informacij o značilnostih, vendar natančno ciljno lokacijo, medtem ko ima globoka plast več, vendar grobo ciljno lokacijo.
Posledično se za napovedovanje majhnih ciljev uporabljajo plitke konvolucijske plasti, za napovedovanje velikih ciljev pa globoke konvolucijske plasti. Četrta lestvica napovedi značilnosti velikosti 152 × 152 je bila dodana trem lestvicam napovedi funkcij strukture YOLOv3network, da bi v celoti izkoristili plitke funkcije v omrežju za predvidevanje majhnih ciljev.
Z velikostjo vhodne slike 608 × 608 je bila velikost funkcije izhodne slike 152 × 152 po konvoluciji in dvakratnem vzorčenju vhodne slike, plast značilnosti pa je bila inducirana skozi plast usmerjanja; ta ekstrakcija značilnosti je bila združena s funkcijo 11. plasti, da se poveča četrta lestvica napovedi lastnosti.
Poleg tega je bil dodan modul SPP za uresničitev združitve lokalnih in globalnih funkcij z izposojo pojma SPPNet in njegove kombinacije z YOLOv3.
Pred plastjo zaznavanja YOL je bil modul SPP integriran med peto in šesto konvolucijsko plast, zemljevidi funkcij modula SPP in združeni zemljevidi funkcij pa so bili ponovno povezani in posredovani naslednji omrežni plasti za zaznavanje.

Da bi dosegli fuzijo lokalnih in globalnih funkcij na ravni zemljevida funkcij, bi moralo biti največje združevalno jedro modula SPP čim bližje velikosti zemljevida funkcij, ki naj bi bil združen.
Da bi čim bolj zmanjšali računalniški napor, ki ga povzroča modul SPP, obogatili zmožnost izražanja zemljevida značilnosti in povečali učinek zaznavanja, je bil modul SPP v tej raziskavi sestavljen iz dveh vzporednih vej, od katerih je bila vsaka sestavljena iz plasti združevanja 19 × 19 max in ajump povezava. Slika 6 prikazuje izboljšano strukturo omrežja YOLOv3.

3.2. Izboljšana funkcija izgube
Funkcijo izgube YOLOv3 sestavljajo izguba središčne koordinate (izguba), izguba koordinate širine in višine (izguba), izguba zaupanja (lossconf) in izguba klasifikacije (izguba). Izguba osrednje koordinate je predstavljena z:

kjer λcoord označuje koordinatno izgubo teže; λnoobj označuje težo izgube zaupanja brez predmeta; Iobjij označuje, ali je j-to sidrišče i-te celice odgovorno za predmet (1 ali 0); Inobbyij označuje j-to sidrišče i-te mreže, ki ni odgovorno za predmet; (xi,yi,wji,hjI, CjI, Pji) označuje predvidene koordinate ciljnega polja, zaupanje in kategorijo; in (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) označuje dejanske koordinate ciljnega polja, zaupanje in kategorijo
Izgubna funkcija YOLOv3 je predstavljena z enačbo (5), kjer se izgubna funkcija srednje kvadratne napake (MSE) uporablja za regresijo mejnega polja, navzkrižna entropija pa se uporablja kot izgubna funkcija v lossconf in locals.
izguba=izgubaxy + izgubawh − izgubacon f − izgubacls (5)
Vendar pa je uporaba MSE kot funkcije izgube regresije omejevalne škatle neugodna za zaznavanje majhnih ciljev, občutljiva na velikost objekta in se osredotoča na velike cilje, medtem ko ni prijazna do majhnih objektov.
Za uravnoteženje izgube velikih in majhnih tarč ter povečanje rezultatov odkrivanja z oslabitvijo vpliva velikosti omejevalnega polja na funkcijo izgube širine in višine je bila v tem dokumentu uporabljena funkcija izgube tipa IoU, metrična izguba, ki jo ustvari IoU, pa je bila uporabljena kot enačba zmogljivosti (6).
IoU =|A ∩ B||A ∪ B|(6)
Ko se mejni okvir in ciljni okvir ne prekrivata, IoU=0 ne odraža vrzeli razdalje med obema poljema; ko se predvideno polje in označeno polje v celoti prekrivata, IoU=1, središčne točke omejevalnega polja ni mogoče določiti in velikostne vrzeli s ciljnim poljem ni mogoče dodatno optimizirati.
Izguba DIoU [24] ni odvisna od velikosti; tako velike velikosti ne bodo povzročile velike izgube. Ker majhna velikost povzroči majhno izgubo, ki lahko odpravi težavo, je to delo uporabilo izgubo DIoU, katere formula za izračun je predstavljena v enačbi (7).
D IoU izguba=1 − IoU +ρ2 b, bgt c2(7)
kjer b in bgt označujeta središčni točki, ρ je evklidska razdalja in c je dolžina diagonale najmanjšega okvirja, ki pokriva obe škatli.
Izguba DIoU zmanjša razdaljo med dvema ciljnima okvirjema neposredno, hitro konvergira in je bolj v skladu z regresijskim mehanizmom ciljnega okvirja, ki upošteva razdaljo med ciljem in sidrom, stopnjo prekrivanja in merilo, zaradi česar je regresija ciljnega okvirja boljša stabilen, hkrati pa še vedno zagotavlja smer gradienta za omejevalni okvir, ko se ne prekriva s ciljnim okvirjem.

For more information:1950477648nn@gmail.com






