Prepoznavanje govora samoglasnika iz elektroencefalografije štakora korištenjem neuronske mreže dugog kratkoročnog pamćenja, dio 3
Dec 28, 2023
Klasifikatori mašinskog učenja
Performanse BiLSTM-a su upoređene sa konvencionalnim klasifikatorima mašinskog učenja: SVM sa linearnim jezgrom (SVM_lin), SVM sa jezgrom radijalne baze (SVM_rbf), slučajnim šumama (RF), NB i KNN.
Slučajna šuma je algoritam mašinskog učenja koji se trenutno široko koristi u različitim poljima analize podataka i predviđanja. U poređenju sa drugim algoritmima za mašinsko učenje, ima bolju robusnost i tačnost, a istovremeno efikasno smanjuje preopterećenje. Posljednjih godina opseg primjene nasumičnih šuma se širi, pa se čak može koristiti i za predviđanje određenih sposobnosti ljudskog pamćenja.
U polju kognitivne psihologije, pamćenje je veoma važan istraživački pravac. Naučnici su tražili jednostavan i efikasan način za procjenu nivoa ljudskog pamćenja. Posljednjih godina, pojava nasumičnih šuma donijela je nove ideje i metode u ovu oblast.
Random Forest može obučiti model da predvidi varijablu, što može biti bilo šta što želite da predvidite, uključujući sposobnost pamćenja. Naučnici mogu uneti relevantne faktore u nasumični šumski model kako bi predvidjeli koliko će osoba postići rezultat na testu pamćenja. Ovi faktori mogu biti faktori kao što su starost, nivo obrazovanja, pol, težina, itd., ili biološki pokazatelji kao što je struktura mozga. Prema istraživanjima, postoji određena veza između ovih faktora i ljudske sposobnosti pamćenja.
Prikupljanjem i analizom velikih količina test podataka od ispitanika, naučnici mogu izgraditi model koji predviđa sposobnost pamćenja u nasumičnom šumskom modelu. Predviđanje rezultata može pružiti vrijedne informacije o budućim performansama subjekta na određenom testu pamćenja.
Ukratko, algoritam nasumične šume pruža naučnicima novi način za procjenu nivoa ljudske memorije. U budućnosti bi njegova primjena mogla igrati važnu ulogu u kognitivnoj psihologiji, neuronauci i drugim poljima. Imamo razloga vjerovati da kombinacija nasumičnih šuma i drugih tehnika može pružiti širu perspektivu i dublje razumijevanje istraživanja funkcija ljudskog mozga. Vidi se da moramo poboljšati pamćenje, a Cistanche deserticola može značajno poboljšati pamćenje, jer i Cistanche deserticola može regulisati ravnotežu neurotransmitera, kao što je povećanje nivoa acetilholina i faktora rasta. Ove supstance su veoma važne za pamćenje i učenje. Osim toga, meso može poboljšati protok krvi i promovirati isporuku kisika, što može osigurati da mozak dobije dovoljno hranjivih tvari i energije, čime se poboljšava vitalnost i izdržljivost mozga.

Kliknite znati načine za poboljšanje funkcije mozga
SVM [74] ima za cilj da odredi optimalno odvojenu hiperravninu maksimiziranjem margine, što je rastojanje između vektora podrške. Koristeći trik kernela, SVM je sposoban da mapira prostor karakteristika od niskih do visokih dimenzija; stoga može efikasno izvršiti linearnu klasifikaciju i nelinearnu klasifikaciju.
RF [75] radi tako što konstruiše više stabala odlučivanja tokom faze obuke i generiše konačnu klasu koja kombinuje rezultate svakog stabla odluka. NB [76, 77] je probabilistički klasifikator zasnovan na Bayesovoj teoremi i uslovnoj vjerovatnoći koja obično pretpostavlja da su sve karakteristike nezavisne jedna od druge.
KNN [78] je neparametarski pristup koji klasifikuje ulaz na osnovu većinske klase njegovih k-najbližih susjeda u prostoru karakteristika. Obično se k vrijednost bira kao neparan broj kako bi se izbjegle vezane klase.
Za obuku i evaluaciju gore navedenih modela mašinskog učenja, korišten je isti 10-CV kao u BiLSTM. Svi modeli mašinskog učenja implementirani su korišćenjem biblioteke Scikit-Learn [73] u Pythonu.
Statističke analize
Sve statističke analize obavljene su korištenjem SPSS softvera (SPSS verzija 20.0, SPSS Inc.,Armonk, NY, USA) i MATLAB softverske verzije 2017b (Mathworks, Inc., MA, USA).
Podaci su analizirani parametarskom statistikom jer su svi podaci u studiji pokazali normalnu distribuciju u Shapiro-Wilkovom testu (p > 0.05). ANOVA je korištena za analizu statističke značajnosti TFR-ova prema različitim samoglasničkim stimulansima.
Pored toga, sprovedena je ponovljena ANOVA mjerenja kako bi se uporedile performanse svakog klasifikatora. Nakon toga, obavljena su poređenja u paru koristeći uparene t-testove između BiLSTM mreže i drugih klasičnih klasifikatora mašinskog učenja, a izvršena je i Bonferronijeva korekcija kako bi se prilagodila inflacija stope greške tipa I.
Statistička značajnost p-vrijednosti postavljena je na 0.01 kada se upoređuje TFR EEG odgovora, dok je nivo značajnosti thep-vrijednosti postavljen na 0,05 kada se poredi performanse između BiLSTM mreže i drugi klasifikatori mašinskog učenja.
Rezultati
Auditivni evocirani potencijali kao odgovor na samoglasnike
Ukupno 19 Sprague-Dawley pacova je podvrgnuto operaciji implantacije epiduralne elektrode, a svi pacovi su preživjeli operaciju. Kao rezultat toga, EEG odgovori na pet engleskih samoglasnika snimljeni su od 19 pacova anesteziranih izofluranom. Da bi se izdvojili srednji AEP valni oblici, svi neuralni odgovori su uprosječeni nad subjektima za svaki stimulus. Slika 4 predstavlja prosječne AEP valne oblike za svaki samoglasnički zvuk iz bilateralnog AAF-a.
Kao što se i očekivalo, svaki kategorički samoglasnički zvuk izazvao je različite neuronske aktivnosti u bilateralnom AAF-u sa različitim vršnim amplitudama i latencijama. Maksimalna amplituda AEP-a, definirana kao najveći zabilježeni napon nakon samoglasničkog podražaja, bila je najmanja za /i/ (61,74 ㎶ u lijevom AAF i 61,27 ㎶ u desnom AAF), dok su AEP kao odgovor na /a/ pokazali najveće amplitude vrha (92,12 ㎶ u lijevom AAF i 90,18 ㎶ u desnom AAF).
Vršna latencija, definirana kao trajanje od početka stimulusa do vršne amplitude je bila približno {{0}}.39 s do 0,5 s, najkraća u /i/(0. 39 s u lijevom i desnom AAF-u), a najduže u /o/ zvuku (0,51 s u lijevom i desnom AAF-u). Kao što je prikazano na slici 4, slični AEP valni oblici su uočeni sa lijevog i desnog AAF-a.

Vremensko-frekvencijska analiza EEG signala
Vremensko-frekvencijska analiza je moćna metoda za analizu nestacionarnih EEG signala u vremensko-frekvencijskoj ravni i koristi se za pružanje kvalitativnih informacija za klasifikaciju EEG-a [79, 80]. Stoga je TFR velikog prosječnog EEG-a izračunat za svaki zvuk kako bi se identificirale promjene u veličini i fazi EEG oscilacija na određenim frekvencijama koje se odnose na prepoznavanje samoglasnika (slika 5A).
Iz TFR analize, uočena je aktivacija velike snage oko delta (1–4 Hz), theta (4–8 Hz) i alfa (8–12 Hz) opsega na 0.3–{{8} }.6 s od početka stimulusa, bez obzira na govornu zvučnu stimulaciju.

Pored toga, sproveden je ANOVA test sa Bonferronijevom korekcijom da se analiziraju statistički značajne TFR komponente prema svakom samoglasničkom stimulusu.
Nakon toga, snaga statistički značajnih područja (p < {{0}}.01) je predstavljena F-vrijednošću (slika 5B). U analizi, većina EEG frekvencijskih opsega od 0,2-0,8 s se značajno razlikovala prema samoglasničkim podražajima.
Osim toga, dio TFR-a od {{0}}.8–1 s je također bio statistički različit za svaki stimulus. Uzimajući u obzir AEP valne oblike i rezultate ANOVA testova, zaključeno je da su AEP-ovi od 0.2–0,8 s nakon samoglasničkog stimulusa bili najinformativniji neuronski odgovori i povezani sa prepoznavanjem zvuka samoglasnika.
Obuka modela i evaluacija BiLSTM mreža
Na osnovu rezultata slike 5B, odabrani su EEG podaci koji su filtrirani propusnim opsegom između 1-60 Hz sa vremenskim prozorom od 0.2-0.8 s. Zatim su z-rezultati odabranih EEG podataka korišteni kao ulaz u BiLSTM mrežu.
Svi EEG podaci podijeljeni su u 10 puta unutar svakog subjekta kako bi se procijenile BiLSTM mreže. Dakle, performanse testa su dobijene po preklopu korištenjem obučenog modela sa preostalim naborima u 10-CV šemi.
Učinak mreže je procijenjen korištenjem metrike tačnosti, f{{0}}skora i Cohenove kapa statistike κ (slika 6 i tabela 1). Prosječna tačnost EEG diskriminacije pet klasa mreže BiLSTM bila je 75,18 ± 7.06% i f1-skor je bio 0,74 ± 0,08 . Cohenov κ bio je 0,68 ± 0,09, što je interpretirano kao umjereno slaganje [81].
Za detaljniju analizu performansi BiLSTM mreže, nacrtana je matrica konfuzije na slici 7. Ovo ukazuje da su mnoge greške nastale zbog pogrešne klasifikacije EEG odgovora na /u/ kao /a/ i /e/ kao /o/. Međutim, BiLSTM mreža je klasifikovala većinu EEG odgovora sa više od 50% tačnosti, što je visoka preciznost u petoklasnoj EEG klasifikaciji.

Poređenje BiLSTM mreže sa drugim metodama mašinskog učenja
Da bi se potvrdila efikasnost BiLSTM mreža u klasifikovanju EEG-a za prepoznavanje zvuka samoglasnika, rezultati su upoređeni sa rezultatima drugih konvencionalnih metoda mašinskog učenja. Slika 6 i tabela 1 pokazuju performanse klasifikatora mašinskog učenja.
RF je pokazao najveću tačnost klasifikacije među konvencionalnim algoritmima mašinskog učenja (tačnost: 63,21 ± 7,41%, f1-score: 0,62 ± 0.09, i Cohenov : 0.52 ± 0.1). U statističkoj analizi, performanse klasifikacije RF nisu bile značajno veće od onih SVM_lin i SVM_rbf, dok su pokazale veće performanse u poređenju sa onima NB i KNN.
Međutim, kada su performanse konvencionalnih algoritama mašinskog učenja, uključujući RF, upoređene sa BiLSTM, bilo je očigledno da je BiLSTM mreža superiorna za sve metrike korištene u studiji (p < 0.01).
U matrici konfuzije, konvencionalni algoritmi mašinskog učenja ne mogu dobro razlikovati određene EEG odgovore. Konkretno, svi konvencionalni algoritmi mašinskog učenja imaju poteškoća u razlikovanju zvuka /u/. Uočeno je da su algoritmi pokazali tendenciju pogrešnog klasificiranja zvuka /u/ kao /a/ u prosjeku 30% vremena (25,96% u NB do 36,97% u KNN), što je rezultiralo smanjenjem ukupne izvedbe klasifikacije (slika 7) .

Diskusija
U ovoj studiji, epiduralni EEG odgovori štakora na pet kategoričkih samoglasničkih zvukova (/a/, /e/, /i/, /o/, i/u/) su diskriminisani pomoću BiLSTM mreže. Klasifikacija epiduralnih EEG signala u pet klasa izvršena je na bazi jednog pokušaja, što je poznato kao izazov. Kako bi se maksimizirale performanse učenja, ova studija je pokušala odrediti specifične komponente EEG-a koje bi mogle imati veze s prepoznavanjem govornih zvukova u mozgu pacova i koristila je ove komponente EEG-a kao ulazne karakteristike. Kao rezultat toga, relativno visoke performanse u klasifikaciji AEP-a u pet različitih samoglasničkih zvukova postignute su korištenjem BiLSTM. Poređenje performansi klasifikacije BiLSTM mreže sa drugim algoritmima mašinskog učenja pokazalo je da je BiLSTM mreža nadmašila druge klasične klasifikatore. Ovi rezultati pokazuju da BiLSTM mreža obučena sa EEG komponentama koje se odnose na prepoznavanje govora pouzdano klasifikuje AEP za svaki kategorički samoglasnički zvuk sa visokim stepenom tačnosti. Koliko znamo, LSTM mreže nisu primijenjene na klasifikaciju EEG odgovora na slušne stimuluse, a ovo je prva studija koja koristi algoritam dubokog učenja za analizu EEG signala iz AAF štakora.

Trenutno je samo nekoliko studija koristilo LSTM arhitekturu za postizanje vrhunskih rezultata u klasifikaciji zasnovanoj na EEG-u. LSTM arhitektura je pogodna za klasifikaciju zasnovanu na EEG-u, jer njena lančana struktura može uhvatiti vremenski slijed EEG podataka [82]. Na početku, istraživanje se fokusiralo na poboljšanje rezultata klasifikacije kroz različite LSTM arhitekture; međutim, ulazne karakteristike su i dalje ekstrahovane ručno, kao u konvencionalnim metodama mašinskog učenja [83, 84].
Tsiouris et al. procijenio performanse različitih kombinacija LSTM mrežnih elemenata kako bi pronašao najefikasnije LSTM arhitekture za otkrivanje epileptičkih napada, čime je dobio skoro savršene rezultate u predviđanju napadaja (100% osjetljivosti i 99.86% specifičnosti) [83]. Budući da je LSTM moćna struktura za obradu sekvencijalnih podataka, neke studije koriste neobrađene EEG podatke kao ulazne karakteristike sa minimalnom prethodnom obradom. Kako LSTM mreža direktno uči karakteristike iz neobrađenih EEG podataka, performanse u studijama prepoznavanja emocija poboljšane su za najmanje 12% [85], a rezultati studija klasifikacije motornih slika su također poboljšani [86], u poređenju s drugim tradicionalnim tehnike izdvajanja karakteristika.
Štaviše, BiLSTM arhitektura je korištena za klasifikaciju zasnovanu na EEG-u jer može pristupiti informacijama iz prošlih i budućih stanja. Stoga, otkrivajući različita stanja mozga koja se odražavaju u EEG podacima, kao što su napadi, san, itd. [63–67], BiLSTM mreža je generalno nadmašila LSTM mrežu koja samo hvata prošle informacije iz sekvence u smjeru naprijed. Iz tog razloga, visoke performanse su zabilježene u nedavnoj klasifikaciji zasnovanoj na EEG-u korištenjem BiLSTM mreža. Sharma et al. postigao 82,01% tačnost klasifikacije za četiri tipa emocija na osnovu BiLSTM algoritma i statistike višeg reda [87]. Pored toga, BiLSTM mreže su uspješno klasificirale epilepsijske tipove i faze spavanja [88, 89].
Slično prethodnim studijama, ova studija je postigla relativno dobre rezultate koristeći BiLSTMnetworks. Predloženi algoritam je uspješno diskriminirao EEG odgovore na pet samoglasničkih zvukova sa visokim vrijednostima tačnosti, f{{0}}skor i Cohenov κ od 75,18%, 74,43% i 0,68, respektivno. Vrijednost Cohenovog κ za petoklasnu klasifikaciju je veća od one koja se vidi u većini aktuelnih studija [90]. Kao što je ilustrovano na slici 6, BiLSTM metoda je proizvela najveću vrijednost za sve metrike u poređenju s drugim metodama mašinskog učenja. Pored toga, da bi se utvrdila statistička razlika u performansama klasifikacije, analizirani su rezultati ponovljenih mjerenja ANOVA između BiLSTM i drugih klasičnih metoda mašinskog učenja koristeći sve metričke vrijednosti. Statističkom analizom utvrđeno je da je učinak klasifikacije BiLSTM mreže značajno veći od ostalih klasičnih metoda mašinskog učenja (p < 0,01). Ovaj rezultat je također bio u skladu sa matricom konfuzije. Kao što je prikazano na slici 7, BiLSTM mreža je dobro predvidela prave oznake pet samoglasničkih zvukova, dok klasične metode mašinskog učenja nisu.
Predviđanje dobijeno pomoću konvencionalnog klasifikatora mašinskog učenja bilo je posebno loše u klasifikaciji zvuka /u/; /u/zvuk je uglavnom pogrešno protumačen kao /a/. Čak je i RF, koji je pokazao najbolje performanse među pet konvencionalnih klasifikatora mašinskog učenja, imao stopu klasifikacije od 34,48% za/u/ zvuk, sa 33,89% stope pogrešne klasifikacije zvuka /u/ kao /a/ zvuka. Kao što se može vidjeti na slici 4, /a/ i /u/ zvukovi su imali sličnu vršnu latenciju, što je jedna od glavnih karakteristika AEP valnih oblika (vršna latencija zvuka /a/: 0.448, vrh latencija zvuka /u/: 0.444). Kada je klasifikacija izvršena na osnovu minimalno prethodno obrađenih jednoprobnih EEG signala, čini se da se takve sličnosti ne mogu razlikovati konvencionalnim algoritmima mašinskog učenja, dok BiLSTM mreža mogao ih razlikovati.
S obzirom da BiLSTM mreža može istovremeno pristupiti svim prošlim i budućim kontekstima, bogate informacije se mogu naučiti kroz ovu mrežu. Osim toga, iako su karakteristike koje odražavaju karakteristike EEG odgovora na svaki samoglasnički zvuk izvučene direktno iz smjera naprijed i nazad LSTM sloja, performanse klasifikacije su poboljšane. U ovoj studiji možemo izvući dobre rezultate klasifikacije koristeći jednostavnu BiLSTM arhitekturu bez dodatnog ručno izrađenog procesa ekstrakcije karakteristika.
Klasifikacija ERP odgovora na govorne podražaje u jednom ispitivanju je vrlo izazovna zbog karakteristika niskog SNR-a EEG-a. Iako je jedna od ključnih prednosti metode dubokog učenja njena sposobnost da nauči karakteristike visokog nivoa bez ekstrakcije ključnih karakteristika, pokušali smo da odaberemo najrelevantnije EEG signale koji se odnose na prepoznavanje govora kako bismo postigli bolje performanse. U ovoj studiji, uočeni su različiti AEP valni oblici koji odgovaraju svakom govornom zvučnom stimulansu uz veliku snagu aktivacije niskofrekventnog pojasa, uključujući delta, teta i alfa opsege, u TFR analizama. Opšte je poznato da neuronske oscilacije u thealfa pojasu igraju važnu ulogu u slušnoj obradi.Mazaheri et al. izvijestili su da je slabljenje alfa aktivnosti usko povezano sa razlikovanjem slušnih ciljeva [91].
Staruß et al. dokazali da su kortikalne alfa oscilacije ključni mehanizam za selektivno inhibiranje obrade buke kako bi se poboljšala slušna selektivna pažnja prema ciljnim signalima [92]. Ranije smo također otkrili da je alfa snaga bila visoko aktivirana u bilateralnim temporalnim područjima nakon specifičnih zvučnih podražaja koji su se statistički razlikovali u pogledu vrste zvuka [48]. Osim toga, poznato je da su delta i theta pojasevi povezani s oblikovanjem segmentacije i perceptivnog utjecaja akustičkih informacija [93].
Iako je ova studija zasnovana na eksperimentalnim podacima na životinjama, slične komponente vezane za govor, u poređenju sa prethodnim studijama na ljudima, uočene su u TFR analizama. Štaviše, u statističkoj analizi, utvrđeno je da su svi EEG trakovi značajni unutar 1 štiti stimuluse i predstavlja EEG komponente vezane za percepciju zvuka. Ovi rezultati su se donekle razlikovali od onih prethodnih studija, sugerirajući da su samo specifični EEG pojasevi, kao što je alfa opseg, povezani sa percepcijom zvuka. Očekuje se da se čak i suptilne promjene u svim aktivnostima EEG opsega zabilježe putem epiduralnog EEG snimanja jer osigurava veći SNR smanjenjem provođenja volumena i eliminacijom artefakata koji su inherentni ekstrakranijalnim EEG snimcima.
U ovoj studiji su određene komponente EEG-a koje se odnose na prepoznavanje govornih zvukova kod pacova i AEP komponente su uspješno klasifikovane korištenjem BiLSTM mreže. Međutim, ova studija je imala neka ograničenja. Prvo, broj uključenih predmeta bio je premali, posebno za duboko učenje. Štaviše, ova studija nije procjenjivala performanse svakog klasifikatora eksternom validacijom, već je umjesto toga koristila 10-CV kako bi se prevazišle ograničene veličine uzorka. Osim toga, ne možemo isključiti mogućnost da slušni sistem pacova kontinuirano reaguje na zvuk jer je u ovoj studiji korišten samo jedan izgovor svakog samoglasnika. Pored toga, na dobijene EEG odgovore uticali su anestetički efekti. Iako je korištena minimalna doza anestetika, usporavanje frekvencije s povećanjem delta snage je tipičan nalaz EEG promjena nakon inhalacije izoflurana [94]. Stoga, komponente EEG-a za prepoznavanje samoglasnika predložene u ovoj studiji mogu se razlikovati od EEG signala dobivenih od pacova koji se probude. Međutim, vjerujemo da je kvalitet EEG signala dovoljno dobar budući da je EEG snimljen implantacijom epiduralne elektrode, a nije kontaminiran artefaktima pokreta.
Zaključci
U zaključku, ova studija je izdvojila značajne neuronske komponente vezane za kategoričku percepciju govora. Nadalje, na osnovu karakteristika LSTM mreža, dokazano je da je BiLSTM mreža pogodna za klasifikaciju EEG odgovora sa minimalno prethodno obrađenim AEP. Budući da je ova studija pionirsko istraživanje sa podacima o životinjama, možda neće biti direktno prenosiva na druge praktične aplikacije kao što su interfejsi mozak-računar ili alternativna komunikacijska pomagala za ljude.

Stoga su potrebne buduće studije sa ljudskim EEG podacima kako bi se potvrdila efikasnost BiLSTM mreže u klasifikaciji slušnog prepoznavanja govora zasnovanog na EEG-u. Dodatno, potrebno ga je ponovo procijeniti radi optimalnog podešavanja parametara i ekstrakcije karakteristika. Očekuje se da će ova studija pružiti novi pristup za analizu EEG signala, kao i vrijedne informacije o mehanizmima percepcije i prepoznavanja govora u mozgu.

Reference
1. Wernicke C. Kompleks simptoma afazije. U: Cohen RS, Wartofsky MW, urednici. Proceedings of the Boston Colloquium for the Philosophy of Science 1966/1968. Dordrecht: Springer Holandija; 1969. str. 34–97.
2. Shi Z, Yan S, Ding Y, Zhou C, Qian S, Wang Z, et al. Prednje slušno polje je potrebno za zvučnu kategorizaciju u zadatku uslovljavanja straha kod odraslih pacova. Front Neurosci. 2019; 13: 1374.
3. Liberman AM, Harris KS, Hoffman HS, Griffith BC. Diskriminacija govornih zvukova unutar i preko granica fonema. J Exp Psychol. 1957; 54: 358–368.
4. Johnson K. Akustična i slušna fonetika. Chichester: Wiley-Blackwell; 2012.
5. Green PA, Brandley NC, Nowicki S. Kategorična percepcija u životinjskoj komunikaciji i donošenju odluka. Behav Ecol. 2020; 31: 859–{5}}.
6. Craik A, He Y, Contreras-Vidal JL. Duboko učenje za zadatke klasifikacije elektroencefalograma (EEG): Pregled. J Neural Eng. 2019; 16:28.
7. Na¨a¨ta¨nen R, Paavilainen P, Rinne T, Alho K. Nepodudarnost negativnosti (MMN) u osnovnim istraživanjima centralne slušne obrade: pregled. Clinical Neurophysiology. Elsevier; 2007. str. 2544–2590.
8. Garrido MI, Kilner JM, Stephan KE, Friston KJ. Negativnost neusklađenosti: pregled osnovnih mehanizama. Clinical Neurophysiology. Elsevier; 2009. str. 453–463
For more information:1950477648nn@gmail.com






