Efikasna, dugotrajna, kratkoročna, memorija zasnovana analiza osjećaja recenzija e-trgovine, 2. dio

Jan 18, 2024

Muhammad et al. [20] je predstavio model za sentimentalnu analizu koristeći word2vec i LSTM za recenzije hotela.

Muhamed je prorok i osnivač islama. Poznat je kao mudar, mudar i mudar čovjek. Njegovo pamćenje je veoma moćno, što ga čini veoma efikasnim u procesuiranju informacija i izražavanju svojih misli.

Muhamedovo sjećanje ima mnogo veze s njegovim obrazovanjem i iskustvom. Prema zapisima, u mladosti je često bio udubljen u razmišljanje i razmišljanje. Ova radoznalost i žeđ za znanjem pomogli su mu da izgradi snažnu bazu znanja i sposobnost pamćenja.

Osim toga, Muhamedova inteligencija je također igrala veliku ulogu u njegovim sposobnostima pamćenja. Pametan je, duhovit, pronicljiv i ima sposobnost logičkog razmišljanja, što je vrlo korisno kada se radi sa složenim informacijama. Ova prednost mu je pomogla da bolje upravlja i kontroliše proces pamćenja, čime je poboljšao svoje pamćenje.

Međutim, Muhamedovo pamćenje nije bilo urođeno, već se poboljšavalo napornim radom i vježbom. Često provodi trening pamćenja, kao što je ponavljano čitanje, diktiranje i govor, kako bi mu pomogao da dublje razumije i savlada znanje.

Muhamedovo pamćenje nije bilo samo prirodni talenat, ono je poboljšano kroz naporan rad i praksu. Ovo pokazuje da svako od nas može poboljšati svoje pamćenje i poboljšati svoju efikasnost učenja i rada kroz učenje i praksu. Hajde da, poput Muhameda, aktivno radimo na stalnom usavršavanju svojih vještina pamćenja, kako bismo postigli veći uspjeh u životu i radu! Vidi se da moramo poboljšati pamćenje, a Cistanche deserticola može značajno poboljšati pamćenje, jer i Cistanche deserticola može regulisati ravnotežu neurotransmitera, kao što je povećanje nivoa acetilholina i faktora rasta. Ove supstance su veoma važne za pamćenje i učenje. Osim toga, meso može poboljšati protok krvi i promovirati isporuku kisika, što može osigurati da mozak dobije dovoljno hranjivih tvari i energije, čime se poboljšava vitalnost i izdržljivost mozga.

increase brain power

Kliknite Znaj da poboljšate kratkoročno pamćenje

Za ovu studiju, podaci su prikupljeni pretraživanjem web stranice za putovanja koristeći selen i otpad. +e Najvažnija svrha ovog eksperimenta bila je analiza tačnosti promjenom parametara word2vec i LSTM. +e rezultati su pokazali da se srednja tačnost od 85,96 može postići korištenjem parametara, što je pokazalo obećavajuće rezultate.

Zhao et al. [21] uveo je novu tehniku ​​za analizu osjećaja kupaca iz recenzija na web stranicama e-trgovine. +e predložena optimizirana tehnika "Elman NeuralNetwork (LSIBA-ENN) zasnovana na Improviziranom algoritmu Bata LocalSearch" uključuje četiri koraka i otkriva polaritet i klasifikuje osjećaje recenzija. +e podaci za ovo istraživanje prikupljeni su korištenjem alata za scrapping na web stranicama e-trgovine kako bi se izvukle recenzije kupaca.

Uz prethodnu obradu podataka, ova studija koristi "LogTerm Frequency-based Modified Inverse Class Frequency (LTF-MICF) i Hybrid Mutation based Earth Warm Algoritam (HMEWA)" za ponderiranje termina i odabir karakteristika. +e predložena metodologija je nadmudrila druge osnovne tehnike u smislu tačnosti predviđanja.

Jiang [22] je predložio model za klasifikaciju osjećaja recenzija dobijenih od platforme za e-trgovinu Taobao.+e studija koristi algoritam strojnog učenja kao i pomoćnu vektorsku mašinu za klasifikaciju i poboljšanu optimizaciju roja čestica (IPSO) za optimizaciju parametara. +e podaci za studiju prikupljeni su indeksiranjem komentara sa web stranice. +e eksperimentalni rezultati su pokazali da kombinovani pristup SVM-a i IPSO-a ima veću tačnost. Međutim, većina postojećih modela pati od prekomjernog prilagođavanja [23–25], slabe brzine konvergencije [26–28] i problema s gradijentom koji nestaje [29–31].

3. Eksperimentalna studija

+is odjeljak daje jasan pregled metodologije korištene u projektu za klasifikaciju osjećaja. +e tehnika koja je korištena je mreža dugotrajne memorije, koja se koristi za klasifikaciju velikog broja recenzija Amazondatabase. +e embedding koji se koristi je word2vec, koji je prilagođen u skladu sa bazom podataka.

Podešavanje word2veca prema skupu podataka poboljšava ukupne performanse modela. Prednost korištenja LSTM-a je da daje bolje rezultate čak i za nestrukturirane podatke pregleda. Sposoban je da dobije korisnu funkcionalnost za resurse koji sadrže dugoročne ovisnosti.

+e podaci se prikupljaju iz Amazonovog skupa podataka za pregled, koji se zatim prethodno obrađuje. Word2vec ugradnje predstavljaju važan korak u prethodnoj obradi podataka. Podaci o vlakovima i testovima su kreirani. +e podaci o obuci su podijeljeni u skupove podataka za obuku i validaciju. +e prilagođeni word2vec model je obučen po bazi podataka. Dobija se vektor karakteristika +e, koji se zatim koristi kao sloj za ugrađivanje za LSTM model.

Keras se koristi za izgradnju LSTM sekvencijalnog modela sa maksimalnim karakteristikama jednakim 50,000 i veličinom ugradnje jednakom 16. +emodel se zatim obučava za 10 epoha. +e model je testiran na osnovu sklearn metrike performansi. +e proces dobijanja karakteristika prikazan je na slici 2.

3.1. Skup podataka. Za generiranje tačnih rezultata, korišteni skup podataka treba biti velik i obogaćen. +e skup podataka prikupljen je iz odjeljka za mobilne telefone i pribor na mreži skupa podataka Amazon Reviews (2018). +e skup podataka sastoji se od ukupno 938.261 recenzija, među kojima je 47901 jedinstvenih proizvoda i 153124 jedinstvenih recenzija korisnika. +e set podataka se u početku sastoji od 7 kolona, ​​odnosno ocjene koja varira od 1 do 5, vremena pregleda, ID-a recenzenta, ID-a proizvoda i sažetka teksta recenzije.

Nakon izbacivanja duplikata, skup podataka se sastoji od 938254 zapisa, a tabela 2 prikazuje isječak zapisa originalnog skupa podataka.

3.2. Metodologija. Obučili smo naš model word2vec da se koristi sa LSTM modelom za klasifikaciju. Word2vec je ugrađivanje riječi koje se koristi za predstavljanje riječi kolekcijom nekoliko termina vektora. To je daleko od preslikavanja riječi u vektorski prostor. +e skup podataka se učitava u pandas okvir podataka. Za razvoj customword2vec modela, prvi korak je prethodna obrada podataka.

Gledamo samo ocjenu i pregledamo tekst i ispuštamo sve ostalo. +e tekst se čisti uklanjanjem interpunkcije. Kao poduzorak teksta kreiran je od blizu 200,000 recenzija, a metoda čistog teksta se primjenjuje za pretvaranje svake recenzije u listu riječi. +is lista riječi sada djeluje kao ulaz u genism word2vec model.

Napravili smo prilagođeni obučeni skip-gram word2vecmodel i instancirali model sa dimenzijama: veličina vektora riječi kao 100, veličina prozora jednaka 15, min_broji 2 za riječi koje se pojavljuju manje od 2 puta u našem korpusu, negativan jednak 5, a stopa uzorkovanja jednaka 1e−5. Koristili smo sve ove dimenzije da izgradimo vokabular iz naših rečenica za pregled.

increase memory

Treniramo naš word2vec model za 1000 epohe. +hr izračunavamo gubitak u svakoj epohi. +e gubitak je visok na početku i smanjuje se prema posljednjoj epohi. +e gubitak atepoch 0 je 2239394.0 i gubitak u epohi 1000 je 11504.0.+e sačuvani model se zatim ponovo učitava i operacije se izvode na njemu.

Na primjer, ako želimo pronaći riječi slične buci u našem skupu podataka, dobijamo otkazivanje i slušalice.

Slično, također možemo pronaći sličnost između određenih riječi kao što su slušalice i slušalice, što je {{0}}.48756, a sličnost između riječi punjenje i punjač je 0,89264.

Da bismo smanjili dimenzije naših podataka, koristili smo TSNE vizualizaciju da podatke iscrtamo u dvije dimenzije. Sada se ovi vektori riječi mogu koristiti za dalju klasifikaciju. +ove ugradnje se zatim koriste kao karakteristike za daljnji streaming.

3.2.1. Priprema podataka za LSTM. Naš skup podataka sastoji se od 938254 zapisa pri čemu većina recenzija ima distribuciju bodova veću od 3. Prvo smo izračunali broj riječi za svaku recenziju. +e prosječna srednja vrijednost se koristi kao statistika za pronalaženje prosječne dužine recenzija. +e srednja dužina recenzije je 44,59, a maksimalna dužina je 4303.

Napravili smo skup podataka koji se sastoji od recenzija koje imaju 100 riječi ili manje. Recenzije čija je dužina više od 20, ali manje od 100 kategorizirane su pod kratkim recenzijama, a ponovne objave pod dugim recenzijama. +e broj kratkih pregleda je 411313, a dugih 100239. Hiperparametri korišteni u modelu opisani su u tabeli 3.

Zatim smo definisali ocjenu osjećaja kao pozitivnu ako je ocjena veća ili jednaka 3; inače, ocjena je negativna. Uzeli smo u obzir tekst pregleda i mišljenje za kreiranje skupa podataka o vozu. +e testni podaci se sastoje od proizvoda koji imaju najmanje više od 10 recenzija.

Nakon distribucije, skup podataka o obuci sastojao se od ukupno 203891 zapisa, od kojih je 175910 pripadalo pozitivnoj, a 27981 negativnoj klasi. Skup podataka +e testa sastojao se od ukupno 686345 zapisa, od kojih je 592118 pripadalo pozitivnoj, a 94227 negativnoj klasi.

U ovoj studiji, koristili smo Keras da napravimo naš LSTM model, koji uzima maksimalno 50,000 karakteristika kao ulaz u sloj za ugrađivanje. Dugotrajna kratkoročna memorija (LSTM) je vrsta rekurentne neuronske mreže koja koristi unutrašnji mehanizam koji reguliše protok informacija.+interni mehanizam se sastoji od kapija koje je potrebno obučiti tako da mogu precizno filtrirati nerelevantne informacije i zadržati korisne informacije.

ways to improve brain function

Slika 3 prikazuje osnovnu arhitekturu LSTM modela u našoj predloženoj metodologiji.

Ht−1 i Xt su ulazi u LSTM jedinicu; Ht−1, koji se obično naziva kratkoročna memorija, uzima izlaz iz prethodnih stanja kao ulaz. +e memorijska ćelija ili dugotrajna memorija, Ct-1, pomaže u prenošenju relevantnih informacija kroz proces sekvence. +eLSTM arhitektura kombinuje tri kapije: gejt za zaborav, ulaznu kapiju i izlaznu kapiju. U LSTM jedinici, tanh i sigmoid funkcije se koriste za dobijanje ovih kapija.

+e podaci o vlaku su zatim podijeljeni na podatke o vlaku i validaciji jednake dužine. +e dužina podataka je izračunata na 101945, a distribucija klasa je bila {1: 87955, 0:13990}. Da bismo kreirali TensorFlow skupove podataka za testiranje i validaciju, moramo konvertovati naše podatke o vlaku u sekvence. Dopunili smo ih na maksimalnu dužinu od 100 tako da sve sekvence budu iste dužine. +e naljepnice za obuku i testiranje

improve your memory


For more information:1950477648nn@gmail.com



Moglo bi vam se i svidjeti