Rozpoznávání samohlásky z krysí elektroencefalografie pomocí neuronové sítě s dlouhodobou krátkodobou pamětí, část 1
Dec 27, 2023
Abstraktní
V průběhu let byl proveden značný výzkum zaměřený na zkoumání mechanismů vnímání a rozpoznávání řeči.
Mezi vnímáním řeči a pamětí existuje neoddělitelný vztah. Vnímání řeči je pro nás důležitou schopností uvědomovat si zvukové signály a paměť je důležitým způsobem, který používáme k ukládání a získávání informací. Když jsme schopni lépe vnímat řeč, dokážeme si také lépe zapamatovat informace, které slyšíme.
Výzkumy ukazují, že vztah mezi vnímáním řeči a pamětí je obousměrný. Na jedné straně může špatné vnímání řeči vést k poškození paměti. Je to proto, že když neslyšíme řeč jasně, nemůžeme si přesně zapamatovat informace, které jsme slyšeli. Na druhou stranu silné vnímání řeči může zlepšit naši paměť. Když dokážeme správně vnímat a rozumět řeči, můžeme si také snáze zapamatovat, co slyšíme.
Proto bychom se měli zaměřit na kultivaci našich dovedností vnímání řeči, abychom zlepšili naši paměť. Toho lze dosáhnout trénováním našich dovedností naslouchání a porozumění řeči. Své vnímání řeči a paměť můžeme zlepšit činnostmi, jako je poslech nahrávek, sledování filmů a navštěvování jazykových kurzů.
Stručně řečeno, mezi vnímáním řeči a pamětí je úzký vztah a měli bychom se zaměřit na kultivaci našich dovedností vnímání řeči, abychom si paměť zlepšili. Prostřednictvím aktivního tréninku a cvičení můžeme neustále zlepšovat úroveň vnímání řeči a lépe porozumět a zapamatovat si, co slyšíme. Je vidět, že potřebujeme zlepšit paměť a Cistanche deserticola dokáže výrazně zlepšit paměť, protože Cistanche deserticola dokáže regulovat i rovnováhu neurotransmiterů, jako je zvýšení hladiny acetylcholinu a růstových faktorů. Tyto látky jsou velmi důležité pro paměť a učení. Kromě toho může maso také zlepšit průtok krve a podpořit dodávku kyslíku, což může zajistit, že mozek dostane dostatek živin a energie, a tím zlepší mozkovou vitalitu a vytrvalost.

Kliknutím na možnost Know zlepšíte krátkodobou paměť
Elektroencefalografie (EEG) je mocný nástroj pro identifikaci mozkové aktivity; proto se široce používá k určení nervového základu rozpoznávání řeči.
Zejména pro klasifikaci rozpoznávání řeči jsou v centru pozornosti přístupy založené na hlubokém učení, protože se mohou automaticky učit a extrahovat reprezentativní rysy prostřednictvím učení typu end-to-end.
Tato studie si kladla za cíl identifikovat konkrétní komponenty, které potenciálně souvisejí s reprezentací fonémů v mozku krys, a rozlišit mozkovou aktivitu pro každý samohláskový stimul na základě jednoho pokusu pomocí obousměrné sítě dlouhé krátkodobé paměti (BiLSTM) a klasických metod strojového učení.
Bylo použito devatenáct samců krys Sprague-Dawley podrobených chirurgickému zákroku implantace mikroelektrody k záznamu EEG signálů z bilaterálních předních sluchových polí. Bylo vybráno pět různých podnětů pro samohlásku, /a/, /e/, /i/, /o/ a /u/, které mají velmi odlišné frekvence formantů. EEG zaznamenané pod náhodně danými samohláskovými podněty bylo minimálně předzpracováno a normalizováno transformací z-skóre, které bylo použito jako vstup pro klasifikaci rozpoznávání řeči.
Síť BiLSTM vykázala nejlepší výkon mezi klasifikátory tím, že dosáhla celkové přesnosti, f{{0}}skóre, a Cohenových hodnot κ 75,18 %, 0,75, respektive 0,68, pomocí 10-násobného křížového ověření.
Tyto výsledky naznačují, že vrstvy LSTM mohou efektivně modelovat sekvenční data, jako je EEG; informativní funkce lze tedy odvodit prostřednictvím školení BiLSTM s komplexním učením bez jakýchkoli dalších ručně vytvořených metod extrakce vlastností.
Úvod
Řeč přenáší do mozku obrovské množství informací a je jedním z typických rysů mozku rozpoznávat a kategorizovat zvuky chovaných zvířat.
Vzhledem k jeho důležitosti se již více než 100 let provádějí pokusy prozkoumat mechanismy rozpoznávání zvuku řeči. Jedna z prvních neurolingvistických studií rozpoznávání řeči byla provedena prostřednictvím observační studie v 70. letech 19. století německým neuropsychiatrem, který zjistil klíčovou roli horního temporálního gyru ve vnímání řeči, z čehož vyvodil, že deficity rozpoznávání řeči byly spojeny s poškozením levého horního temporálního gyru [ 1].
Nyní je známo, že rozpoznávání řeči závisí především na dorzolaterálních temporálních lalocích, včetně horního temporálního gyru, který obsahuje primární sluchovou kůru (A1) a přední sluchové pole (AAF) [2].

Ačkoli způsob kódování a interpretace fonémů v mozku zůstává kontroverzní, bylo široce přijímáno, že rozpoznávání zvuku je kategorické. To znamená, že diskriminace je lepší pro podněty patřící do různých fonetických kategorií než pro podněty patřící do stejné kategorie, i když jsou akustické rozdíly ekvivalentní [3, 4].
Nejen lidé, ale i zvířecí percepční systémy třídí průběžně se měnící zvukové podněty do množiny diskrétních kategorií [5].
S pokrokem v neurofyziologických studiích byla elektroencefalografie (EEG) široce používána ve výzkumu zahrnujícím neurovědu a neurální inženýrství [6].
Díky vysokému časovému rozlišení a citlivosti na různé funkční mozkové stavy je EEG mocným nástrojem pro zkoumání mozkové aktivity v reálném čase a roste zájem o osvětlení nervové základny pro kategorické vnímání. Při studiích na lidech jsou signály EEG tradičně zaznamenávány neinvazivně z pokožky hlavy. Na úrovni zvukové nebo řečové percepce se ke studiu nervových korelátů kategoriální percepce široce používá chybná negativita (MMN), složka sluchově evokovaného potenciálu (AEP), která je vyvolána zvláštními zvuky [7, 8]. Naatanen a kol. nalezený důkaz pro jazykově závislé samohláskové reprezentace v lidském mozku [9].
Jiná studie zkoumala kategorické vnímání lexikálních tónů a zjistila, že mezikategoriální kontrast vyvolal větší MMN než rozlišení uvnitř kategorie [10]. V experimentech na zvířatech byly invazivními postupy získány přesnější signály EEG.
Například neurální koreláty kategorického vnímání a neurální reprezentace různých zvuků byly studovány pomocí extracelulárního záznamu akčního potenciálu.
Neurony zpěvných ptáků promítající striatum vykazují kategorické sluchové reakce a jsou vysoce citlivé na změny v délce tónu [11]. Kromě toho Kilgard a kol.studovali odlišné nervové reprezentace souhlásek a samohlásek pomocí intraparenchymálního záznamu v mozku potkana. Zaznamenáním vícejednotkových a jednojednotkových odpovědí z inferior colliculus a A1 navrhli, že hrot počítá samohlásky, zatímco časování hrotů kóduje souhláskové zvuky [12, 13].
Účinky tréninku zvukové diskriminace u potkaního modelu autismu byly také zkoumány na základě předchozích zjištění korelujících nervové reakce na zvukové podněty se schopností vnímání zvuku [14].
Nedávná studie navíc prokázala, že elektrokortikografie zaznamenaná vícekanálovým zářením koreluje s pasivní expozicí specifickému zvuku i ve sluchové kůře anestetizovaných potkanů [15].
Přístupy strojového učení byly použity k praktickému využití EEG v celé řadě studií. Využití metod strojového učení umožňuje zkoumat bohaté informace, které jsou vlastní a obtížně se odhalují ze signálů EEG [6].
Klasifikace založená na EEG může být proto prováděna v následujících oblastech pomocí konvenčních algoritmů strojového učení (např. stroj podporující vektor (SVM), k-nejbližší sousedé (KNN) a naivní Bayes (NB)): motorické snímky, rozpoznávání emocí, detekce duševních chorob, detekce potenciálu souvisejícího s událostmi (ERP) a tak dále [16, 17].

Kromě toho se v posledních letech díky rostoucím pokrokům v grafických procesorových jednotkách a dostupnosti velkých datových souborů stalo možné provádět klasifikaci založenou na EEG pomocí různých sítí hlubokého učení [6, 18, 19]. Ve srovnání s konvenčními metodami strojového učení sítě hlubokého učení mohou automaticky detekovat a extrahovat vhodné reprezentace ze vstupních dat [20, 21].
I s nedostatečnými předchozími odbornými znalostmi lze tedy získat slibné výsledky pomocí algoritmů hlubokého učení, které nevyžadují další ručně vyráběný proces extrakce vlastností [22, 23].
Například v oblasti řeči, obrázků a videa byly výsledky významně zlepšeny aplikací algoritmů hlubokého učení [24–26]. Není však jasné, zda takovéto nadprůměrné výsledky vždy doprovázejí klasifikační doménu založenou na EEG při použití přístupů hlubokého učení namísto tradičních metod strojového učení [27].
Roy et al. ukázali, že ve většině studií (s výjimkou čtyř ze 102 studií) vedl přístup hlubokého učení k vyššímu výkonu než tradiční přístup strojového učení a nejvyšší zlepšení přesnosti bylo 35,3 % [18, 28].
Kromě toho, mezi různými oblastmi klasifikačních studií založených na EEG, jsou klasifikační studie ERP aktivně prováděny použitím konvenčních metod strojového učení a hlubokého učení.
V rané studii byla tradiční metoda velkého průměru použita ke zlepšení nízkého poměru signálu k šumu (SNR), což je jedno z omezení signálů EEG, ak získání signálů ERP.
V těchto studiích bylo několik komponent ERP považováno za sady funkcí pro klasifikaci [29, 30]. Ve studiích na zvířatech se k rozlišení signálů ERP používají také vlastnosti ERP, jako je špičková amplituda a latence [31, 32].
Klasifikace založená na EEG v jednom pokusu však také získala velkou pozornost, protože je známo, že data EEG na úrovni jednoho pokusu obsahují více funkčních a bohatších informací než signály ERP získané tradiční metodou velkého průměru [33, 34].
Proto v následných studiích byly vlastnosti extrahované různými algoritmy, jako jsou algoritmy založené na vlnkách [35], modely Gaussových směsí [36] a prostorové filtrování [37] pro klasifikaci pomocí konvenčních metod strojového učení [38, 39]. ručně vyrobené prvky z jednozkušebního EEG jsou časově náročné a pracné, protože je nutné provést další kroky zpracování. V této souvislosti mohou metody hlubokého učení tento problém zmírnit tím, že umožňují úplné učení.
Nejrozšířenější architekturou hlubokého učení je konvoluční neuronová síť (CNN), po níž následuje rekurentní neuronová síť (RNN). CNN je speciálním typem architektury hlubokého učení široce používané pro klasifikaci založenou na EEG v jednom pokusu [6]. Vstupy CNN jsou odvozeny z nezpracovaných nebo předzpracovaných EEG dat, primárně v následující formě: počet kanálů × počet časových bodů v jednom pokusu.
Kromě toho byly prokázány značné výsledky klasifikace a bylo známo, že nejlépe funguje při použití spektrogramů jako vstupů [40–44]. Na rozdíl od CNN je RNN vysoce preferovanou architekturou, zejména při manipulaci se sekvenčními daty (jako v aplikacích pro zpracování přirozeného jazyka), protože opakované spojení architektury učení RNN umožňuje rekurzivně využít předchozí informace sítě jako aktuální vstupní data [45 ].
Dlouhá krátkodobá paměť (LSTM) je druh architektury RNN navržený Hochreiterem a Schmidhuberem k překonání explodujících a mizejících gradientních problémů RNN [46]. Obousměrný LSTM (BiLSTM) je dalším vývojem LSTM, který kombinuje přední a zadní skryté vrstvy pro přístup k předchozím i následujícím informacím.
Přestože je model BiLSTM mnohem složitější a může vyžadovat další výpočetní výkon, očekává se, že vyřeší úlohu sekvenčního modelování a klasifikace lépe než LSTM [47].
Dříve jsme zkoušeli klasifikovat EEG signály na základě jednoho pokusu pro tři samohlásky, /a/,/o/ a /u/, pomocí technik strojového učení pro lidský mozek.
Po aplikaci vhodných algoritmů zpracování signálu, včetně vícerozměrného empirického dekompozice (MEMD), byly EEG odezvy efektivně klasifikovány podle každého zvuku samohlásky pomocí klasifikátoru lineární diskriminační analýzy (LDA). Z časově-frekvenční reprezentace (TFR) signálů EEG bylo také stanoveno, že složky alfa pásma byly nejvíce souvisejícími nervovými reakcemi na vnímání zvuku samohlásek [48].
Vzhledem k nízkému SNR lidských EEG signálů je však třeba dále hodnotit zastoupení fonémů v mozku pomocí invazivnější záznamové techniky, která umožňuje získání spolehlivějších EEG signálů.
Kromě toho je nutné provést další studie klasifikačního výkonu každého algoritmu strojového učení při klasifikaci EEG odpovědí na různé fonémy.
Primárním účelem této studie bylo určit specifické komponenty EEG, které by mohly souviset s reprezentací řeči v mozku potkana, aby se dále osvětlily reakce mozku na rozpoznávání zvuku řeči.
Pro získání přesnějších EEG signálů byly epidurální EEG signály nereagující na sluchové podněty zaznamenány v AAF, o kterém je známo, že hraje zásadní roli ve sluchovém vnímání a kategorizaci [2]. Kromě toho se tato studie pokusila rozlišit různé mozkové reakce pro každý zvuk řeči na základě jediného pokusu pomocí sítí LSTM a dalších konvenčních technik strojového učení.
Byla vyslovena hypotéza, že síť BiLSTM by byla vhodná pro klasifikaci EEG odpovědí na samohláskové podněty a překonala by ostatní klasické klasifikátory, protože síť může fungovat robustně při modelování dlouhodobých závislostí sekvenčních dat, jako je EEG. Pokud je autorovi známo, sítě LSTM nebyly aplikovány na klasifikaci EEG odpovědí na sluchové podněty a toto je první studie, která používá algoritmus hlubokého učení k analýze epidurálních EEG signálů z AAF.

Navíc pomocí algoritmu hlubokého učení byly EEG reakce klasifikovány jako sluchové stimuly pomocí end-to-end učení s minimálně předzpracovanými EEG signály bez dalších metod extrakce příznaků.
For more information:1950477648nn@gmail.com






