Learning capabilities in Transformer Neural Networks

Variš, Dušan

Schopnosti učení v transformerových neuronových sítích

dc.contributor.advisor	Bojar, Ondřej
dc.creator	Variš, Dušan
dc.date.accessioned	2024-04-08T10:48:52Z
dc.date.available	2024-04-08T10:48:52Z
dc.date.issued	2023
dc.identifier.uri	http://hdl.handle.net/20.500.11956/188234
dc.description.abstract	Title: Learning Capabilities of the Transformer Neural Networks Author: Dušan Variš Department: Institute of Formal and Applied Linguistics Supervisor: doc. RNDr. Ondřej Bojar, Ph.D., Institute of Formal and Applied Linguistics Abstract: Although the contemporary neural networks, inspired by biological neurons, were able to reach human-like performance on many tasks in recent years, their optimiza- tion (learning) process is still very far from the one observed in humans. This thesis investigates various aspects of learning in the current state-of-the-art Transformer neural networks, the dominant architecture in the current neural language process- ing. Firstly, we measure the level of generalization in Transformers using several probing experiments based on the idea of adversarial evaluation. Secondly, we ex- plore their potential for incremental learning when combined with regularization using the elastic weight consolidation approach. Lastly, we propose a modular ex- tension of the existing Transformer architecture enabling subnetwork selection con- ditioned on the intermediate hidden layer outputs and analyze the attributes of this network modularization. We investigate our hypotheses mainly within the scope of neural machine translation and multilingual translation showing the limitations of the...	en_US
dc.description.abstract	Název práce: Schopnosti učení neuronových sítí Transformer Autor: Dušan Variš Katedra: Ústav formální a aplikované lingvistiky Vedoucí práce: doc. RNDr. Ondřej Bojar, Ph.D., Ústav formální a aplikované lingvistiky Abstrakt: Přestože současné neuronové sítě, inspirované biologickými neurony, byly v posled- ních letech schopny dosáhnout lidské úrovně na mnoha úlohách, proces jejich op- timalizace (učení) je stále velmi odlišný od procesů pozorovaných u lidí. Tato práce zkoumá různé aspekty učení současných neuronových sítí Transformer, převláda- jící architektury pro zpracování přirozeného jazyka. V první části zkoumáme úro- veň generalizace v Transformerech pomocí analytických experimentů založených na myšlence adversariální evaluace. V části druhé pak zkoumáme jejich potenciál pro kontinuální učení s použitím regularizace založené na elastické konsolidaci vah. V závěru práce navrhujeme modulární rozšíření stávající sítě Transformer umožňující výběr podsítí podmíněný zpracovaným vstupem spolu s demonstrací vlastností této síťové modularizace. Naše hypotézy testujeme především v kontextu neuronového strojového překladu a vícejazyčného překladu, přičemž naměřené výsledky odhalují limity původního Transformeru i metody regularizace pomocí elastické konsolidace vah. Navíc prezentujeme slibné výsledky navržené...	cs_CZ
dc.language	English	cs_CZ
dc.language.iso	en_US
dc.publisher	Univerzita Karlova, Matematicko-fyzikální fakulta	cs_CZ
dc.subject	neuronový strojový překlad\|katastrofické zapomínání\|modulární neuronové sítě\|navazující učení\|generalizace	cs_CZ
dc.subject	neural machine translation\|catastrophic forgetting\|modular neural networks\|incremental learning\|generalization	en_US
dc.title	Learning capabilities in Transformer Neural Networks	en_US
dc.type	dizertační práce	cs_CZ
dcterms.created	2023
dcterms.dateAccepted	2023-03-24
dc.description.department	Institute of Formal and Applied Linguistics	en_US
dc.description.department	Ústav formální a aplikované lingvistiky	cs_CZ
dc.description.faculty	Faculty of Mathematics and Physics	en_US
dc.description.faculty	Matematicko-fyzikální fakulta	cs_CZ
dc.identifier.repId	177547
dc.title.translated	Schopnosti učení v transformerových neuronových sítích	cs_CZ
dc.contributor.referee	Sennrich, Rico
dc.contributor.referee	Dušek, Ondřej
thesis.degree.name	Ph.D.
thesis.degree.level	doktorské	cs_CZ
thesis.degree.discipline	Computational linguistics	en_US
thesis.degree.discipline	Matematická lingvistika	cs_CZ
thesis.degree.program	Computational linguistics	en_US
thesis.degree.program	Matematická lingvistika	cs_CZ
uk.thesis.type	dizertační práce	cs_CZ
uk.taxonomy.organization-cs	Matematicko-fyzikální fakulta::Ústav formální a aplikované lingvistiky	cs_CZ
uk.taxonomy.organization-en	Faculty of Mathematics and Physics::Institute of Formal and Applied Linguistics	en_US
uk.faculty-name.cs	Matematicko-fyzikální fakulta	cs_CZ
uk.faculty-name.en	Faculty of Mathematics and Physics	en_US
uk.faculty-abbr.cs	MFF	cs_CZ
uk.degree-discipline.cs	Matematická lingvistika	cs_CZ
uk.degree-discipline.en	Computational linguistics	en_US
uk.degree-program.cs	Matematická lingvistika	cs_CZ
uk.degree-program.en	Computational linguistics	en_US
thesis.grade.cs	Prospěl/a	cs_CZ
thesis.grade.en	Pass	en_US
uk.abstract.cs	Název práce: Schopnosti učení neuronových sítí Transformer Autor: Dušan Variš Katedra: Ústav formální a aplikované lingvistiky Vedoucí práce: doc. RNDr. Ondřej Bojar, Ph.D., Ústav formální a aplikované lingvistiky Abstrakt: Přestože současné neuronové sítě, inspirované biologickými neurony, byly v posled- ních letech schopny dosáhnout lidské úrovně na mnoha úlohách, proces jejich op- timalizace (učení) je stále velmi odlišný od procesů pozorovaných u lidí. Tato práce zkoumá různé aspekty učení současných neuronových sítí Transformer, převláda- jící architektury pro zpracování přirozeného jazyka. V první části zkoumáme úro- veň generalizace v Transformerech pomocí analytických experimentů založených na myšlence adversariální evaluace. V části druhé pak zkoumáme jejich potenciál pro kontinuální učení s použitím regularizace založené na elastické konsolidaci vah. V závěru práce navrhujeme modulární rozšíření stávající sítě Transformer umožňující výběr podsítí podmíněný zpracovaným vstupem spolu s demonstrací vlastností této síťové modularizace. Naše hypotézy testujeme především v kontextu neuronového strojového překladu a vícejazyčného překladu, přičemž naměřené výsledky odhalují limity původního Transformeru i metody regularizace pomocí elastické konsolidace vah. Navíc prezentujeme slibné výsledky navržené...	cs_CZ
uk.abstract.en	Title: Learning Capabilities of the Transformer Neural Networks Author: Dušan Variš Department: Institute of Formal and Applied Linguistics Supervisor: doc. RNDr. Ondřej Bojar, Ph.D., Institute of Formal and Applied Linguistics Abstract: Although the contemporary neural networks, inspired by biological neurons, were able to reach human-like performance on many tasks in recent years, their optimiza- tion (learning) process is still very far from the one observed in humans. This thesis investigates various aspects of learning in the current state-of-the-art Transformer neural networks, the dominant architecture in the current neural language process- ing. Firstly, we measure the level of generalization in Transformers using several probing experiments based on the idea of adversarial evaluation. Secondly, we ex- plore their potential for incremental learning when combined with regularization using the elastic weight consolidation approach. Lastly, we propose a modular ex- tension of the existing Transformer architecture enabling subnetwork selection con- ditioned on the intermediate hidden layer outputs and analyze the attributes of this network modularization. We investigate our hypotheses mainly within the scope of neural machine translation and multilingual translation showing the limitations of the...	en_US
uk.file-availability	V
uk.grantor	Univerzita Karlova, Matematicko-fyzikální fakulta, Ústav formální a aplikované lingvistiky	cs_CZ
thesis.grade.code	P
uk.publication-place	Praha	cs_CZ
uk.thesis.defenceStatus	O