Lielo valodas modeļu pielietošana sekundārās terminrades atbaslstīšanai

Čižikovs, Maksims

dc.contributor.advisor	Zuters, Jānis
dc.contributor.author	Čižikovs, Maksims
dc.contributor.other	Latvijas Universitāte. Eksakto zinātņu un tehnoloģiju fakultāte
dc.date.accessioned	2025-06-28T01:06:37Z
dc.date.available	2025-06-28T01:06:37Z
dc.date.issued	2025
dc.identifier.other	107956
dc.identifier.uri	https://dspace.lu.lv/dspace/handle/7/71083
dc.description.abstract	Maģistra darbs piedāvā specializētu lielo valodas modeli, kas ģenerē normatīvi korektus un semantiski precīzus latviešu ekvivalentus informācijas tehnoloģiju (IKT) angļu terminiem, tādējādi atbalstot sekundāro terminradi. Empīriskajam pamatam izmantots Latvijas Zinātņu akadēmijas Terminoloģijas komisijas lēmumu kopums (~8 600 ieraksti, 2005 – 2025), kas papildus bagātināts ar laika un domēna metadatiem. Darba gaitā uz transformera bāzes modeļa (Helsinki-NLP/opus-mt-tc-big-en-lv, ~300 M parametru) veikta precīza pielāgošana (fine-tuning) uz specializētā korpusa; apmācība realizēta ar NVIDIA RTX 4080 16 GB GPU. Pirmsapstrādē dati apstrādāti, bagātināti vai kontekstualizēti, sinonīmu grupas sadalītas. Modeļa kvalitāte novērtēta ar BLEU = 91.34, chrF++ = 72.54 un TER = 42.66 uz neatkarīgas testa kopas, kas pārsniedz sākotnējā pirmsapmācītā modeļa rādītājus par 20+ %. Rezultātā radīts publiski pieejams modelis, kas demonstrē lielo valodas modeļu potenciālu latviešu IKT terminoloģijas ģenerēšanā un var kalpot par pamatu turpmākiem pētnieciskiem darbiem.
dc.description.abstract	Master’s thesis “Application of Large Language Models for Supporting Secondary Terminology Creation” presents a specialised neural-network model whose goal is to generate normatively correct and semantically precise Latvian equivalents for English information-technology (IT) terms. The empirical basis is a decision set of the Terminology Commission of the Latvian Academy of Sciences (≈ 8,600 entries, 2005 – 2025), further enriched with temporal and domain-specific metadata. A full fine-tuning cycle was carried out on the specialised corpus using the transformer base model (Helsinki-NLP/opus-mt-tc-big-en-lv, ≈ 300 M parameters); training was performed on a NVIDIA RTX 4080 16 GB GPU. During pre-processing the data were cleaned, enriched or contextualised, and synonym groups were split. Model quality was evaluated with BLEU = 91.34, chrF++ = 72.54 un TER = 42.66 on an independent test set, exceeding the scores of the original pre-trained model by 20+ %. As a result, a publicly available model has been created that demonstrates the great potential of language models in generating Latvian ICT terminology and can serve as a basis for further research.
dc.language.iso	lav
dc.publisher	Latvijas Universitāte
dc.rights	info:eu-repo/semantics/openAccess
dc.subject	Datorzinātne un informātika
dc.subject	LVM
dc.subject	terminoloģija
dc.subject	latviešu valoda
dc.subject	precīza pielāgošana
dc.subject	informācijas tehnoloģijas
dc.title	Lielo valodas modeļu pielietošana sekundārās terminrades atbaslstīšanai
dc.title.alternative	The Application of Large Language Models to Support Secondary Terminology Creation
dc.type	info:eu-repo/semantics/masterThesis

Files in this item

Name:: 302-107956-Cizikovs_Maksims_mc ...
Size:: 614.7Kb
Format:: PDF

View/Open

This item appears in the following Collection(s)

Bakalaura un maģistra darbi (EZTF) / Bachelor's and Master's theses [6025]

Show simple item record