{"id":23146,"date":"2025-01-31T12:52:25","date_gmt":"2025-01-31T10:52:25","guid":{"rendered":"https:\/\/teatmik.eki.ee\/teatmik\/?p=23146"},"modified":"2025-12-04T12:57:38","modified_gmt":"2025-12-04T10:57:38","slug":"mis-on-suured-keelemudelid","status":"publish","type":"post","link":"https:\/\/teatmik.eki.ee\/teatmik\/mis-on-suured-keelemudelid\/","title":{"rendered":"Mis on suured keelemudelid?"},"content":{"rendered":"\r\n<div id=\"luhidalt-block_04f1c9e9802094c0c4f63619c24471af\" class=\"luhidalt\">\r\n   <h4>L\u00fchidalt<\/h4>\r\n<\/div>\n\n\n<p class=\"wp-block-paragraph\">Suurte keelemudelite (SKMide) p\u00f5him\u00f5te on lihtne: SKMid on arvutiprogrammid, mis on treenitud ennustama eelnevate s\u00f5nade p\u00f5hjal j\u00e4rgmist s\u00f5na. SKMid \u00f5pivad keelt andmekogude p\u00f5hjal, m\u00e4rgates mustreid s\u00f5nade, lausete ja isegi terviktekstide vahel.&nbsp;<\/p>\n\n\n\r\n<div id=\"pikemalt-block_7d57ed66bea97fc7da4128b4785b1ce6\" class=\"pikemalt\">\r\n\r\n   <h4>Pikemalt<\/h4>\r\n\r\n<\/div>\n\n\n<p class=\"wp-block-paragraph\">SKMid on tehisintellekti mudelid, mis on masin\u00f5ppe ja n\u00e4rviv\u00f5rkude abil treenitud t\u00f6\u00f6tlema ja genereerima loomulikku keelt. Need anal\u00fc\u00fcsivad, kuidas s\u00f5nad omavahel seostuvad, ja ennustavad j\u00e4rgmisi s\u00f5nu v\u00f5i fraase, luues niimoodi loogilisi lauseid ja tekstil\u00f5ike.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Mudelite suurus viitab nende keerukusele ja sellele, kui palju andmeid nende treenimiseks on kasutatud. N\u00e4iteks OpenAI loodud keelemudel GPT (<em>Generative Pretrained Transformer<\/em>) suudab t\u00f6\u00f6delda tohutuid tekstimahte ja \u00f5ppida nende p\u00f5hjal, kuidas inimesed eri kontekstides suhtlevad.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">SKMid teevad v\u00f5imalikuks tehisintellekti kasutamise igap\u00e4evastes tegevustes, mida saab automatiseerida ja nii kokku hoida inimese t\u00f6\u00f6aega. SKMide abil saab kiiresti teha t\u00f6id, mis k\u00e4sitsi tehes v\u00f5taksid tunde v\u00f5i isegi p\u00e4evi ning milleks pole vaja ekspertteadmisi arvutite ega programmeerimise kohta.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Praegu on k\u00f5ige tuntumad suurfirmade arendatud keelemudelid nt (Chat)GPT (OpenAI), Claude (Anthropic), Llama (Meta) ja Gemini (Google).&nbsp;<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Kuidas keelemudelid t\u00f6\u00f6tavad?&nbsp;<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Mudelite v\u00f5imekuse m\u00e4\u00e4rab suures osas andmestik, millega neid on treenitud. Suuri keelemudeleid treenitakse v\u00e4ga erinevatest allikatest koosnevate andmekogude, n\u00e4iteks raamatute, teadusartiklite, veebilehtede, sotsiaalmeedia postituste jpm p\u00f5hjal. Mudelid anal\u00fc\u00fcsivad tekstide statistilisi mustreid ning otsivad, kuidas s\u00f5nu erinevates kontekstides kasutatakse ja kui suure t\u00f5en\u00e4osusega s\u00f5nad \u00fcksteisele j\u00e4rgnevad. Kui mudeli treenimisel kasutatakse suurel hulgal eri pikkusega tekste, \u00f5pib mudel ennustama ka kontekstides, mida tema treenimiseks kasutatud ei ole. &nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">N\u00e4iteks kui anda mudelile lause algus \u201cKass istub aknal ja\u2026\u201d, suudab ta ennustada j\u00e4rgmise(d) s\u00f5na(d) selle p\u00f5hjal, mida ta on varem andmete p\u00f5hjal \u00f5ppinud, ning pakub v\u00e4lja k\u00f5ige t\u00f5en\u00e4olisema variandi, arvestades sisestatud konteksti. Sellest tulenevalt v\u00f5ib lause l\u00f5pp olla n\u00e4iteks \u201c\u2026vaatab linde\u201d v\u00f5i      \u201c\u2026ootab omanikku koju\u201d v\u00f5i midagi hoopis muud. &nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">SKMide puhul suudetakse j\u00e4lgida antud sisendeid ja v\u00e4ljundeid, kuid inimesel on tavaliselt v\u00f5imatu aru saada, mille alusel mudel tegelikult antud sisendile just mingi konkreetse v\u00e4ljundi annab. Alati on v\u00f5imalik k\u00fcsida mudelitelt selgitusi selle kohta, kuidas nad pakutud v\u00e4ljundini j\u00f5udsid, kuid kuna neid pole \u00f5petatud iseennast anal\u00fc\u00fcsima ja oma otsustusprotsessi kommenteerima, ei ole nad selles praegu veel v\u00e4ga edukad.&nbsp;<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><a>Mille jaoks suuri keelemudeleid kasutatakse?<\/a><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Suured keelemudelid v\u00f5imaldavad t\u00f6\u00f6d efektiivsemaks muuta paljudes valdkondades, kuid eri mudelid on osavad eri \u00fclesannetes. Seega mudel, mis tuleb edukalt toime \u00fcht t\u00fc\u00fcpi \u00fclesandega, ei pruugi olla nii hea teistes. Seet\u00f5ttu tasub v\u00f5imaluse korral uurida ja katsetada, milline mudel just sinu \u00fclesande t\u00e4itmiseks k\u00f5ige paremini sobib.&nbsp;M\u00f5ned SKMide kasutusvaldkonnad on n\u00e4iteks:&nbsp; <\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>masint\u00f5lge ehk automaatne t\u00f5lkimine&nbsp;<\/li>\n\n\n\n<li>vestlusrobotid&nbsp;<\/li>\n\n\n\n<li>tekstiloome (nt artiklite, postituste, dokumentide, e-kirjade vms koostamine v\u00f5i t\u00e4iustamine)&nbsp;<\/li>\n\n\n\n<li>keele\u00f5pe ja grammatika parandamine&nbsp;<\/li>\n\n\n\n<li>programmeerimine&nbsp;<\/li>\n\n\n\n<li>andmeanal\u00fc\u00fcs&nbsp;<\/li>\n\n\n\n<li>s\u00f5naraamatute koostamine<\/li>\n<\/ul>\n\n\n\n<h2 class=\"wp-block-heading\">Kuidas hinnata mudelite keeleoskust ja kultuuritundlikkust?&nbsp;<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Keelemudelite oskusi hinnatakse nii nagu inimeste omi \u2013 mudelile antakse ette andmestik, mis sisaldab erinevaid \u00fclesandeid ja k\u00fcsimusi. Sageli on \u00fclesandet\u00fc\u00fcbiks j\u00e4reldamis\u00fclesanded, kus mudelile antakse ette mitu vastusevarianti eesm\u00e4rgiga hindamist lihtsustada.&nbsp;&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Kui nii keele kui ka kultuuri tundmisel tahetakse saada t\u00e4psemat \u00fclevaadet, kasutatakse selleks spetsiifilisemaid testandmestikke, kus \u00fclesannete koostamisel on silmas peetud, et need sisaldaksid esinduslikult eesti keele ja kultuuri olulisi n\u00e4htuseid.&nbsp;&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Keeleoskuse hindamiseks m\u00f5eldud \u00fclesannete koostamine on k\u00fcllaltki lihtne, kuid kultuuri tundmise hindamine eeldab andmeid selle kohta, mis on eestlase jaoks t\u00e4htsaimad kultuurivaldkonnad ja millised teadmised on selles valdkonnas peamised. See t\u00e4hendab, et selline andmestik ei saaks eales olla t\u00e4ielikult esinduslik, vaid pigem p\u00fc\u00fceldakse selle eesm\u00e4rgi poole.&nbsp;K\u00f5ige paremini oskavad aga mudelite kvaliteeti, teadmisi ja keeleoskust hinnata mudeleid kasutavad eksperdid.&nbsp;<a id=\"_msocom_1\"><\/a><\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Miks on keelemudelite kultuuritundlikkus oluline?&nbsp;&nbsp;<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Juba praegu kasutatakse suuri keelemudeleid \u00fcha enam otsingumootorite k\u00f5rval ja asemel, mist\u00f5ttu on oluline, et saaksime mudelitelt t\u00f5est infot. Kui p\u00e4rida keelemudeli k\u00e4est infot n\u00e4iteks eesti kirjandusklassika kohta, v\u00f5ib sageli saada kummalisi vastuseid, millel pole konkreetse raamatuga mingit seost. Kui tahame kasutada keelemudeleid eesti keeles, on oluline, et mudel oleks kursis ka eesti kultuuriga. &nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">SKMe v\u00f5ib vaadelda kui andmebaasi, kus on v\u00f5imalus s\u00e4ilitada eesti keelt ja kultuuri k\u00e4sitlevat infot. Kuigi info p\u00e4rimine erineb sellest, kuidas p\u00e4ritakse tavap\u00e4rastest andmebaasidest, suudab mudel olemasolevate andmete p\u00f5hjal teha j\u00e4reldusi, mida tavalised andmebaasid ei suuda.&nbsp;<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Keelemudelite kasutamine \u00f5ppe- ja teadust\u00f6\u00f6s&nbsp;<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Eesti koolide suhtumine generatiivse tehisintellekti kasutamisse \u00f5ppet\u00f6\u00f6s on varieeruv. Samamoodi ka tehnoloogiate kasutuselev\u00f5tt haridussektoris \u00fcldiselt. M\u00f5nes koolis ollakse uuendusmeelsemad ja avatumad, teistes on vastasseisu ja k\u00f5hklusi rohkem. Tehisintellektip\u00f5histe t\u00f6\u00f6riistade kasutuselev\u00f5tt eeldab nii tehnilist valmisolekut kui ka pedagoogilist l\u00e4henemist.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Suurte keelemudelite tulek sunnib \u00f5petajaid l\u00e4bi m\u00f5tlema, milliseid \u00fclesandeid \u00f5pilastele anda ja kuidas \u00f5ppimist ja sellega seotud eesm\u00e4rke \u00fcmber m\u00f5testada. On kindlasti \u00fclesandeid, mille tegemine kaotab m\u00f5tte, kuid \u00fcha olulisemaks muutuvad kriitilise m\u00f5tlemise oskus, \u00fcmberp\u00f6\u00f6ratud \u00f5pe ja julgus katsetada.&nbsp;<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">SKMide potentsiaalset rolli s\u00f5nastike koostamisel ja uurimisel on k\u00e4sitletud arvukates uurimustes, seni n\u00e4hakse neid leksikograafide abistajana. Ennek\u00f5ike p\u00fc\u00fctakse SKMe rakendada nende t\u00f6\u00f6protsesside juures, mis on automatiseeritavad v\u00f5i mille puhul saab v\u00e4hendada mehaanilist ja ajamahukat k\u00e4sit\u00f6\u00f6d. Eesti Keele Instituudis uuritakse praegu peamiselt SKMide v\u00f5imekust vanade (17.\u201318. sajandi s\u00f5naraamatute) s\u00f5nakujude tuvastamisel, s\u00f5naregistrite m\u00e4\u00e4ramisel ja s\u00f5naraamatu jaoks s\u00f5naseletuste ja t\u00e4henduste loomisel.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Kirjandus<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Madis J\u00fcrviste, Tiina Paet, Sven-Erik Soosaar, Eesti vanade s\u00f5nakujude tuvastamisest suurte keelemudelitega. Eesti Rakenduslingvistika \u00dchingu aastaraamat, 2025 nr 21, lk 63\u221283. http:\/\/dx.doi.org\/10.5128\/ERYa21.04.<\/li>\n\n\n\n<li>Helen Kaljum\u00e4e, <a href=\"https:\/\/digi.geenius.ee\/blogi\/keel-ja-tehnoloogia\/keeletehnoloog-helen-kaljumae-suurtest-keelemudelidest-ja-veel-suuremast-tehisintellekti-maailmast\/\" target=\"_blank\" rel=\"noreferrer noopener nofollow\">Keeletehnoloog Helen Kaljum\u00e4e suurtest keelemudelitest ja veel suuremast tehisintellekti maailmast<\/a>. Geenius 16.10.2024.\u00a0<\/li>\n\n\n\n<li>Tuulike Kivestu-Rotella, <a href=\"https:\/\/opleht.ee\/2024\/01\/koolid-valmistuvad-tehisaru-kasutusele-votma\/\" target=\"_blank\" rel=\"noreferrer noopener nofollow\">Koolid valmistuvad tehisaru kasutusele v\u00f5tma<\/a>. \u00d5petajate Leht 23.01.2024.\u00a0<\/li>\n\n\n\n<li>Krister Kruusmaa, <a href=\"https:\/\/epl.delfi.ee\/artikkel\/120318713\/tehnokolumn-krister-kruusmaa-naksitrall-noksitrall-ja-nupsitrall-tehisaru-uleviimine-eestikeelsele-oppele-ei-ole-opetajate-vastutus\" target=\"_blank\" rel=\"noreferrer noopener nofollow\">Naksitrall, noksitrall ja nupsitrall \u2013 tehisaru \u00fcleviimine eestikeelsele \u00f5ppele ei ole \u00f5petajate vastutus.<\/a> Eesti P\u00e4evaleht 01.09.2024.\u00a0<\/li>\n\n\n\n<li>Lydia Risberg, Maria Tuulik, <a href=\"https:\/\/kultuur.err.ee\/1609457063\/keeleminutid-tehisaru-pakub-sisetundele-konkurentsi\" target=\"_blank\" rel=\"noreferrer noopener nofollow\">Keeleminutid. Tehisaru pakub sisetundele konkurentsi<\/a>. ERR 16.09.2024.\u00a0<\/li>\n\n\n\n<li>Kairit Sirts, <a href=\"https:\/\/sirp.ee\/s1-artiklid\/c21-teadus\/eesti-keele-ja-kultuuri-toetusest-suurtes-keelemudelites\/\" target=\"_blank\" rel=\"noreferrer noopener nofollow\">Eesti keele ja kultuuri toetusest suurtes keelemudelites<\/a>. Sirp 25.10.2024.\u00a0\u00a0<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Koostanud Susanna Oja, Eleri Aedmaa, Tiiu Kivistik<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Kuidas keelemudelid t\u00f6\u00f6tavad? Mille jaoks suuri keelemudeleid kasutatakse? Kuidas hinnata mudelite keeleoskust ja kultuuritundlikkust?<\/p>\n","protected":false},"author":16,"featured_media":23429,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[990],"tags":[1571,1572,1573],"class_list":["post-23146","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-mis-on-muutunud","tag-keelemudel","tag-skm","tag-tehisintellekt"],"acf":[],"_links":{"self":[{"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/posts\/23146","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/users\/16"}],"replies":[{"embeddable":true,"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/comments?post=23146"}],"version-history":[{"count":28,"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/posts\/23146\/revisions"}],"predecessor-version":[{"id":26821,"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/posts\/23146\/revisions\/26821"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/media\/23429"}],"wp:attachment":[{"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/media?parent=23146"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/categories?post=23146"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/teatmik.eki.ee\/teatmik\/wp-json\/wp\/v2\/tags?post=23146"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}