Lithuanian-Latvian, Latvian-Lithuanian Parallel Corpus (LILA)
Erika Rimkutė, Andrius Utka, Kristīne Levāne-Petrova · Studies About Languages · 2013
Anotacija.Straipsnyje pristatomas naujas kalbos išteklius -lygiagretusis beveik iš 9 mln.žodžių sudarytas lietuvių-latvių, latvių-lietuvių kalbų tekstynas LILA, kurio tekstai sulygiagretinti pastraipų ir sakinių lygmeniu.Tekstynas yra su metaduomenimis, kuriuose pateikiama informacija apie autorius, leidimo metus ir pan.Tekstynas struktūriškai anotuotas: jame sužymėtos pastraipų ir sakinių ribos.Kol kas tai vienintelis dvikalbis šios kalbų poros tekstynas.Tekstynas parengtas 2011-2012 m.Vytauto Didžiojo universiteto Kompiuterinės lingvistikos centro (VDU KLC) darbuotojų kartu su Latvijos universiteto Matematikos ir informatikos instituto Dirbtinio intelekto laboratorijos (LU MII) mokslininkais.Pastraipoms ir sakiniams lygiagretinti naudotas VDU KLC sukurtas pusiau automatinis įrankis Aligner 2.0.6.7.Straipsnyje aprašyta, su kokiomis problemomis, rengdami tekstynus ir kitas kalbos priemones, susiduria rečiau vartojamų kalbų atstovai.Daugiausia problemų kelia ribotas tekstų pasirinkimas, dėl to sunku sudaryti norimos apimties ir pobūdžio tekstynus; ilgai užtrunka spausdintų tekstų skaitmeninimas.Pristatyta tekstyno sudarymo koncepcija, sandara, jo rengimo etapai; išsamiau aprašytas naudotas lygiagretinimo įrankis.Straipsnyje rašyta apie lygiagrečiojo tekstyno paieškos sistemą, šio ir kitų lygiagrečiųjų tekstynų panaudojimo galimybės, ypač kalboms mokyti ir mokytis, struktūrinių lietuvių ir latvių kalbų skirtumų analizei, vertimų kokybės lyginimui, keliakalbiams žodynams sudaryti, kalbų technologijų srityje (kuriant statistinio automatinio vertimo sistemas).