Anglicko-slovenský paralelný korpus: využitie, zdroje a význam pre lingvistiku

Slovenský národný korpus (SNK) predstavuje rozsiahly vedecko-výskumný projekt, ktorého cieľom je budovanie elektronickej základnej slovnej zásoby. Ide o špecifický súbor jazykových dát, ktorého základom sú texty rôznych štýlov, žánrov a vecných oblastí. Tieto texty sú obohatené o lingvistické informácie na úrovni slova, vety aj celého textu. Vďaka výkonným vyhľadávacím nástrojom, ako sú korpusový manažér Manatee a klient Bonito, môžu používatelia vyhľadávať a triediť skúmané jazykové prostriedky a informácie. Tento autentický jazykový materiál umožňuje lingvistom opisovať významy a funkcie slov a ďalších jazykových javov.

SNK sa neustále rozvíja a okrem budovania korpusu písaných textov a tvorby súvisiacich počítačových nástrojov sa venuje aj rozširovaniu ponuky paralelných korpusov. Hoci sú už k dispozícii rusko-slovenský a francúzsko-slovenský paralelný korpus, v pláne sú ďalšie, vrátane chorvátsko-slovenského, česko-slovenského, nemecko-slovenského a anglicko-slovenského paralelného korpusu.

Každý paralelný korpus obsahuje identické texty v dvoch rôznych jazykoch. Môže ísť o vzájomné preklady alebo preklady z tretieho jazyka. Slovenské texty, ktoré sú prevažne prekladmi, sa do týchto korpusov zaraďujú na základe licenčnej zmluvy. Cudzojazyčné texty sa pre tento účel získavajú z internetových zdrojov. Dôležité je, že na časť textov zaradených do anglicko-slovenského, bulharsko-slovenského, česko-slovenského, francúzsko-slovenského, maďarsko-slovenského a nemecko-slovenského paralelného korpusu sa autorské práva nevzťahujú, keďže ide o texty európskej legislatívy.

Texty v paralelných korpusoch SNK sú spárované na úrovni viet. Hoci každý paralelný korpus oddelenia SNK ponúka obojstranné vyhľadávanie, neznamená to, že v smere zo slovenčiny do cudzieho jazyka ide vždy o originálne slovenské texty a v opačnom smere o originálne cudzojazyčné texty. V prípade veľkých jazykov, ako je angličtina, nemčina či francúzština, je pôvodným jazykom takmer alebo úplne všetkých textov práve cudzí jazyk. Pomer pôvodného a prekladového jazyka textov je pri ostatných paralelných korpusoch rôzny.

Význam anglicko-slovenského paralelného korpusu

Vytvorenie anglicko-slovenského paralelného korpusu predstavuje významný krok pre slovenskú lingvistiku a jazykovedu. Umožní detailnejší výskum prekladových ekvivalentov, špecifických jazykových javov a gramatických štruktúr medzi týmito dvoma jazykmi. Bude cenným zdrojom pre prekladateľov, jazykovedcov, študentov a všetkých, ktorí sa zaujímajú o porovnávaciu lingvistiku.

V oblasti počítačového spracovania jazyka sa pozorne sleduje každý nový projekt a každý nový partner. Nejde o likvidačnú konkurenciu, ale o spoluprácu, ktorej cieľom je spracovanie čo najväčšieho počtu jazykov. Slovenský národný korpus má dobrú metodiku získavania textov s dôrazom na dodržiavanie autorských práv a je oceňovaný aj v rovine morfologického značkovania textov.

Metodika a spracovanie textov v korpuse

Korpusový materiál sa získava najčastejšie priamo v elektronickej podobe, sporadickejšie technickým spracovaním vydaného tlačeného diela. Následne prebiehajú technické fázy, napríklad odstraňovanie znakov a symbolov editačných softvérov alebo grafických súčastí textu, konverzia do jednotného formátu a segmentácia textu na najmenšie jednotky. Takto segmentovaný text sa môže ďalej značkovať podľa typu korpusu - pridávajú sa dodatočné informácie, ako sú bibliografické údaje, informácie o štruktúre textu, jazykové informácie na úrovni slov (napr. slovný druh, základný tvar slova - lema) alebo na úrovni viet (funkcia vo vete, sémantika).

Typy korpusov v SNK:

  • Písané korpusy: Hlavný korpus prim obsahuje písané texty súčasného slovenského jazyka z rôznych štýlov, žánrov, vecných oblastí, regiónov a pod., ktoré vznikli po roku 1955. Rovnako fungujú aj špecializované korpusy (napríklad korpus ekonomických textov).
  • Korpus nárečí SNK: Zaraďujú sa do neho existujúce, predovšetkým už publikované textové prepisy nárečových zvukových alebo transkribovaných záznamov v elektronickom formáte.
  • Historické korpusy: Oddelenie SNK ponúka tri korpusy obsahujúce texty v slovenskom jazyku, ktoré vznikli pred rokom 1955. Historický korpus slovenčiny zachováva pôvodný pravopis.
  • Webový korpus: Jednotlivé verzie webového korpusu obsahujú slovenské texty dostupné na webovej stránke, ktoré boli v jednotlivých rokoch automaticky stiahnuté a spracované.
  • Hovorený korpus: Pozostáva zo zvukových nahrávok prepojených s príslušným prepisom zaznamenaných prehovorov, vrátane neverbálnych javov, lapsusov a pod.

Príklad existujúceho paralelného korpusu: Česko-slovenský paralelný korpus. Všetky texty v česko-slovenskom paralelnom korpuse sú automatizovane zarovnané po vetách. Slovenské texty sú morfologicky anotované tagermi Morče a MorphoDiTa natrénovanými v SNK na báze tagsetu vypracovaného v Slovenskom národnom korpuse. České texty sú anotované tagerom Morče a MorphoDiTa na báze tagsetu použitého v Českom národnom korpuse.

Vyhľadávanie v korpuse je možné viacerými spôsobmi: po registrácii v NoSketch Engine je možné vyhľadávať v českej a slovenskej časti rôznych verzií, resp. v beletickej časti verzií. V slovníkovom rozhraní sú dostupné príslušné prekladové ekvivalenty automaticky vybrané z textov v korpuse. Predchádzajúce verzie umožňovali vyhľadávanie aj v jednoduchom webovom rozhraní.

Prehľad verzií a špecifikácie

  1. Verzia par-skcs-5.0 - 20.05.2025, približne 526 miliónov tokenov (277 mil. v slovenskej časti, 249 mil. v anglickej časti).
  2. Verzia par-skde-4.0 - 07.12.2015, približne 556 mil. tokenov (261 mil. slovenskej, 295 mil. anglickej).
  3. Verzia par-skde-3.0 - január 2014, 392 mil. tokenov (184 mil. slovenských, 208 mil. anglických).
  4. Verzia par-skde-2.0 - 25.05.2016, 446 mil. tokenov (219,8 mil. slovenských, 226,4 mil. nemeckých).
  5. Verzia par-skde-1.0 - 15.12.2014, 263 mil. tokenov (129,5 mil. slovenských, 133 mil. nemeckých).

Par-sken-5.0 obsahuje podkorpus beletrie aj podkorpus voľne dostupných textov (najmä texty z inštitúcií Európskej únie). Par-sken-4.0 rozdeľuje korpus na dve časti: beletriu a voľne dostupné texty. Par-sken-3.0 obsahoval hlavne beletriu; par-sken-2.0 zahŕňal aj 10 miliónov párov viet.

Slovensko-anglický paralelný korpus obsahuje vzájomné preklady a automatickú vetovú aligáciu. Slovenské texty sú morfologicky anotované Morče natrénovaným v SNK, anglické texty používa tagset Penn Treebank s TreeTaggerom. Novšia anotácia zahŕňa aj štruktúrne a štýlovo-žánrové kľúče pre lepšie vyhľadávanie.

Spolupráca a prínos pre komunitu

Vo vnímaní komunity počítačovej lingvistiky ide o spoluprácu a spracovanie čo najväčšieho počtu jazykov. Kolegovia v Česku prejavujú veľký záujem o rozvoj Slovenského národného korpusu, čo potvrdzuje hodnotu existencie elektronickej databázy a prístupnosti slovníkov a lingvistických zdrojov na internete. SNK sa môže pochváliť dobrú metodikou získavania textov s dôrazom na dodržiavanie autorských práv a morfologickým značkovaním textov. V roku 2005 získal kolektív oddelenia SNK cenu Slovenskej akadémie vied za budovanie infraštruktúry pre vedu a terminologickú databázu.

Poznámka: tému terminológie sleduje Jazykovedný ústav Ľudovíta Štúra SAV, ktorý koordinuje vývoj terminológií a celkovej odbornej komunikácie v slovenčine.

Príležitosti rozvoja zahŕňajú kolokačný, retrográdny a frevenčný slovník; základné frekvenčné zoznamy sú sprístupňované spolu s novými verziami korpusu. Práca sa zameriava na lexikológickú a gramatickú rovinu jazyka, korpusovú lingvistiku a celkové využitie korpusu ako zdroja pre výučbu slovenčiny aj ako cudzieho jazyka.

Infografika: Štruktúra SNK a základné typy korpusov

Príklad kolokačného slovníka ukazuje, že kolokačné väzby sú často dvojice alebo viac slov. Verzie par-sken ukazujú postupný rast objemu dát a rozšírenie špecifikácií anotácie, ktoré umožňujú vyhľadávanie konkrétnych jazykových dát v oboch jazykoch.

Mapa paralelných korpusov SNK po jazykoch a verziách

PhDr. Mária Šimková, ktorá stála pri zrode oddelenia, je vedúcou oddelenia SNK a spolupracuje na projekte Komplexné spracovanie slovenského jazyka a jeho elektronizácia. Jej práca zahŕňa lexikologickú a gramatickú rovinu jazyka a využitie korpusu v edukácii a výskume.

Taktiež je zdôraznené, že paralelné korpusy poskytujú dostatok materiálu na výskum a že paralelné korpusy sú cenným nástrojom pri výučbe aj pri tvorbe lexikálnych databáz a terminologických zoznamov.

Krátke zhrnutie dát o anglicko-slovenskom korpuse

Aktuálna verzia par-skde-3.0 obsahuje výskyt 526 mil. tokenov, pričom slovenská časť predstavuje veľkú časť. Verzie 4.0 a 5.0 prinášajú rozšírené anotácie a zapájajú aj ekonomicky a technicky texty, ako aj beletriu. Porovnanie ukazuje rast dostupného materiálu a zlepšenie nástrojov vyhľadávania a analýzy.

tags: #anglicko #slovensky #paralelny #korpus