SNK predstavuje rozsiahly vedecko-výskumný projekt, ktorého cieľom je budovanie elektronickej základnej slovnej zásoby. Ide o špecifický súbor jazykových dát, ktorého základom sú texty rôznych štýlov, žánrov a vecných oblastí. Tieto texty sú obohatené o lingvistické informácie na úrovni slova, vety aj celého textu. Vďaka výkonným vyhľadávacím nástrojom, ako sú korpusový manažér Manatee a klient Bonito, môžu používatelia vyhľadávať a triediť skúmané jazykové prostriedky a informácie. Tento autentický jazykový materiál umožňuje lingvistom opisovať významy a funkcie slov a ďalších jazykových javov.
SNK sa neustále rozvíja a okrem budovania korpusu písaných textov a tvorby súvisiacich počítačových nástrojov sa venuje aj rozširovaniu ponuky paralelných korpusov. Hoci sú už k dispozícii rusko-slovenský a francúzsko-slovenský paralelný korpus, v pláne sú ďalšie, vrátane chorvátsko-slovenského, česko-slovenského, nemecko-slovenského a obzvlášť očakávaného anglicko-slovenského paralelného korpusu.
Čo je paralelný korpus a aký význam má
- Každý paralelný korpus obsahuje identické texty v dvoch rôznych jazykoch. Môže ísť o vzájomné preklady alebo preklady z tretieho jazyka.
- Slovenské texty, ktoré sú prevažne prekladmi, sa do týchto korpusov zaraďujú na základe licenčnej zmluvy. Cudzojazyčné texty sa pre tento účel získavajú z internetových zdrojov.
- Dôležité je, že na časť textov zaradených do anglicko-slovenského, bulharsko-slovenského, česko-slovenského, francúzsko-slovenského, maďarsko-slovenského a nemecko-slovenského paralelného korpusu sa autorské práva nevzťahujú, keďže ide o texty európskej legislatívy.
- Texty v paralelných korpusoch SNK sú spárované na úrovni viet. Hoci každý paralelný korpus ponúka obojstranné vyhľadávanie, neznamená to vždy, že v smere zo slovenčiny do cudzieho jazyka ide o originálne slovenské texty a naopak o originálne cudzojazyčné texty.
Význam anglicko-slovenského paralelného korpusu
Vytvorenie anglicko-slovenského paralelného korpusu predstavuje významný krok pre slovenskú lingvistiku a jazykovedu. Umožní detailnejší výskum prekladových ekvivalentov, špecifických jazykových javov a gramatických štruktúr medzi týmito dvoma jazykmi. Bude cenným zdrojom pre prekladateľov, jazykovedcov, študentov a všetkých, ktorí sa zaujímajú o porovnávaciu lingvistiku.
Metodika a spracovanie textov v korpuse
Korpusový materiál sa získava najčastejšie priamo v elektronickej podobe, sporadickejšie technickým spracovaním vydaného tlačeného diela. Následne prebiehajú technické fázy, ako odstraňovanie znakov a symbolov editačných softvérov alebo grafických súčastí textu, konverzia do jednotného formátu a segmentácia textu na najmenšie jednotky. Takto segmentovaný text sa ďalej značkuje podľa typu korpusu a pridávajú sa dodatočné informácie, napríklad bibliografické údaje, informácie o štruktúre textu, jazykové informácie na úrovni slov (napr. slovný druh, lema) alebo na úrovni viet (funkcia vo vete, sémantika).
Typy korpusov v SNK
- Písané korpusy: Hlavný korpus prim obsahuje písané texty súčasného slovenského jazyka z rôznych štýlov, žánrov, vecných oblastí, regiónov a pod., ktoré vznikli po roku 1955. Rovnako fungujú aj špecializované korpusy (napríklad korpus ekonomických textov).
- Korpus nárečí SNK: Zaraďujú sa do neho existujúce, predovšetkým už publikované textové prepisy nárečových zvukových alebo transkribovaných záznamov v elektronickom formáte.
- Historické korpusy: Oddelenie SNK ponúka tri korpusy obsahujúce texty v slovenskom jazyku, ktoré vznikli pred rokom 1955. Pre Historický korpus slovenčiny sa vyberali a korpusovo spracovali pramenné materiály v pôvodnom pravopise.
- Webový korpus: Jednotlivé verzie webového korpusu obsahujú slovenské texty dostupné na webovej stránke, ktoré boli v jednotlivých rokoch automaticky stiahnuté a následne spracované.
- Hovorený korpus: Pozostáva zo zvukových nahrávok prepojených s príslušným prepisom zaznamenaných prehovorov. Okrem základného prepisu výpovedí sa v druhej, výslovnostnej rovine, zachytávajú sprievodné, neverbálne javy a ďalšie jazykové fenomény ako lapsusy a opakujúce sa časti.

Príklad existujúceho paralelného korpusu: Česko-slovenský paralelný korpus. Medzi paralelné korpusy patrí aj Česko-Slovenský Paralelný Korpus, ktorý slúži ako vynikajúci príklad funkčnosti a rozsahu takýchto databáz. Aktuálne dáta slovensko-českého paralelného korpusu sú sprístupnené vo viacerých verziách. Všetky texty v česko-slovenskom paralelnom korpuse sú automatizovane zarovnané po vetách. Slovenské texty sú morfologicky anotované tagermi Morče a MorphoDiTa natrénovanými v SNK na báze tagsetu vypracovaného v Slovenskom národnom korpuse. České texty sú anotované tag param Morče a MorphoDiTa na báze tagsetu použitého v Českom národnom korpuse. Vyhľadávanie v korpuse je možné viacerými spôsobmi: Po zaregistrovaní sa v NoSketch Engine je možné vyhľadávať v českej časti celej verzie 4.0, v slovenskej časti celej verzie 4.0, resp. v českej časti beletristických textov verzie 5.0 a v slovenskej časti beletristických textov verzie 5.0. V slovníkovom rozhraní, v ktorom sú dostupné príslušné prekladové ekvivalenty automaticky vybrané z textov v korpuse. V predchádzajúcich verziách je ešte možné vyhľadávať v jednoduchom webovom rozhraní.
| Verzia | Dátum sprístupnenia | Celkový rozsah (tokeny) | Podkorpus beletrie (tokeny) |
|---|---|---|---|
| par-skcs-fic-5.0 | 13. 12. 2018 | 31,5 mil. | 31,5 mil. |
| par-skcs-all-4.0 | 25. 5. 2016 | 418,5 mil. | 19 mil. |
| par-skcs-all-3.0 | Január 2014 | 240 mil. | 19 mil. |
| par-skcs-2.0 | 2011 | cca 240 mil. | cca 20 mil. |
Korpus par-skde-2.0 obsahuje dvoje časti: slovensko-nemecký paralelný korpus a podkorpus beletrie. Verzia 2.0 bola sprístupnená 25. 5. 2016 v rozsahu takmer 446 mil. tokenov (219,8 mil. tokenov v slovenskej časti, 226,4 mil. tokenov v nemeckej časti). Verzia 1.0 par-skde-1.0 bola sprístupnená 15. 12. 2014 v rozsahu takmer 263 mil. tokenov (129,5 mil. tokenov v slovenskej časti, 133 mil. tokenov v nemeckej časti). Podkorpus beletrie obsahoval 7,5 mil. tokenov.

Ďalšie zdroje a spolupráca
Slovenský národný korpus sa týka aj širšej spolupráce so zahraničnými partnermi a projektmi. Význam anglicko-slovenského korpusu spočíva v tom, že umožňuje porovnanie jazykových javov a gramatických štruktúr medzi týmito dvoma jazykmi a predstavuje cenný zdroj pre odborníkov i študentov.
Praktické využitie a prínosy
- Vykonávanie hĺbkovej analýzy prekladových ekvivalentov a jazykových javov medzi slovenčinou a nemčinou (alebo inými jazykmi).
- Podpora výučby a výskumu porovnávacej lingvistiky a tvorby slovných zásob.
- Dodržiavanie autorských práv pri získavaní a spracovaní textov a vysoká kvalita morfologickej anotácie textov.

Prehľad verzií Česko-Slovenského paralelného korpusu ukazuje vývoj rozsahu a prístupnosti dát, pričom slovenská časť je morfologicky anotovaná tagermi Morče a MorphoDiTa a česká časť podľa tagsetu ČNČ. Texty v anglicko-slovenskom korpuse sa tešia z postupného rozšírenia a zvyšovania počtu jazykov zahrnutých do projektu.