Nemecko-slovenský paralelný korpus: využitie a funkcie

Slovenský národný korpus (SNK) predstavuje elektronickú databázu textov súčasného slovenského jazyka, ktorá slúži na vyhľadávanie slov, slovných spojení a jazykových prostriedkov. SNK je vedecko-výskumný projekt, ktorého cieľom je budovanie elektronického korpusu textov a jeho postupné rozširovanie cez jednotlivé etapy a korpusy. Na základe tohto projektu sa otvorilo pracovisko SNK a vybudovalo sa množstvo korpusov vrátane paralelných, webových, hovorových či historických.

Hlavný korpus písaných textov SNK, známy ako prim, obsahuje písané texty súčasného slovenského jazyka z rôznych štýlov a žánrov, pričom aktuálna verzia prim-11.0 bola sprístupnená v roku 2025 s rozsahom vyše 1,85 miliardy tokenov. Paralelné korpusy SNK obsahujú identické texty v dvoch jazykoch a sú určené pre vzájomné preklady alebo preklady z tretieho jazyka; ich príklady zahŕňajú nemecko-slovenský paralelný korpus.

Infografika: Štruktúra Slovenského národného korpusu a jeho typy

Čo je SNK a aký je jeho význam

SNK predstavuje systém obsahujúci elektronické texty a lingvistické informácie na úrovni slova, vety aj celého textu. Výkonné vyhľadávacie nástroje umožňujú vyhľadávanie a triedenie jazykových prostriedkov a informácií, čím sa z korpusu stáva robustný nástroj pre jazykovedu, lexikografiu, výučbu a spracovanie prirodzeného jazyka. Korpus je podložený licenčnou zmluvou s autormi alebo držiteľmi autorských práv, aby sa zabezpečila legálnosť a etické využívanie textov.

Mapa prístupnosti SNK a prednášky/workshopy

Typy korpusov a ich účel

  • Písané korpusy - Hlavný korpus prim a špecializované korpusy. Zdroje pochádzajú z rôznych štýlov a žánrov a texty vznikli po roku 1955. Aktuálna verzia prim-11.0 obsahuje vyše 1,85 mld. tokenov.
  • Nárečový korpus - obsahuje existujúce prepisy nárečí a poskytuje sociolingvistické údaje o informátoroch a pôvode nahrávok.
  • Historické korpusy - texty zo Slovenska z období pred rokom 1955, vrátane pramenných materiálov z publikácií a zásad editorov.
  • Webový korpus - verzie z rokov 2010 a neskôr, ktoré obsahujú slovenské texty dostupné na webe a spracované SNK.
  • Paralelné korpusy - identické texty v dvoch jazykoch, často preklady; obsahujú napr. nemecko-slovenský paralelný korpus, ktorý umožňuje lingvistické porovnanie a preklady na úrovni viet.
  • Hovorené korpusy - zvukové nahrávky s prepismi a sociolingvistickými informáciami; v rovine výslovnostnej sa zaznamenávajú aj neverbálne javy a odchýlky od bežného štandardu.
Graf vývoja veľkosti SNK tokenov v čase

Ako sa dostanete k SNK a ako pracovať s ním

  1. Prístup na vyhľadávanie je bezplatný po registrácii; registrácia na webovej stránke SNK je potrebná pre plný prístup k vyhľadávaniu a vytváraniu podkorpusov.
  2. Predovšetkým sa používajú NoSketch Engine a Bonito ako korpusový manažér a klient; používateľ musí mať vlastné prihlasovacie údaje alebo ich získať pri workshopoch.
  3. Webové rozhranie umožňuje jednoduché vyhľadávanie s obmedzeným prístupom bez registrácie; plný prístup zahŕňa aj prácu s podkorpusmi a citácie z korpusových zdrojov.
  4. Štandardy anotácie zahŕňajú bibliografickú a štýlovo-žánrovú anotáciu, morfologickú anotáciu a nástroje na tvorbu morfologických značiek a rekonštrukciu značiek.

Techniky a metódy vyhľadávania

V SNK sa používajú metaznaky a komplexné dotazy na vyhľadávanie v NoSketch Engine a Sketch Engine. Metaznaky definujú opakovania, alternatívy a kontexty, pričom ukazujú užitočné príklady ako [lemma="hlava"] alebo [tag="S.*"]{3} v rámci viet a frázy. Praktické ukážky ukazujú, ako kombinovať exaktné lemy a ich kontexty, napríklad pomocou metaznavikov a operátorov ako union, within, containing, meet a ďalšie.

Infografika: Príklady metaznakov a syntaxe vyhľadávania

Využitie SNK v oblasti lingvistiky a lexikografie

SNK slúži ako základ pre rozsiahly výskum jazykovedy. Lexikografické využitie je jednou z kľúčových aplikačných zložiek, pretože veľa korpusov bolo postavených práve na podporu tvorby slovníkov. Výsledky zo spracovania korpusov, ako sú frekvencie slov a spoločné výskyty, nachádzajú uplatnenie aj mimo lingvistiky - napríklad v systémoch na spracovanie textov, kontrole pravopisu a gramatiky, strojovom preklade či správe reči.

Tabuľka: Rozloženie typov korpusov a ich veľkosti

Konferencie a spolupráca

Slovenský národný korpus a Jazykovedný ústav Ľ. Štúra SAV aktívne spolupracujú s medzinárodnými partnermi a organizujú konferencie Slovko, ktoré sa venujú počítačovému spracovaniu prirodzeného jazyka, lexikografii a terminológii. Od roku 2001 sa tieto konferencie konajú pravidelne každé dva roky v Bratislave; prvé ročníky sa zameriavali na lexikografické a jazykovedné otázky a následne sa rozšírili o širšie témy spolupráce a spracovania jazykových javov.

Infografika: Medzinárodná spolupráca SNK a konferencie Slovko

Terminologická databáza a ďalšie plány

V súčasnosti sa pripravuje spolupráca na tvorbe Slovenskej terminologickej databázy, ktorá predstavuje jeden z najnovších príspevkov Jazykovedného ústavu SAV. Jej cieľom je koordinovať vývoj terminológií a celkovú odbornú komunikáciu v slovenčine. Na príkladoch z korpusu sa plánuje aj automatizovaný výber pojmov a súvislostí. Ako ukážka: v skúšobnej verzii databázy bolo zahrnutých viac než 3 000 terminologických záznamov zo 11 oblastí.

Schéma procesu tvorby terminologickej databázy

Praktické príklady a zaujímavosti

Učebné materiály a cvičebnice vyberajú reálne jazykové javy z korpusov a demonštrujú postupy vyhľadávania cez rôzne vrstvy anexovaného textu. Príklady z kontextu ukazujú, ako korpus poskytuje autentické príklady používania slov a kontextov, ktoré sa následne využívajú pri výučbe slovenčiny ako cudzieho či materinského jazyka. Okrem toho korpus podporuje lexikografické projekty a tvorbu káždých terminologických entít spolu s kontextom ich použitia.

Príklad zo súčasnosti

Napríklad nájdenie spojky keby a sloveso v prítomnom čase je typickým cvičením z Korpusu; podobné úlohy umožňujú študentom a lingvonom získať hlas s kontextom vo vetách a frázach naprieč dielami.

tags: #nemecko #slovensky #korpus