Koditex: korpus diverzifikovaných textů

Publikace

Abstrakt

Koditex je synchronní, reprezentativní a referenční korpus, obsahující 9 milionů textových slov (tedy vyjma interpunkce), který byl vytvořen za účelem multidimenzionální analýzy (MDA) registrové variability češtiny. Při vytváření korpusu byl důraz kladen zejména na jeho pestré složení, které odráží variabilitu češtiny ve všech jejích módech (psaná, mluvená, internetová komunikace), a na bohatou anotaci (texty byly lemmatizovány, morfologicky označkovány dvěma různými systémy, dále v nich byly anotovány frazémy a tzv. pojmenované entity - named entities).

Z hlediska psanosti a mluvenosti se tak jedná o korpus smíšený.

Klíčová slova

jazykový korpus čeština multidimenzionální analýza