SYN v9: korpus současné psané češtiny

Publikace

Abstrakt

Synchronní korpus o celkovém rozsahu 4,7 mld. textových slov (tj. 5,7 mld. tokens), který zachycuje psanou češtinu především z let 1990-2019. Obsahuje převážně texty publicistické, ačkoli zahrnuje také velké množství dalších textových typů (beletrii, oborovou literaturu).

Korpus je lemmatizován a morfologicky označkován kombinací stochastických a pravidlových metod, u každého textu jsou uvedeny podrobné bibliografické a další údaje včetně jeho příslušnosti ke klasifikaci textů. Rozdíl oproti předchozí verzi, korpusu SYN v8, spočívá jednak v aktualizaci publicistiky (přidání textů z roku 2019) a zejména v tom, že celé zpracování (strukturace, lemmatizace, morfologické značkován) bylo provedeno na úrovni korpusu SYN2020.

Klíčová slova

jazykový korpus čeština