ChatPaper.aiChatPaper

100.000+ filmrecensies uit Kazachstan: Russische, Kazachse en code-switched teksten

100,000+ Movie Reviews from Kazakhstan: Russian, Kazakh, and Code-Switched Texts

May 9, 2026
Auteurs: Rustem Yeshpanov
cs.AI

Samenvatting

Wij presenteren een nieuw openbaar toegankelijk corpus van 100.502 filmrecensies uit Kazachstan, verzameld van kino.kz, dat de periode 2001-2025 beslaat en 4.943 unieke titels omvat. De dataset is meertalig en bestaat voornamelijk uit Russische recensies, naast Kazachse en gemengdtalige teksten. Recensies zijn handmatig geannoteerd op taal en sentimentpolariteit, en 11.309 recensies bevatten bovendien expliciete door gebruikers verstrekte beoordelingen. We definiëren twee sentimenttaken – driedelige polariteitsclassificatie en vijfklassenscoreclassificatie – en benchmarken klassieke BoW/TF-IDF-baselines tegen meertalige transformermodellen (mBERT, XLM-RoBERTa, RemBERT). Experimentele resultaten tonen aan dat transformermodellen consistent beter presteren dan klassieke baselines op polariteitsclassificatie, terwijl scoreclassificatie onder lekkage-gecontroleerde evaluatie uitdagend blijft vanwege ernstige klasse-onbalans en subtiele verschillen tussen aangrenzende beoordelingsniveaus.
English
We present a new publicly available corpus of 100,502 movie reviews from Kazakhstan collected from kino.kz, spanning 2001-2025 and covering 4,943 unique titles. The dataset is multilingual, consisting mainly of Russian reviews alongside Kazakh and code-switched texts. Reviews are manually annotated for language and sentiment polarity, and 11,309 reviews additionally contain explicit user-provided ratings. We define two sentiment tasks -- three-way polarity classification and five-class score classification -- and benchmark classical BoW/TF-IDF baselines against multilingual transformer models (mBERT, XLM-RoBERTa, RemBERT). Experimental results show that transformer models consistently outperform classical baselines on polarity classification, while score classification remains challenging under leakage-controlled evaluation due to severe class imbalance and subtle distinctions between adjacent rating levels.