ChatPaper.aiChatPaper

AI-vertaling van literaire teksten is 'prima', maar lezers geven nog steeds de voorkeur aan menselijke vertalingen.

AI translation of literary texts is "fine", but readers still prefer human translations

June 24, 2026
Auteurs: Yves Ferstler, Adam Podoxin, Ty Brassington, Roman Grundkiewicz, Maite Taboada, Marzena Karpinska
cs.AI

Samenvatting

AI-vertaling van literaire werken komt steeds vaker voor. Hoewel de inhoud wellicht adequaat wordt weergegeven, weten we onvoldoende over hoe lezers deze ervaren op het gebied van onderdompeling en literair effect; aspecten die slecht worden gevangen door automatische machinevertaalmetrieken of menselijke evaluatie gericht op vloeiendheid en adequaatheid. We vragen 15 fervente lezers om onlangs gepubliceerde menselijke vertalingen (HT) te vergelijken met machinevertalingen (MT) gegenereerd via een agentische pijplijn gebaseerd op een groot taalmodel (LLM), voor 15 recente romans in het Frans, Pools en Japans, vertaald naar het Engels. Lezers evalueerden fragmenten van circa 8000 woorden in twee condities: onderdompelend lezen van het volledige fragment (30 vergelijkingen) en nauwkeurig lezen van 386 uitgelijnde HT-MT-stukparen (772 vergelijkingen), met twee lezers per boek en in afwisselende presentatievolgorde. Over het algemeen vinden lezers MT "prima", maar geven ze de voorkeur aan HT (licht op fragmentniveau 19/30, duidelijker op stukniveau 522/772) vanwege het gemak, de helderheid en het onderdompelende karakter. De aantekeningen van lezers tonen aan dat de kwaliteit van MT binnen één boek meer varieert dan die van HT. Cruciaal is dat lezers de twee niet betrouwbaar kunnen onderscheiden (17/30 correct geraden) en doorgaans de voorkeur geven aan de versie die zij denken dat menselijk is. Automatische metrieken, inclusief LLM-as-a-judge-benaderingen, slagen er niet in de voorkeuren van lezers te achterhalen en geven de voorkeur aan MT. We publiceren LAIT (Literary AI Translation), een lezergecentreerde evaluatiedataset met 1000 lezerscommentaren, 2000 oordelen en voorkeursbeoordelingen, en 7200 annotaties op zinsdeelniveau, samen met ons evaluatieprotocol en ondersteunende interface.
English
AI translation of literary works is increasingly common. While the content may be rendered adequately, we do not know enough about how readers experience it in terms of immersiveness and literary effect, aspects poorly captured by automatic machine translation metrics or human evaluation targeting fluency and adequacy. We ask 15 avid readers to compare recently published human translations (HT) to machine translations (MT) generated with an agentic large language model (LLM)-based pipeline, for 15 recent novels in French, Polish, and Japanese and translated into English. Readers evaluated approximately 8K-word excerpts in two conditions: immersive reading of the whole excerpt (30 comparisons) and close reading of 386 aligned HT-MT chunk pairs (772 comparisons), with two readers per book and in alternating order of presentation. Overall, readers find MT "fine", but prefer HT (slightly at excerpt-level 19/30, more clearly at chunk-level 522/772) for its ease, clarity, and immersive nature. Readers' highlights show that MT's quality varies more within one book than HT's does. Crucially, readers cannot reliably tell the two apart (17/30 guess correctly) and tend to prefer the version they believe to be human. Automatic metrics, including LLM-as-a-judge approaches, fail to recover reader preferences and favor MT. We release LAIT (Literary AI Translation), a reader-centered evaluation dataset with 1K reader comments, 2K judgments and preference ratings, and 7.2K span-level annotations, along with our evaluation protocol and supporting interface.