Eén beurt te laat: Responsbewuste verdediging tegen verborgen kwaadaardige bedoelingen in meerbeurten dialoog
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
May 12, 2026
Auteurs: Xinjie Shen, Rongzhe Wei, Peizhi Niu, Haoyu Wang, Ruihan Wu, Eli Chien, Bo Li, Pin-Yu Chen, Pan Li
cs.AI
Samenvatting
Verborgen kwaadwillige bedoeling in meerbeurtse dialoog vormt een groeiende bedreiging voor ingezette grote taalmodellen (LLM's). In plaats van een schadelijk doel in één enkele prompt te onthullen, kunnen steeds capabelere aanvallers hun bedoeling verspreiden over meerdere onschuldig ogende beurten. Recente studies tonen aan dat zelfs moderne commerciële modellen met geavanceerde veiligheidsmechanismen kwetsbaar blijven voor dergelijke aanvallen, ondanks vooruitgang in veiligheidsafstemming en externe beveiligingssystemen. In dit werk pakken we deze uitdaging aan door de vroegste beurt te detecteren waarin het geven van de kandidaatrespons de opgebouwde interactie voldoende zou maken om schadelijke actie mogelijk te maken. Deze doelstelling vereist een precieze interventie op beurtniveau die het schade mogelijk makende afsluitpunt identificeert, terwijl voortijdige weigering van onschuldige verkennende gesprekken wordt vermeden. Ter verdere ondersteuning van training en evaluatie construeren we de Multi-Turn Intent Dataset (MTID), die vertakkende aanvalsuitrolpatronen, gematchte onschuldige harde negatieven en annotaties van de vroegste schade mogelijk makende beurten bevat. We tonen aan dat MTID een monitor op beurtniveau, TurnGate, mogelijk maakt, die aanzienlijk beter presteert dan bestaande baselines in detectie van schadelijke bedoelingen, terwijl lage overmatige weigeringspercentages worden gehandhaafd. TurnGate generaliseert verder over domeinen, aanvalspijplijnen en doelmodellen. Onze code is beschikbaar op https://github.com/Graph-COM/TurnGate.
English
Hidden malicious intent in multi-turn dialogue poses a growing threat to deployed large language models (LLMs). Rather than exposing a harmful objective in a single prompt, increasingly capable attackers can distribute their intent across multiple benign-looking turns. Recent studies show that even modern commercial models with advanced guardrails remain vulnerable to such attacks despite advances in safety alignment and external guardrails. In this work, we address this challenge by detecting the earliest turn at which delivering the candidate response would make the accumulated interaction sufficient to enable harmful action. This objective requires precise turn-level intervention that identifies the harm-enabling closure point while avoiding premature refusal of benign exploratory conversations. To further support training and evaluation, we construct the Multi-Turn Intent Dataset (MTID), which contains branching attack rollouts, matched benign hard negatives, and annotations of the earliest harm-enabling turns. We show that MTID helps enable a turn-level monitor TurnGate, which substantially outperforms existing baselines in harmful-intent detection while maintaining low over-refusal rates. TurnGate further generalizes across domains, attacker pipelines, and target models. Our code is available at https://github.com/Graph-COM/TurnGate.