Um Turno Tarde Demais: Defesa Ciente da Resposta contra Intenção Maliciosa Oculta em Diálogo de Múltiplos Turnos
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
May 12, 2026
Autores: Xinjie Shen, Rongzhe Wei, Peizhi Niu, Haoyu Wang, Ruihan Wu, Eli Chien, Bo Li, Pin-Yu Chen, Pan Li
cs.AI
Resumo
Intenção maliciosa oculta em diálogos de múltiplas voltas representa uma ameaça crescente para modelos de linguagem de grande escala (LLMs) implantados. Em vez de expor um objetivo prejudicial em um único prompt, atacantes cada vez mais capazes podem distribuir sua intenção ao longo de várias voltas aparentemente benignas. Estudos recentes mostram que mesmo modelos comerciais modernos com salvaguardas avançadas permanecem vulneráveis a tais ataques, apesar dos avanços no alinhamento de segurança e nas salvaguardas externas. Neste trabalho, abordamos esse desafio detectando a primeira volta na qual entregar a resposta candidata tornaria a interação acumulada suficiente para possibilitar uma ação prejudicial. Esse objetivo requer uma intervenção precisa ao nível da volta, que identifique o ponto de encerramento que permite o dano, evitando ao mesmo tempo a recusa prematura de conversas exploratórias benignas. Para apoiar ainda mais o treinamento e a avaliação, construímos o Conjunto de Dados de Intenção em Múltiplas Voltas (MTID), que contém rollouts de ataques ramificados, exemplos negativos difíceis benignos emparelhados e anotações das primeiras voltas que permitem dano. Mostramos que o MTID ajuda a viabilizar um monitor ao nível da volta, o TurnGate, que supera substancialmente as linhas de base existentes na detecção de intenção prejudicial, mantendo baixas taxas de recusa excessiva. O TurnGate ainda generaliza entre domínios, pipelines de ataque e modelos-alvo. Nosso código está disponível em https://github.com/Graph-COM/TurnGate.
English
Hidden malicious intent in multi-turn dialogue poses a growing threat to deployed large language models (LLMs). Rather than exposing a harmful objective in a single prompt, increasingly capable attackers can distribute their intent across multiple benign-looking turns. Recent studies show that even modern commercial models with advanced guardrails remain vulnerable to such attacks despite advances in safety alignment and external guardrails. In this work, we address this challenge by detecting the earliest turn at which delivering the candidate response would make the accumulated interaction sufficient to enable harmful action. This objective requires precise turn-level intervention that identifies the harm-enabling closure point while avoiding premature refusal of benign exploratory conversations. To further support training and evaluation, we construct the Multi-Turn Intent Dataset (MTID), which contains branching attack rollouts, matched benign hard negatives, and annotations of the earliest harm-enabling turns. We show that MTID helps enable a turn-level monitor TurnGate, which substantially outperforms existing baselines in harmful-intent detection while maintaining low over-refusal rates. TurnGate further generalizes across domains, attacker pipelines, and target models. Our code is available at https://github.com/Graph-COM/TurnGate.