PASA: Uma Abordagem de Marca d'Água em Espaço de Embeddings para Texto Gerado por LLM sob Ataques Invariantes Semânticos
PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks
May 9, 2026
Autores: Zhenxin Ai, Haiyun He
cs.AI
Resumo
A marcação d'água para grandes modelos de linguagem (LLMs) é uma abordagem promissora para detectar texto gerado por LLMs e permitir uma implantação responsável. No entanto, os métodos existentes de marcação d'água são frequentemente vulneráveis a ataques semanticamente invariantes, como a paráfrase. Propomos o PASA, um algoritmo de marcação d'água robusto, sem distorção e baseado em princípios, que incorpora e detecta uma marca d'água no nível semântico. O PASA opera em aglomerados semânticos em um espaço de embeddings latentes e constrói uma dependência distribucional entre sequências de tokens e auxiliares por meio de aleatoriedade compartilhada sincronizada por uma chave secreta e histórico semântico. Este design é fundamentado em nosso arcabouço teórico que caracteriza um par embedding-detecção conjuntamente ótimo, alcançando as compensações fundamentais entre precisão de detecção, robustez e distorção. Avaliações em múltiplos LLMs e ataques semanticamente invariantes demonstram que o PASA permanece robusto mesmo sob fortes ataques de paráfrase, preservando alta qualidade de texto, superando as linhas de base padrão do espaço de vocabulário. Estudos de ablação validam ainda mais a eficácia de nossas escolhas de hiperparâmetros. Página web: https://ai-kunkun.github.io/PASA_page/.
English
Watermarking for large language models (LLMs) is a promising approach for detecting LLM-generated text and enabling responsible deployment. However, existing watermarking methods are often vulnerable to semantic-invariant attacks, such as paraphrasing. We propose PASA, a principled, robust, and distortion-free watermarking algorithm that embeds and detects a watermark at the semantic level. PASA operates on semantic clusters in a latent embedding space and constructs a distributional dependency between token and auxiliary sequences via shared randomness synchronized by a secret key and semantic history. This design is grounded in our theoretical framework that characterizes a jointly optimal embedding-detection pair, achieving the fundamental trade-offs among detection accuracy, robustness, and distortion. Evaluations across multiple LLMs and semantic-invariant attacks demonstrate that PASA remains robust even under strong paraphrasing attacks while preserving high text quality, outperforming standard vocabulary-space baselines. Ablation studies further validate the effectiveness of our hyperparameter choices. Webpage: https://ai-kunkun.github.io/PASA_page/.