ChatPaper.aiChatPaper

PASA: Een principiële watermerkbenadering in de inbeddingsruimte voor door LLM gegenereerde tekst onder semantisch-invariante aanvallen

PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks

May 9, 2026
Auteurs: Zhenxin Ai, Haiyun He
cs.AI

Samenvatting

Het watermerken van grote taalmodellen (LLM's) is een veelbelovende aanpak voor het detecteren van door LLM gegenereerde tekst en het mogelijk maken van verantwoorde inzet. Bestaande watermerkmethoden zijn echter vaak kwetsbaar voor semantisch-invariante aanvallen, zoals parafraseren. Wij stellen PASA voor, een principieel, robuust en vervormingsvrij watermerkalgoritme dat een watermerk op semantisch niveau inbedt en detecteert. PASA werkt op semantische clusters in een latente inbeddingsruimte en construeert een distributionele afhankelijkheid tussen token- en hulpsequenties via gedeelde willekeur, gesynchroniseerd door een geheime sleutel en semantische geschiedenis. Dit ontwerp is gegrond in ons theoretisch kader dat een gezamenlijk optimaal inbedding-detectiepaar karakteriseert, dat de fundamentele afwegingen tussen detectienauwkeurigheid, robuustheid en vervorming bereikt. Evaluaties over meerdere LLM's en semantisch-invariante aanvallen tonen aan dat PASA robuust blijft, zelfs onder sterke parafraseringsaanvallen, terwijl de hoge tekstkwaliteit behouden blijft, en het presteert beter dan standaard basislijnen in de vocabulaire-ruimte. Ablatiestudies valideren verder de effectiviteit van onze hyperparameterkeuzes. Webpagina: https://ai-kunkun.github.io/PASA_page/.
English
Watermarking for large language models (LLMs) is a promising approach for detecting LLM-generated text and enabling responsible deployment. However, existing watermarking methods are often vulnerable to semantic-invariant attacks, such as paraphrasing. We propose PASA, a principled, robust, and distortion-free watermarking algorithm that embeds and detects a watermark at the semantic level. PASA operates on semantic clusters in a latent embedding space and constructs a distributional dependency between token and auxiliary sequences via shared randomness synchronized by a secret key and semantic history. This design is grounded in our theoretical framework that characterizes a jointly optimal embedding-detection pair, achieving the fundamental trade-offs among detection accuracy, robustness, and distortion. Evaluations across multiple LLMs and semantic-invariant attacks demonstrate that PASA remains robust even under strong paraphrasing attacks while preserving high text quality, outperforming standard vocabulary-space baselines. Ablation studies further validate the effectiveness of our hyperparameter choices. Webpage: https://ai-kunkun.github.io/PASA_page/.