Personalisatie als Inverse Planning: Leren van Latente Ontwerpintenties voor Agentische Dia-Generatie via Structurele Denoising
Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising
July 1, 2026
Auteurs: Tianci Liu, Zihan Dong, Linjun Zhang, Haoyu Wang, jing Gao, Emre Kiciman, Ranveer Chandra, Wei-Ting Chen
cs.AI
Samenvatting
Het ontwerpen van dia's vereist het personaliseren van zowel presentatiebundelthema's als paginalay-outs. Huidige methoden op basis van AI-agenten worstelen echter met fijnmazig ontwerp op paginaniveau. Door uitsluitend te vertrouwen op vooraf gedefinieerde sjablonen of uitvoerige gebruikersinstructies, slagen ze er niet in om latente ontwerpintenties te vatten, waardoor paginaniveau-diapersonalisatie (PSP) onopgelost blijft. Om deze leemte te vullen, formuleert dit werk PSP als een omgekeerd planningsprobleem. Wij stellen voor een ontwerpintentie te leren zonder enige kennis van de specifieke uitvoeringstools (bijv. PowerPoint, Beamer) die worden gebruikt. Het loslaten van de controle over deze tools maakt het probleem echter onhandelbaar om end-to-end te optimaliseren. Om dit te overwinnen introduceren we SPIRE, een principieel raamwerk om PSP bij benadering op te lossen. Door de visuele structuren van schone dia's opzettelijk te corrumperen, creëert SPIRE een verifieerbare taak om de corruptie te verwijderen, waarbij twee agenten leren om via reinforcement learning (RL) gezamenlijk uitvoerbare ontwerpen te verfijnen. We presenteren een bewijs dat structurele ruisverwijdering een consistente surrogaat is voor PSP, en dat de multi-agentformulering de variantie van de beleidsgradiënt in RL strikt vermindert. Uitgebreide experimenten tonen de superioriteit van SPIRE aan.
English
Slide design requires personalizing both deck themes and page layouts. Yet, current AI agent-based methods struggle with fine-grained, page-level design. Solely relying on prespecified templates or user verbose instructions, they fail to capture latent design intents, leaving Page-level Slide Personalization (PSP) unresolved. To close this gap, this work formulates PSP as an inverse planning problem. We propose to learn a design intent without assuming any knowledge of the specific executing tools (e.g., PowerPoint, Beamer) being used. However, relinquishing control over these tools makes the problem intractable to optimize end-to-end. To overcome this, we propose SPIRE, a principled framework to solve PSP approximately. By intentionally corrupting the visual structures of clean slides, SPIRE creates a verifiable task to denoise the corruption, whereby two agents learn to collaboratively refine executable designs via reinforcement learning (RL). We present a proof that structural denoising is a consistent surrogate for PSP, and that the multi-agent formulation strictly reduces policy gradient variance in RL. Extensive experiments demonstrate the superiority of SPIRE.