PresentAgent-2 : Vers des agents de présentation multimodaux généralistes
PresentAgent-2: Towards Generalist Multimodal Presentation Agents
May 12, 2026
Auteurs: Wei Wu, Ziyang Xu, Zeyu Zhang, Yang Zhao, Hao Tang
cs.AI
Résumé
La génération de présentations dépasse aujourd'hui la simple création de diapositives statiques pour évoluer vers une génération de vidéos de présentation de bout en bout, ancrée dans la recherche, intégrant des médias multimodaux et une diffusion interactive. Nous présentons PresentAgent-2, un cadre agentif permettant de générer des vidéos de présentation à partir de requêtes utilisateur. Face à une requête ouverte et à un mode de présentation sélectionné, PresentAgent-2 commence par résumer la requête en un sujet ciblé, puis effectue une recherche approfondie sur des sources adaptées aux présentations afin de collecter des ressources multimodales (textes, images, GIFs et vidéos pertinents). Il construit ensuite les diapositives, génère des scripts spécifiques au mode, et compose les diapositives, l'audio et les médias dynamiques en une vidéo de présentation complète. PresentAgent-2 prend en charge trois modes de présentation indépendants au sein d'un cadre unifié : la Présentation Unique, qui génère une vidéo de présentation narrée par un seul intervenant ; la Discussion, qui crée une présentation à plusieurs intervenants avec des rôles structurés (poser des questions directrices, expliquer des concepts, clarifier des détails et résumer les points clés) ; et l'Interaction, qui répond de manière autonome aux questions du public en s'appuyant sur les diapositives générées, les scripts, les preuves extraites et le contexte de la présentation. Pour évaluer ces capacités, nous construisons un référentiel multimodal de présentations couvrant les scénarios de présentation unique, de discussion et d'interaction, avec des critères d'évaluation spécifiques à chaque tâche : qualité du contenu, pertinence des médias, utilisation des médias dynamiques, naturel des dialogues et ancrage des interactions. Dans l'ensemble, PresentAgent-2 étend la génération de présentations de la création de diapositives dépendantes de documents à la génération de vidéos de présentation guidées par des requêtes et fondées sur la recherche, intégrant médias multimodaux, dialogue et interaction. Code : https://github.com/AIGeeksGroup/PresentAgent-2. Site web : https://aigeeksgroup.github.io/PresentAgent-2.
English
Presentation generation is moving beyond static slide creation toward end-to-end presentation video generation with research grounding, multimodal media, and interactive delivery. We introduce PresentAgent-2, an agentic framework for generating presentation videos from user queries. Given an open-ended user query and a selected presentation mode, PresentAgent-2 first summarizes the query into a focused topic and performs deep research over presentation-friendly sources to collect multimodal resources, including relevant text, images, GIFs, and videos. It then constructs presentation slides, generates mode-specific scripts, and composes slides, audio, and dynamic media into a complete presentation video. PresentAgent-2 supports three independent presentation modes within a unified framework: Single Presentation, which generates a single-speaker narrated presentation video; Discussion, which creates a multi-speaker presentation with structured speaker roles, such as for asking guiding questions, explaining concepts, clarifying details, and summarizing key points; and Interaction, which independently supports answering audience questions grounded in the generated slides, scripts, retrieved evidence, and presentation context. To evaluate these capabilities, we build a multimodal presentation benchmark covering single presentation, discussion, and interaction scenarios, with task-specific evaluation criteria for content quality, media relevance, dynamic media use, dialogue naturalness, and interaction grounding. Overall, PresentAgent-2 extends presentation generation from document-dependent slide creation to query-driven, research-grounded presentation video generation with multimodal media, dialogue, and interaction. Code: https://github.com/AIGeeksGroup/PresentAgent-2. Website: https://aigeeksgroup.github.io/PresentAgent-2.