ChatPaper.aiChatPaper

ResearchStudio-Reel : Automatiser le dernier kilomètre de la recherche, de l'article au poster, à la vidéo et au blog

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

July 5, 2026
Auteurs: Lingao Xiao, Yalun Dai, Yangyu Huang, Qihao Zhao, Wenshan Wu, Hugo He, Ruishuo Chen, Jin Jiang, Qianli Ma, Jiahuan Zhang, Xin Zhang, Ying Xin, Yang Ou, Yan Xia, Scarlett Li, Longbo Huang, Zhipeng Zhang, Yang He, Yap Kim Hui, Yan Lu
cs.AI

Résumé

La diffusion de la recherche — transformer un article en poster, en vidéo de présentation et en billet de blog — reste un dernier kilomètre manuel. Les automatisations antérieures traitent chaque artefact de manière isolée, chacune extrayant l’article depuis le départ, livrent généralement un rendu unidirectionnel que l’auteur ne peut pas rouvrir dans PowerPoint ou Word, et conditionnent la qualité sur des scores de préférence VLM mous qui stagnent alors que des sections porteuses restent vides de sens. Nous soutenons que ce dernier kilomètre est mieux construit comme une composition de compétences : des contrats minces lisibles par un agent qui partagent un seul extracteur en amont et enveloppent des primitives déterministes dans une boucle de remplissage mesuré dont les sorties sont des portes de rendu à validation binaire stricte. Nous concrétisons cette approche avec ResearchStudio-Reel, cinq compétences Claude Code et Codex organisées en un extracteur partagé unique (Paper2Assets), trois générateurs éditables (Paper2Poster, Paper2Video, Paper2Blog) et une couche de convergence interactive (Paper2Reel). Paper2Assets extrait chaque article une seule fois en un ensemble partagé réutilisable par toute compétence aval ; les trois générateurs produisent un poster prêt à imprimer, une vidéo de présentation synchronisée et un blog bilingue, factuellement cohérents et permettant des allers-retours avec PowerPoint ou Word ; Paper2Reel assemble ensuite les trois dans un visualiseur HTML autonome dont les clics au niveau des sections font sauter la vidéo, les diapositives, les légendes et le blog vers le contenu correspondant. Sur le benchmark Paper2Poster, nos posters surpassent tous les sous-critères esthétiques et d’information par rapport aux systèmes automatisés antérieurs et aux LLMs frontières en un seul passage, dépassant même ceux des auteurs sur l’esthétique selon deux juges VLM réservés, et remportent globalement 84 % à 93 % des articles ; les audits de capacités montrent en outre qu’en associant de manière unique des points saillants sur les diapositives alignés avec la narration à un blog bilingue conditionné par une réparation DOCX tenant compte de la mise en page, ResearchStudio-Reel est le seul pipeline à livrer les trois artefacts éditables. Le projet est accessible à l’adresse https://aka.ms/ResearchStudio.
English
Research dissemination, turning a paper into a poster, a talk video, and a blog post, is still a manual last mile. Prior automation treats each artifact in isolation that each re-extract the paper from scratch, usually ship one-way renders the author cannot reopen in PowerPoint or Word, and gates quality on soft VLM-preference scores that plateau while load-bearing sections still read as empty. We argue this last mile is best built as a composition of skills: thin agent-readable contracts that share one upstream extractor and wrap deterministic primitives in a measured-fill loop whose exits are hard pass/fail render gates. We instantiate this as ResearchStudio-Reel, five Claude Code and Codex skills organized into one shared extractor (Paper2Assets), three editable generators (Paper2Poster, Paper2Video, Paper2Blog), and one interactive convergence layer (Paper2Reel). Paper2Assets extracts each paper once into a shared bundle that can be reused by every downstream skill; The three generators produce a print-ready poster, a synchronized talk video, and a bilingual blog that stay factually consistent and round-trip through PowerPoint or Word; Paper2Reel then binds all three into a self-contained HTML viewer whose section-level clicks jump the video, slides, captions, and blog to matching content. On the Paper2Poster benchmark, our posters lead every aesthetic and information sub-criterion against both prior automated systems and single-shot frontier LLMs, surpassing the authors' own on aesthetics under two held-out VLM judges and winning overall on 84% to 93% of papers; capability audits further show that, by uniquely pairing narration-aligned on-slide highlights with a bilingual blog gated by layout-aware DOCX repair, ResearchStudio-Reel is the only pipeline to ship all three editable artifacts. Project is available at https://aka.ms/ResearchStudio