ChatPaper.aiChatPaper

ResearchStudio-Reel: автоматизация последнего этапа исследования — от статьи до постера, видео и блога

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

July 5, 2026
Авторы: Lingao Xiao, Yalun Dai, Yangyu Huang, Qihao Zhao, Wenshan Wu, Hugo He, Ruishuo Chen, Jin Jiang, Qianli Ma, Jiahuan Zhang, Xin Zhang, Ying Xin, Yang Ou, Yan Xia, Scarlett Li, Longbo Huang, Zhipeng Zhang, Yang He, Yap Kim Hui, Yan Lu
cs.AI

Аннотация

Распространение научных результатов — преобразование статьи в постер, видео выступления и запись в блоге — по-прежнему остается ручной последней милей. Существующие подходы к автоматизации обрабатывают каждый артефакт изолированно: каждый заново извлекает информацию из статьи с нуля, обычно создает односторонний рендеринг, который автор не может открыть в PowerPoint или Word, и оценивает качество по мягким оценкам предпочтений VLM, которые выходят на плато, в то время как несущие разделы по-прежнему выглядят пустыми. Мы утверждаем, что эту последнюю милю лучше всего строить как композицию навыков: тонких контрактов, понятных для агентов, которые используют один вышестоящий экстрактор и оборачивают детерминированные примитивы в цикл с измеряемым заполнением, выходы из которого представляют собой жесткие пороги рендеринга с результатом «пройдено/не пройдено». Мы реализуем этот подход в виде ResearchStudio-Reel, пяти навыков на базе Claude Code и Codex, организованных в один общий экстрактор (Paper2Assets), три редактируемых генератора (Paper2Poster, Paper2Video, Paper2Blog) и один интерактивный слой конвергенции (Paper2Reel). Paper2Assets однократно извлекает данные из каждой статьи в общий набор, который может быть повторно использован любым нижестоящим навыком; три генератора создают готовый к печати постер, синхронизированное видео выступления и двуязычный блог, которые остаются фактически согласованными и допускают круговой обмен через PowerPoint или Word; Paper2Reel затем объединяет все три в автономный HTML-просмотрщик, в котором клики по разделам переключают видео, слайды, подписи и блог на соответствующий контент. На бенчмарке Paper2Poster наши постеры превосходят как предыдущие автоматические системы, так и однопроходные передовые LLM по каждому эстетическому и информационному подкритерию, обходят собственные постеры авторов по эстетике по оценкам двух отложенных VLM-судей и одерживают общую победу по 84%–93% статей; аудит возможностей также показывает, что благодаря уникальному сочетанию выделений на слайдах, согласованных с повествованием, и двуязычному блогу, контролируемому с помощью учитывающего разметку восстановления DOCX, ResearchStudio-Reel является единственным конвейером, который поставляет все три редактируемых артефакта. Проект доступен по адресу: https://aka.ms/ResearchStudio
English
Research dissemination, turning a paper into a poster, a talk video, and a blog post, is still a manual last mile. Prior automation treats each artifact in isolation that each re-extract the paper from scratch, usually ship one-way renders the author cannot reopen in PowerPoint or Word, and gates quality on soft VLM-preference scores that plateau while load-bearing sections still read as empty. We argue this last mile is best built as a composition of skills: thin agent-readable contracts that share one upstream extractor and wrap deterministic primitives in a measured-fill loop whose exits are hard pass/fail render gates. We instantiate this as ResearchStudio-Reel, five Claude Code and Codex skills organized into one shared extractor (Paper2Assets), three editable generators (Paper2Poster, Paper2Video, Paper2Blog), and one interactive convergence layer (Paper2Reel). Paper2Assets extracts each paper once into a shared bundle that can be reused by every downstream skill; The three generators produce a print-ready poster, a synchronized talk video, and a bilingual blog that stay factually consistent and round-trip through PowerPoint or Word; Paper2Reel then binds all three into a self-contained HTML viewer whose section-level clicks jump the video, slides, captions, and blog to matching content. On the Paper2Poster benchmark, our posters lead every aesthetic and information sub-criterion against both prior automated systems and single-shot frontier LLMs, surpassing the authors' own on aesthetics under two held-out VLM judges and winning overall on 84% to 93% of papers; capability audits further show that, by uniquely pairing narration-aligned on-slide highlights with a bilingual blog gated by layout-aware DOCX repair, ResearchStudio-Reel is the only pipeline to ship all three editable artifacts. Project is available at https://aka.ms/ResearchStudio