每日精选AI研究论文及翻译
深度研究要求智能体找到同时满足多重约束的答案。发现这类答案成本高昂,而验证候选答案时,通常可将该过程分解为可操作的逐条约束检查。这种发现-验证不对称性表明,研究智能体不应仅是延长搜索时间——它应当通过验证中间结果,并利用部分已验证的状态指导后续优化,递归地改进当前答案。我们提出AREX——一类递归自改进(RSI)深度研究智能体。AREX在内层研究循环(收集证据、构建临时答案)与外层自改进循环(逐条约束审计答案、识别未解决的断言、发起针对性后续研究)之间交替运行。为在长周期内维持RSI,AREX学习了一种自主上下文更新工具,将不断累积的交互历史压缩为紧凑的改进状态,保留已验证的证据与未解决的约束,无需依赖外部模型。我们通过智能体中间训练和长跨度强化学习,在已验证的合成任务与高质量轨迹上训练AREX。为缓解长跨度学习中稀疏最终奖励的问题,我们强化了关键步骤——即获取决定性证据或纠正错误研究方向的步骤。我们实现了密集4B模型与122B-A10B混合专家模型。在BrowseComp、WideSearch、DeepSearchQA、人类最后考试(HLE)以及其他推理与工具使用基准测试中,AREX大幅超越同规模基线模型,并与使用显著更多激活参数量的模型保持竞争力。
大语言模型在K-12教育中的应用日益广泛,但现有基准测试主要检测试题解答能力,而非理解课程知识的结构化组织与视觉呈现方式。我们将这类能力称为"课程认知",涵盖先决条件链、概念分类、实验-概念关联、教学序列编排及视觉接地等维度。我们构建了K12-KGraph——基于人民教育出版社官方教材(涵盖中小学数学、物理、化学、生物)的课程对齐知识图谱,包含九类节点与十四类关系,覆盖课程结构与视觉接地信息。基于该图谱,我们衍生出K12-Bench基准测试集,包含23640道多选题,涵盖五大任务族:接地(Ground)、先决条件(Prereq)、邻近(Neighbor)、证据(Evidence)与定位(Locate)。同时构建了K12-Train——包含7335个样本的图引导监督微调语料库,其中含2267个纯文本问答对与5068个多模态视觉问答对。在K12-Bench测试中,Gemini-3-Flash仅达57%精确匹配率,Gemma-4-31B-IT为46%,其中Prereq与Neighbor任务难度最高。我们的训练实验表明,领域特化监督可缩小这一差距。在匹配的2300样本预算下,K12-Train-Text在GaokaoBench与EduEval测试中持续优于同等规模的八个主流指令微调语料库子集。对于视觉语言模型,K12-Train-Full在Gaokao-MM、MDK12-medium与K12Vista上取得所有对比训练配置中的最佳综合结果,且使用的样本数少于完整DataFlow与WizardLM基线。该模型同时超越纯文本与纯多模态变体,证明文本与视觉监督具有互补性。我们已开源该图谱、基准测试、训练数据及完整构建流程。
具身视觉追踪(EVT)要求一个移动智能体仅依靠机载视觉,持续跟随自然语言描述的特定目标。尽管近期视觉-语言-动作(VLA)策略统一了目标识别与轨迹规划,但其思维链(CoT)推理往往在抽象的潜在空间中运行,难以监督且与显式的图像空间检测对齐较弱。为解决这一问题,我们提出ReferTrack——一种先指代后追踪的范式,利用单目前向摄像头实现具身视觉追踪。该模型首先从一组索引化的边界框中选择目标,然后基于这一图像锚定决策解码追踪航点。为保留随时间变化的目标运动线索,ReferTrack维护了一个先前选中的边界框的滑动窗口队列,并通过时空视点-边界框指示(TVBI)令牌将几何特征注入视觉历史。此外,我们通过在自定义Refer-QA数据集上进行联合训练来增强目标识别能力。在EVT-Bench上,ReferTrack在单目标、干扰项和模糊追踪三个子任务中分别取得了89.4%、73.3%和74.1%的成功率,达到最先进的单视图性能,在侧重于身份识别的任务上甚至与多摄像头基线持平或超越。最后,在足式机器人和人形机器人上的实际部署验证了其鲁棒的仿真到现实迁移能力。代码已开源:https://github.com/MedlarTea/referTrack。
基于策略的自蒸馏方法(OPSD)因无需外部教师模型而优于基于策略的蒸馏方法(OPD),但其仍需师生模型间的信息不对称性,以确保自教师提供的学习信号强于学生模型。现有方法通过特权答案或视觉证据构建这种不对称性。我们探讨是否可同时消除这两者,从而实现一种更简洁的、纯粹由输入条件驱动的OPSD形式。为此,我们提出视觉对比自蒸馏方法(VCSD),其将图像内容去除转化为基于策略的自蒸馏信号。在学生模型生成的每个响应前缀处,指数移动平均(EMA)教师模型在同一提示和前缀下生成两种下一个词的分布——一种以原始图像为条件,另一种以内容擦除后的控制图像为条件。两种分布的逐词对数概率差凸显了因实例级视觉内容而可能性显著提升的候选词。我们利用这种对比,在教师模型原始图像分布的合理支持域内对其进行锐化处理,并将所得完整分布目标蒸馏至学生模型。使用ViRL39K数据集,VCSD在Qwen3-VL和Qwen3.5模型上的一致表现均优于匹配的OPSD方法。例如,在Qwen3-VL上,VCSD将七个基准测试的综合得分分别从2B参数的62.27%提升至67.04%、4B参数的71.30%提升至73.16%、8B参数的72.51%提升至76.26%。此外,VCSD无需外部教师模型、特权答案、视觉证据信号、推理轨迹,也不增加额外的推理时间成本。
空间智能对智能体从静态语义理解转向与物理世界交互至关重要。许多空间任务植根于连续视觉场景,其中位置、区域和路径通过指向、标记或绘制来表达比报告精确坐标或离散文本符号更自然。然而,现有空间推理基准通常需要坐标、选项或文本,这为图像生成模型造成了答案接口不匹配的问题。这使得在相同任务语义下评估图像生成模型与文本输出视觉语言模型变得困难,尽管前者能够直接在像素空间中外化空间判断。我们提出ProVisE(协议化视觉评估),这是一个与基准无关的框架,它从图像生成模型中引出受协议约束的视觉答案,并将其解析为与原始指标兼容的结构化预测。ProVisE还包含一个智能体式构建器,可为新基准构建并验证任务特定协议。我们进一步引入SpatialGen-Bench,这是一个精心策划的诊断性基准,包含470个样本,涵盖14个空间子任务、四个能力层级和多种答案形式。我们在统一设置下评估了代表性文本输出视觉语言模型和图像生成模型,并在六个外部空间基准上验证了智能体式协议构建的有效性。结果表明,当空间答案可在像素空间中直接外化时,图像生成模型具有竞争力,而文本输出视觉语言模型在组合空间推理方面仍保持明显优势。这些发现揭示了像素空间表达与文本推理的互补优势,并为研究图像生成模型中的空间认知建立了与指标兼容的测试平台。
我们提出SANA-Video 2.0,这是一种在统一架构下以5B和14B规模实例化的混合视频扩散Transformer。该模型专为在单GPU上生成长达720p的高质量视频而设计,在质量上可与全softmax视频DiT相媲美,同时保留了线性注意力在长序列处理上的优势。为了避免全程使用二次注意力,混合线性-softmax注意力机制以3:1的比例将门控线性注意力(实现O(N)主导的混合)与周期性门控softmax锚点相结合,恢复了纯线性注意力所缺失的全秩token交互。为在深度上传播这些更新的表示,块注意力残差(AttnRes)将完成的块摘要路由至后续线性层,实现了锚点特征复用,并将深层有效秩提升约12%。通过从头训练,SANA-Video 2.0直接学习完整的混合机制,而非对预训练模型进行线性化处理,并通过降分辨率代理研究确定了25% softmax为质量与效率的最佳折衷点。采用40步采样时,SANA-Video 2.0在单块H100上以480p分辨率、13.2秒内达到VBench评分84.30,在延迟远低于更大规模softmax视频DiT的情况下保持竞争力。其编译后的DiT前向传播在720p/60秒场景下比匹配的全softmax基线快3.2倍,且该差距随视频时长增加而扩大。此外,全栈Sol-Engine优化(内核融合、缓存和稀疏注意力)将此硬件友好型主干网络进一步加速3.58倍,使得5B流水线在720p/5秒场景下仅需13.06秒,比单块H100上的Wan 2.2-A14B快120倍。总体而言,我们的混合设计以大幅降低的成本恢复了softmax级别的表现力,从而解锁了可扩展的长时、高分辨率视频生成能力。
传统的智能体开发分散在提示词模板、工具模式、回调代码和工作流图中。我们提出NVIDIA面向对象代理框架(NOOA),这是一个模型无关的Python框架,用于构建可靠的AI智能体。NOOA采用更简洁的方式:智能体就是一个Python对象。其方法是模型可执行的操作,字段是状态,文档字符串是提示词,类型注解是契约。代码体仅为"..."的方法将在运行时由LLM驱动的智能体循环完成,而具有正常代码体的方法则保持标准确定性Python。这使得开发者和智能体拥有相同接口,因此智能体行为可以像其他软件一样被测试、追踪、重构和改进。 本文做出三项贡献:(1)提出"智能体即Python对象"编程模型及其背后的设计原则。对于Python已有的抽象,我们直接采用。智能体特有的能力——上下文、事件、状态渲染、长期记忆和经过验证的LLM循环——通过简单的Python式API暴露,使开发者和智能体共享同一熟悉的编程模型。(2)识别出NOOA首个(据我们所知)在统一界面上组合的六个面向模型的概念:类型化输入/输出、基于活对象的引用传递、代码即行动、可编程循环工程、显式对象状态、以及支持上下文和事件的模型可调用工具API。我们发现社区已在多个概念上趋于一致(通常作为实验性或部分特性),并通过对比促进进一步采纳。(3)在针对性能力测试以及SWE-bench Verified、Terminal-Bench 2.0和ARC-AGI-3等智能体与推理基准上,证明当前模型能有效使用此接口。
我们推出Tencent WorkBuddy Bench——一个面向编码智能体的多领域评估套件;本报告记录了其构建方法、评分协议及跨模型排行榜。其核心是一个统一评估框架,用于在四大工作领域(代码、网页、办公、安全)中构建并运行基于分布信息的编码智能体任务。每个任务并非改编自公开议题文本,而是从真实提交、拉取请求或业务场景中逆向推导,重新编写为简短、口语化、角色扮演式的请求,因此无法通过网络搜索底层议题、拉取请求或提交线程来还原任务提示。由于数据集(包括任务目录、环境镜像、评估框架、测试用例和参考解决方案)完全开放,其抗污染能力依赖于这种构建方法及数据集版本管理,而非保密性。四个子集——仓库级工程、前端开发、办公与业务工作流、红蓝队安全——从不同侧面探索真实工作场景,每个子集采用各自独特的验证方式。所有子集均封装为统一的任务目录格式,并在统一且可复现的协议下,于两个智能体框架(CodeBuddy Code和Claude Code)上运行;完整开源使基准测试可端到端复现并直接审计,任何第三方都能重新运行每个任务并检查其内容。由于每个子集使用不同评分工具,各子集分数不可相互比较,套件不报告整体平均值。我们发布了涵盖多个模型系列的跨模型排行榜。
随着大语言模型能力日益增强,它们越来越多地被部署为协作代理,通过迭代交互来承担用户委托的任务。然而,真正的交互本质上是动态的:用户很少一开始就明确表达意图,而是随着对话展开逐步披露、修正和重塑其意图。尽管如此,大语言模型目前仍主要在单轮、完全指定的设定下进行评估或训练,这留下了一个根本性问题:当用户意图在对话过程中演变时,大语言模型能在多大程度上追踪并响应这种变化?为研究这一问题,我们引入了一个框架,将静态的单轮任务转化为动态的多轮对话——在此过程中,用户的意图在各轮之间逐步揭示、修正,甚至中途转向——同时保留每项任务的原始评估协议,从而使现有基准测试无需额外标注即可作为受控实验平台。在多项任务中,我们发现一个一致的现象:在静态设定下表现优异的模型,在意图演变的设定中性能显著下降,且这一现象跨越不同模型家族。我们的研究结果揭示了一个根本差距:当前的大语言模型尚不能忠实追踪并响应用户不断演变的意图——这一能力在静态评估中不可见,但对未来的协作代理却至关重要。
理解视频中的运动是视觉学习的一个基本挑战,因为帧间变化交织着两种动态来源:相机运动和物体运动。这种分解在表示学习中尚未得到充分探索,部分原因是这些因素在自然视频中紧密耦合,难以单独监督。然而,恢复这种分解对于学习稳健的运动表示至关重要,这些表示能够将有意义的物体动态与相机引起的变体分离开来。我们研究这类结构化的运动表示是否可以从预训练图像视觉变换器的冻结特征中恢复。我们提出了结构动力学模型(SDM),该模型通过未来特征预测,明确地将时间变化的主要来源与残余动态分离开来,而不是用单一的纠缠潜在变量或非结构化的、空间密集的转换令牌来表示视频变化。训练结合了在真实视频上的自监督学习以及在合成Kubric数据上对场景动态的弱监督。我们在ProbeMotion上评估SDM,这是一个新的评估套件,涵盖合成和真实视频,包括相机运动、物体运动和组合动态。SDM在多个探针上优于使用全局CLS令牌或平均池化特征的主干基线,并且与强监督表示(如VGGT)相比表现相当,尽管使用的监督更弱。这些结果表明,预训练图像模型可以很容易地被重新用于结构化的视频动态表示,为学习和分析潜在视频动态提供了有用的归纳偏置。
当真实场景被智能手机摄像头捕捉并显示在屏幕上时,所呈现的图像在色彩、亮度和对比度上往往与原始场景存在显著差异。尽管现代相机和显示技术均取得重大进展,这一差距仍持续存在。其核心原因在于:大多数处理流程将高维的"拍摄-显示"过程分解为相机与显示器两个独立校正的阶段,再通过低维色彩变换进行连接,由此导致信息瓶颈与不可避免的误差累积。针对这一系统性挑战,我们提出"色彩直通"(Color Pass-Through)——一种直接对拍摄图像进行端到端学习的框架。其关键创新在于将相机与显示器视为耦合系统,而非孤立地校准二者。相机与显示器的耦合带来两大实际优势:(1)通过端到端优化将真实场景完整呈现至屏幕;(2)通过完整的"拍摄-显示"通路,为每位特定观察者实现高效的一步校准。我们通过数字观察者与人类观察者双重验证了该方法的有效性。与代表性基线方法相比,我们的方法在5分制用户研究中平均提升2.0分,量化指标提升超过2倍,显著改善了原始场景感知色彩的还原效果。
现实世界中的智能体学习往往受限于高昂的环境交互成本,例如运行耗时实验或获取人工反馈。上下文学习为智能体提供了一种高度样本高效的方式,使其能从自身的交互历史中学习,但一旦该经验从上下文中移除,其收益便会消失。另一方面,上下文蒸馏提供了一种将上下文信息内化到模型权重中的机制。然而,如何将其应用于智能体的交互历史而同时不牺牲环境样本效率,这一问题仍未被充分探索。我们将此问题称为经验蒸馏,并开发了一种无需在已收集经验之外进行更多环境交互的实现方法。在749个精心策划的软件工程任务和六个文字冒险游戏上的实验表明,该方法在两个领域中至少保留了上下文学习收益的64.8%,而直接对收集到的经验进行监督微调仅能恢复3.8%的收益。与经典强化学习基线相比,基于试错经验的上下文学习后接经验蒸馏,在环境样本数量至少减少9.6倍的情况下达到了与其相当的性能。
多智能体交互世界模型不仅需要生成一致的观测结果,还必须维护跨智能体持久存在且随视角演化的世界状态。现有的自回归视频扩散流水线将观测历史作为条件上下文传递,这使得在多智能体与多视角场景中难以维持共享状态。我们提出WorldWeaver (W²),一种流式多智能体视频扩散模型,其通过引入跨智能体世界状态寄存器来增强生成过程:这些可学习令牌存储共享世界信息,追踪个体智能体状态,并在每个生成片段后动态更新。我们为这些寄存器提供涵盖个体智能体状态、全局视角(包括鸟瞰图)及场景文本的监督信号。此外,我们采用混合Transformer架构对模型进行改进,该架构使用独立的权重分别处理世界状态建模与视觉帧建模。在双智能体Minecraft视频生成任务中的大量实验表明,显式的世界状态建模提升了逻辑一致性与生成质量。
我们研究面向智能体任务的在策略蒸馏(OPD),其中大语言模型(LLM)智能体需与环境进行多轮交互,学生模型需模仿教师模型在这些多轮交互历史中的行为。完全在线的OPD成本高昂,因为每次更新都需要学生模型通过环境生成全新轨迹,并在访问过的历史状态上查询教师模型。为此,我们提出重放前缀在策略蒸馏(ReOPD),这是一种离环境替代方案,通过复用预收集的教师轨迹作为重放前缀:学生模型仅在选定步骤执行动作,而教师模型在不触发新环境交互的前提下提供密集的逐步骤监督。我们发现多轮OPD存在一个前缀陷阱:使历史状态更贴近学生模型的实际分布虽能提升与学生的相关性,但可能导致在教师模型目标不可靠的历史状态上发起查询,从而在学生占据分布与教师可靠性之间形成双向分布偏移。ReOPD通过将多轮OPD转化为可靠性感知的前缀分布设计来解决该问题,并采用简单的步长衰减采样调度方案实现——优先选取早期、偏移幅度较小的前缀。在数学推理与搜索环境中,跨越多个教师与学生模型规模的实验表明:ReOPD能保持或提升OPD级别的准确率,学生训练过程中零工具调用,且每次轨迹采样的速度至少是OPD的4倍。因此,ReOPD将昂贵的智能体-环境交互转化为可复用的离线资源,实现了跨工具、任务和环境的高效蒸馏。
强化学习在大语言模型中的应用通常依赖信任区域掩码来稳定离线策略更新。主流的PPO风格方法使用采样令牌的重要性比率作为两项判据:邻近性判据,用于判断策略是否偏离行为策略过远;方向性判据,用于判断更新是否进一步扩大这种偏离。近期研究DPPO通过将PPO基于比率的测试替换为行为策略与训练策略之间的概率散度,改进了邻近性判据。然而其方向性判据仍继承自PPO,仅当采样令牌的重要性比率偏离1时才会对令牌进行掩码处理。我们观察到这种基于比率的方向性判据是一种单样本代理,其符号可能与定义邻近性判据的散度变化产生冲突。因此我们提出预测性散度掩码,通过判断下一步策略梯度更新将增大还是减小信任区域所采用的同一散度值。针对LLM强化学习中使用的离散softmax策略,我们推导出了该预测的闭式解。由于生产环境的推理引擎仅暴露词汇表的截断视图(top-K),我们开发了两种轻量级top-K估计器用于该预测。详细分析表明,与采样比率相比,基于散度的方向判据与散度实际变化的一致性更优,由此生成的掩码能够跨模型规模与精度设置提升强化学习训练效果。
大规模部署导航系统需要一种能够最小化传感器假设、跨机器人形态泛化且训练高效的方案。然而,当前最先进的系统仍依赖于深度传感器、多相机阵列或预建地图,这限制了其支持的硬件类型并增加了部署成本。我们提出 Robostral Navigate,一个基于 8B 参数的视觉-语言模型,专为此规模化目标设计。该模型仅需接收单目 RGB 图像流——这是机器人平台上最普遍的传感器——并通过在当前相机视角中指向下一个目标位置来预测航点。纯图像空间操作而非机器人专用坐标的决策方式,使策略自然具备对相机内参及场景尺度变化的鲁棒性,从而无需重新校准即可部署于轮式、足式及空中机器人。我们生成了覆盖 35 万模拟场景的 240 万条轨迹,以减少对真实世界数据采集的依赖并实现轻松扩展。进一步地,我们引入一种前缀缓存训练方案,将完整轨迹打包为单一训练序列,实现训练 token 数量减少 22 倍,训练时间从数月缩短至数天。基于树的注意力掩码机制可防止模型依赖先前真实动作,促进基于视觉感知的动作预测;同时采用强化学习进一步提升探索与恢复能力。在连续环境下的 Room-to-Room 与 Room-Across-Room 基准测试中,Robostral Navigate 刷新了当前最优性能。在 R2R-CE 上,其成功率达 77.4%,超越最佳单目方法 10.5 个百分点,且仅使用单个 RGB 相机即比最先进的深度或多相机系统高出 5.3 个百分点。在 RxR-CE 上,其成功率达 75.1%,全面超越所有单目基线方法。
智能体推理因其整合大规模信息并生成可靠准确内容的能力,已成为金融分析领域的变革性力量。然而在处理复杂现实问题时,不同智能体仍表现出显著性能差异。本研究设计了基于专家知识的金融文档复杂布局合成技能——Finance-LaTeX SKILL。通过基于该技能的智能体工作流,我们生成了2000份专业金融文档及6000个高质量的问答对。为评估智能体综合能力,我们提出了FinanceComplexQA——一个接近真实场景的综合性开放金融文档生成基准,包含针对1009份金融文档的2026项深度研究任务。该基准具备八大核心特征:双语支持;覆盖六类主流场景与七类任务;专家级文档推理问题;复杂布局深度研究;相对稳定且永久的参考答案;以及通过"智能体作为评判者"结合多评估指标的精准评价体系。我们利用FinanceComplexQA对金融文档问答领域的领先检索增强生成系统与智能体推理工具进行了全面评估。通过识别并分析失败案例,深入研究了其在数值计算、多跳推理、内容摘要及行业分析方面的能力。
我们研究正弦递归作为隐式神经表示中谐波频谱丰富的一种迭代机制。分析表明,正弦激活会诱发谐波线谱,从频谱角度解释了递归展开如何增强有效频谱支持。我们通过共享正弦块实现这一原理,该模块迭代优化潜在表示。我们针对前馈隐式神经网络、非正弦递归变体及平衡态正弦模型,实证验证了所得频谱行为。作为上述分析的补充,我们评估了所提出架构在图像和三维表示任务上的表现。在RGB图像基准测试中,我们的方法以更少的参数和更少的优化步骤实现了高于前馈基线的保真度,并进一步成功迁移至超分辨率、NeRF和SDF任务。
现代AI代理依赖复杂的推理框架(如Claude Code、Codex和OpenClaw)来支持多轮推理、工具调用及外部系统访问。尽管功能强大,但这些复杂框架使得代理难以在开放基础设施上进行端到端训练——其SFT/RL堆栈无法原生支持有状态、多进程的框架推理。为解决这一问题,我们提出OpenForgeRL——一个开源框架,支持在多样化环境中对基于框架的代理进行端到端训练。OpenForgeRL通过轻量级代理实现这一目标:该代理在服务框架的模型调用时,将调用记录为标准RL代码库(如veRL)的训练数据;同时结合Kubernetes编排器,将每次 rollout 部署至独立远程容器,从而支持在任何环境的海量框架上训练。通过解耦训练与推理,OpenForgeRL使研究者能够直接在代理实际部署的框架与环境中便捷地训练、研究及优化代理。我们在多种复杂框架与环境(涵盖基于工具/爪的代理,以及多模态GUI浏览器和计算机操作代理)中验证了该框架。仅使用数百至数千个任务,OpenForgeClaw在ClawEval上达到31.7 pass^3和55.9 pass@3,在QwenClawBench上达到33.7;OpenForgeGUI在OSWorld-Verified上达到37.7,在Online-Mind2Web上达到63.0,在WebVoyager上达到72.3。两者在几乎所有基准测试中均优于相似规模的开源基线,且在GUI场景中匹配或超越数倍规模的模型。除基准测试外,我们分析了框架选择(如ZeroClaw、OpenClaw、Codex)和强化学习如何塑造代理行为。研究发现,部分框架的学习难度显著高于其他框架,且强化学习提升了代理的可靠性(如自我验证、工具覆盖范围及多步计划完成能力),但错误恢复等关键能力仍显薄弱。
通用型机器人操作策略的发展本质上受到大规模、高保真场景数据可用性的限制。尽管近期自动化合成方法尝试通过文本到布局的想象生成或简化程序化生成来弥合这一差距,但这些方法常因物理不可行性而失败,且无法捕捉真实人类环境中复杂密集的杂乱状态。本文提出TableVerse——一种全自动化Real2Sim流水线,将范式从想象性布局生成转向基于非结构化野外图像数据的确定性重建。该框架能够无缝处理非脚本化的互联网媒体,生成具备精确度量尺度、真实拓扑结构及经过验证的机械稳定性的高保真、可仿真桌面环境。此外,我们集成自动化任务条件轨迹生成框架,用于合成高质量、无碰撞的抓取与放置演示。依托完整流水线,我们构建了TableVerse-100K数据集——包含10万个独特、物理一致环境及其配套交互操作轨迹的大规模语料库。通过涵盖多样化的资产组合、真实的空间分布及高质量演示,TableVerse-100K建立了高度可扩展且高保真的数据基础,为推进通用型机器人操作任务的未来研究提供了重要价值。
可控视频生成面临挑战,主要源于通过文本提示或主要约束像素运动的运动控制输入来精确指定多物体交互存在困难。在实际应用中,基于轨迹的控制通常要求用户为多个物体绘制精确轨迹,这种方式难以适应场景复杂度,且在物体遮挡或重叠时会产生歧义。为实现灵活且精确的多主体控制,我们提出了GraphVid——一种基于图条件约束的图像到视频生成模型,该模型通过结构化交互图实现交互式控制。我们进一步构建了GraphVid-Bench,这是一个以交互为中心的大规模视频数据集,包含结构化关系标注,用于训练具备交互感知能力的视频生成模型。尽管相比先前的运动控制方法,GraphVid使用的训练数据和可训练参数大幅减少,但其在可控性和视频质量上表现优异。与Motion-I2V相比,GraphVid将FID降低了39.9%,FVD降低了37.6%,同时提升了PSNR(从9.87提升至15.98)和SSIM(从0.38提升至0.61)。我们的研究结果凸显了结构化语义界面作为可控视频生成强大范式的潜力。
我们从结果导向的角度重新审视了数据集蒸馏问题。与对齐过程替代指标(如逐步梯度或训练轨迹)不同,影响匹配(Inf-Match)方法对齐的是训练的最终结果:它学习一个紧凑的合成数据集,使其对收敛参数的影响与完整数据集的影响相匹配。具体而言,我们引入了一种完全可微的样本级影响估计器,能够量化添加或移除数据带来的参数变化,无需耗时的逆海森矩阵乘积或凸性假设。该估计器通过展开优化动态并应用一阶泰勒近似,以线性时间运行。随后,我们通过最小化合成数据集的影响与真实数据集影响之间的差异来学习合成数据集,从而实现结果对齐而非启发式的过程模仿。Inf-Match在标准分类基准上取得了最佳准确率。例如,在Tiny-ImageNet(IPC=10)上,Inf-Match达到了31.5%,相比NCFM提升了4.7%。除分类任务外,Inf-Match可扩展至Flickr30K上的视觉-语言蒸馏任务,其性能优于强大的过程匹配基线。例如,在使用200到1000个合成样本时,我们的方法在图像/文本检索任务上取得了领先的平均性能,比NCFM高出2.5%。代码将通过https://github.com/hrtan/infmatch发布。