每日精选AI研究论文及翻译
扩展世界模型的一种常见策略是投入更多算力在更多抓取视频上进行训练。我们认为这一策略效率低下:扩展世界模型还需要一个能够提供有依据奖励信号的递归数据引擎。代码智能体的成功恰好说明了这一点为何重要。由于代码是可执行的,编译器和运行时可以为大语言模型的强化学习(RL)后训练提供高质量的奖励。相比之下,空间生成仍然在很大程度上依赖诸如CLIP分数之类的模糊代理指标。这些信号模糊且有偏,难以支撑强化学习后训练。与此相比,游戏开发为空间世界模型提供了一个缺失的奖励环境。由游戏引擎编码的场景是一种可执行的世界规范:引擎能够高效地检查碰撞、物理、可导航性和有界可玩性,而开发者则通过判断场景是否应当被接受来提供全局验证信号。游戏开发还提供了真实世界中的长视界轨迹数据,可用于强化学习后训练。因此,我们提出基于人与引擎联合验证的强化学习(RLHEV),这是一种结合了密集引擎信号与开发过程中隐式人工接受反馈的后训练范式。
近期视频生成模型日益被视作世界模型。许多物理过程可以以不止一种有效方式展开。因此,世界模型不仅应再现一条合理的轨迹,还应再现相同初始观测和动作下可能行为的分布。我们将这种分布层面的要求称为概率对齐。然而,现有评估大多关注单个视频的合理性,并未检验重复生成是否恢复了正确的分布。这引出了一个核心问题:现有视频生成器距离概率对齐的世界建模还有多远?为回答这一问题,我们将概率对齐形式化为世界模型的分布性准则,并引入PAWBench——一个将视频生成器作为世界动力学随机采样器进行评估的基准。我们进一步提出PAWEval,一种结果层面的评估方案,将重复视频展开转化为可能物理行为上的经验分布。在50个场景和11个现有系统中,没有模型能在恢复有效行为范围的同时始终与参考概率保持一致。在确认这一差距后,我们检验了语言提示、初始噪声采样或模型训练是否能重塑模型的预测分布。我们相信,我们的工作可以为未来迈向概率对齐世界建模的努力奠定基础。
多模态大语言模型(MLLMs)能够解读街景,但城市行动能力取决于这些局部证据在智能体开始移动后是否仍然有效。本文研究当前MLLM智能体在复杂的真实规模城市中能将多少局部城市感知转化为可靠行动。我们提出UrbanGround,这是首个基于香港全域三维地理空间数据、在具有物理约束的香港复刻环境中使该问题可测试的沙盒平台。UrbanGround支持第一人称视角下的闭环交互,并提供交互式地图用于导航。智能体可以直接进入三维城市,以第一人称视角进行探索。我们的分析通过三个研究问题追踪空间问题的增长过程。首先,我们测试智能体在主动观察后,是否能够充分理解局部场景以回答空间问题。然后,我们考察当目的地越来越远且越来越不明确时,这种理解能否支撑导航。最后,我们检验由此产生的行为在路径可用性和行人运动发生变化时是否依旧成立。当前MLLM智能体通常在视觉识别和短距离空间推理上表现出有用的原子能力,但方向感知和行人感知运动仍不可靠。它们的核心失败出现在长时间探索中:局部能力无法组合成持续的目标导向行为,错误不断累积且得不到有效纠正。我们希望UrbanGround能够支持更广泛的研究,探讨当前MLLM智能体在复杂、开放的城市环境中究竟能可靠地探索多远。
近期突出的训练后方法,如强化学习(RL)和在线策略自蒸馏(OPSD),已推动大语言模型在数学推理方面取得快速进展,然而它们对真实标签的依赖阻碍了测试时训练(TTT)。用多数投票伪标签替代真实标签是一种自然的替代方案,但该方法存在脆弱性:一次错误的投票会污染教师模型并误导每一个词元。我们观察到这种失败模式具有不对称性:无论投票本身是否正确,与伪标签不一致的采样轨迹通常是错误的。基于这一观察,我们提出了测试时策略优化(TTPO),这是一种不对称的目标函数,通过OPSD蒸馏一致的采样轨迹,并通过分组RL惩罚不一致的采样轨迹。词元级选择进一步优化了两个分支:蒸馏降低已收敛位置的权重,而RL仅惩罚高置信度的错误。即使在伪标签频繁出错的情况下,两种更新仍保持良好有效性,并且随着模型改进,多数投票路由能产生更紧密的自监督信号。在无需任何标签的情况下,TTPO在五个竞赛级基准上达到了与标签监督OPSD相当的性能,在TTT中将Qwen3-1.7B从38.0%提升至45.2%,在无思考模式下取得了+25.2%至+36.4%的提升,并展现出强大的跨任务泛化能力。
同策略蒸馏(OPD)利用预训练的任务特定教师模型提供密集监督信号,已在大语言模型(LLMs)中取得显著成功,并最近被适配用于流匹配模型。然而,该范式存在两大问题:首先,为每个新目标单独训练一个任务特定的教师模型会带来高昂的计算成本;其次,教师与学生分布之间的差异往往导致沿生成轨迹的误差累积。在本文中,我们提出Self-OPD,一种用于流匹配模型的无教师OPD框架,它将学生自身的自我探索转化为逐步监督。在每个时间步,Self-OPD将确定性下一状态预测分支为K个随机SDE候选,利用ODE采样器进行展开,并将它们的奖励与确定性自参考基线比较,得到归一化优势。速度场通过一个全分支拉推目标进行优化,其中高优势分支吸引学生,低优势分支在方向感知衰减和SDE方差归一化下排斥学生。对于多目标对齐,Self-OPD在奖励层面融合归一化分数,避免了直接的梯度冲突。在单一与混合奖励基准上的实验表明,Self-OPD在无需任务特定教师的情况下优于先前的RL和OPD方法。
LLM智能体越来越依赖生成的交互数据来学习如何与外部环境交互。智能体数据生成必须在环境、任务、交互和成功信号之间保持一致性,同时产生有用而非仅仅丰富多样的经验。现有研究覆盖了多个智能体领域,但以领域为中心的组织方式和异构评估往往掩盖了共同的生成机制,并将候选构建与验证和选择混为一谈。本研究为该领域构建了一个两层框架。首先,我们将智能体数据表示为一个通用的因子化对象(E,q,τ,v),包含环境规范、任务信号、交互实现和可选的验证器。我们按照主要锚点和依赖结构来组织生成范式。其次,我们通过准确性-复杂性-多样性(ACE)视角将生成形式化为约束分布设计。准确性建立了基于真实环境且内部一致的数据的可行支撑集。在该支撑集内,复杂性根据所声明学习器及其执行配置的能力来分配学习质量,而多样性则控制数据的覆盖范围和冗余度。利用该框架,我们探讨了先前工作如何验证生成的经验、构建和校准难度以及扩展行为覆盖范围。文献揭示了一种向执行锚定的准确性、学习器相对的复杂性和超越表面变化或数据集规模的多样性转变的趋势。我们进一步通过ACE视角讨论了智能体数据生成中更广泛的方向和新兴趋势,包括它们对扩展、数据来源、训练范式和自适应学习的影响。总体而言,核心挑战不仅仅是生成更多数据,而是在智能体和环境不断演变的过程中持续分配有效、信息丰富且不冗余的经验。
AI驱动的数字人主播必须实时回答商品问题、与观众互动并执行营销策略,这对低延迟、频繁的策略更新以及准确且有效的响应提出了要求。可进化Harness(Evolvable Harnesses)的Skills、Hooks、提示词和工具可以独立于模型权重进行更新,从而支持快速迭代,但这也带来了一个权衡:大模型虽然能零样本适应但速度过慢,而紧凑模型虽然能满足延迟目标却会过拟合于固定的Harness配置。我们提出Harness感知训练(Harness-Aware Training, HAT),训练紧凑模型以适应变化的Harness。其核心组件Harness状态增强(Harness-State Augmentation, HSA)对Skill标识符及其内容、工具模式、提示词结构和Hook函数施加保持任务不变的变换。训练分为三个阶段:HSA-SFT阶段从强模型在多样化环境中的轨迹中学习推理和工具使用;通用在线蒸馏(General On-Policy Distillation)阶段恢复SFT过程中丢失的泛化能力;HSA-RL阶段通过增强环境中的强化学习提升模型对变化Harness的鲁棒性。在四个评测集上,HAT在直播问答(Live-Stream QA)上达到94.8分(基线模型:80.3分;最强通用大语言模型:93.0分),在Harness变体问答(Harness-Variant QA)上达到94.6分(基线模型:75.4分)。与固定Harness的SFT相比——后者使IFEval相较基线模型下降7.7个百分点——HAT避免了这一退化并达到83.5分。在单块NVIDIA H20 GPU上,优化后的系统实现了3.4秒的P50延迟和8.1秒的P95延迟。该系统已部署于淘宝直播的数字人服务中,并在GMV和商品详情页浏览量方面取得了正向的线上A/B测试结果。
现代视频游戏融合了第一人称感知、快速视觉变化、持久世界状态和异构原生控制。现有游戏智能体直接将视觉和任务上下文映射到动作,但缺乏显式世界动态建模;而交互式游戏世界模型能从给定动作预测视觉未来状态,却不能作为任务策略。世界-动作模型(WAMs)统一了这两个目标,但在视频游戏的动态性和开放式交互下仍鲜有探索。我们提出了GameWAM,据我们所知这是首个用于原生闭环游戏和GUI控制的世界-动作模型。GameWAM通过并行视觉与动作生成过程,结合块因果条件化和流匹配,联合生成未来视觉观测和可执行的键盘-鼠标轨迹。为支持联合世界-动作学习,我们构建了同步的游戏与GUI轨迹。为处理异构原生控制,GameWAM在每个动作步预测游戏/GUI模式,并使用模式特定的预测分布和连续动作归一化生成动作。针对长时程交互,块循环控制在已提交的预测范围之外进行预测,仅执行短动作前缀,并根据新观测重新规划,同时周期内的细粒度上下文和跨周期的层次化历史保持了时间连续性。实验表明,与对比智能体相比,GameWAM以更少的执行原生动作实现了具有竞争力的任务成功率。我们进一步发现了低频动作源印记(LASI)现象,即在固定条件化下,采样动作源的低频分量会系统性引导粗略生成的相机运动,揭示了生成式控制中的一种源敏感性失效模式。项目页面见https://yunncheng.github.io/GameWAM/。
长时程智能体运行会产生经验,这些经验既能改进当前运行,也能改善未来的工作。大多数自我改进方法只在执行结束后才处理这些经验,因此它们无法重定向正在进行的运行,也无法立即应用并验证从中获得的经验教训。我们认为,自我改进应当改为实时进行,既利用不断涌现的经验来重定向当前运行,又利用其更新持久化的框架。现有的智能体架构并不能完全支持这一目标。单智能体自我纠正在同一上下文中将任务执行与轨迹评估结合,而子智能体委派虽然将执行分离,但通常无法重定向正在运行的子智能体。我们提出了 PILOT,一个用于实时自我改进的监督者-工作者框架,它通过两种耦合机制实现:(1)实时引导,使独立的监督者能够在执行过程中重定向或中止当前工作者;(2)实时自我进化,将执行过程中暴露的流程与失败模式提炼为可复用的技能和记忆。在两个冻结骨干模型和三个基准测试上,PILOT 在六种配置中的五种排名第一。在 Terminal-Bench 2.0 上,PILOT 的表现比对照框架高出最多 9.8 个百分点。在自我改进设置中,PILOT 在 GLM-5.1 上提升了 14.6 分,在 Kimi-K2.6 上提升了 12.4 分。平均输出 token 数分别下降了 42.9% 和 47.4%,而每百万输出 token 的成功评估次数分别上升了 110.3% 和 134.0%。
零样本跨任务泛化,即策略必须执行训练中从未见过的操作任务,仍然是机器人学习中的核心挑战。在大型语言模型中,只需在上下文中指定新任务即可执行,无需任何参数更新。这种上下文学习(ICL)形式将泛化转化为任务描述问题。为了实现跨任务泛化,我们将这一范式引入机器人操作,并提出操作任务的自然任务描述是人类视频:与语言不同,人类视频提供了关于预期任务演变的丰富视觉线索。我们提出了 Zero-WAM,一种因果视频-动作模型,通过遵循上下文中的人类视频引导来执行未见过的任务。为了解决任务丰富的配对人类-机器人数据稀缺的问题,我们提出了一种自动流程,将任务采样的机器人轨迹转换为语义匹配的人类视频,由此生成了 HumanGen 数据集,涵盖 8.6K 个任务下的 74.2K 个人类-机器人 ICL 对。在模型训练中,我们进一步引入了上下文未来分块预测(IFP)目标,该目标抑制从已见任务中学习到的捷径,并迫使策略从视频提示中提取任务信息。在 RoboTwin 2.0 仿真中的七个未见任务上,Zero-WAM 实现了 47.0% 的平均成功率,相比最强的视频-动作基线绝对提升了 29.5 个百分点。在真实世界评估中,它遵循人类视频引导,泛化到涉及多物体场景、长时域操作和精细插入的未见任务配置。
进化策略(ES)近来已成为大语言模型(LLM)推理后训练的一种内存高效范式。然而,ES的优化行为尚未得到充分研究,难以界定其相较于主流后训练范式(如组相对策略优化(GRPO))的优势范围。通过系统考察ES的动力学与机制,本文首先识别出ES相对于GRPO的性能优势,从理论和实证两个层面表明ES能够带来更广泛的推理覆盖,从而更好地发掘预训练LLM的推理能力。在理论上,我们证明ES种群中验证器投影的Jensen-Shannon散度有助于提升Pass@K性能。在实证上,与表现出熵坍缩的GRPO不同,ES在获得更高Pass@K的同时提升了Pass@1。我们进一步开发了一种顺序式GRPO-ES训练策略,将GRPO在Pass@1上的优势与ES在Pass@K上的增益相结合。其次,我们发现尽管整体模型参数漂移显著,ES的任务性能增益仅由幅度较大的更新所构成的稀疏子集贡献。这种功能稀疏性表明,较大的参数变动未必意味着广泛的功能改变,而保留集评估进一步显示,这也不必然导致灾难性遗忘。最后,我们研究了超参数设计对ES有效性的影响,证明在更大的LLM中ES需要更小的种群规模。这些发现将ES定位为一种独特的推理后训练范式,而非GRPO的一种效果较差但内存高效的替代方案。
智能体技能包将专业知识和工作流程封装为可复用资源,以扩展AI智能体的能力。近期研究从智能体经验中自动发现此类技能,使智能体能够通过交互逐步适应。然而,指导技能发展的洞见通常散落在优化历史中,限制了其在多次迭代中的系统性复用。我们引入了WikiSkill,一个将智能体技能与持久化知识库(wiki)协同演化的框架。在高层面上,WikiSkill将原始执行经验、累积知识和可执行技能相分离,同时持续将经验整合进知识库中,使后续的技能更新能够在此基础上构建。在多样化的基准测试和模型中,WikiSkill持续优于最先进的技能进化方法,并在大多数模型-基准测试组合中优于无技能基线。我们发现技能进化与模型扩展具有互补性:较大的模型通常从进化技能中获益更多,而具备技能的较小模型可以超越没有技能的大得多的模型。我们还发现进化技能在模型间和模型家族间具有有效的迁移性,且由其他模型进化的技能可以优于自我进化的技能。最后,我们的消融研究证实,知识库中的持久知识积累对于有效的技能进化至关重要。这些结果证明了系统地积累和提炼智能体经验对于开发可复用和可迁移技能的价值。
原生3D生成器现已能从单张图像恢复令人印象深刻的网格几何体。然而,密集网格在机加工物体本应锐利的边缘处仍显柔和,其不具备部件分解结构,也未暴露任何用户可编辑的参数。为解决这一问题,我们探索了“以代码表述三维形状”这一范式,利用并扩展大语言模型(LLM)在三维建模中的编码能力。我们提出了Procedura,一种新颖的三维建模智能体框架,它将物体编写为程序化装配体——一种参数化程序,其中的命名部件通过类型化、机器可检查的配合关系连接。根据文本提示,智能体将物体规划为装配图,并逐部件编写程序,每个部件的放置均基于配合坐标系求解而非猜测,且仅当编译、配合及连接性检查全部通过时才接纳该部件。随后,一个解耦的视觉评判器逐项诊断并修复装配体。此外,同一装配图还承载逐部件材质及经模拟器验证的关节运动。我们在P3D-Bench上依据其装配评判标准进行评估,并采用相同评判标准在自建硬表面基准MechBench-36上进行评测。在两项评测中,Procedura在评判质量上均优于最先进的原生3D生成器及所有此前基于代码的三维智能体,在所评估的方法中产生最锐利的边缘,并且是唯一输出可编辑、具有部件结构的程序的方法。
现代游戏开发高度依赖传统的图形渲染管线。高质量视觉内容需要建模、材质制作、动画、光照、特效及运行时优化,这使得美术资产生产成本高昂,并延长了游戏原型的开发周期。近年来,视频基础模型正开始改变电影与视频制作流程,但游戏不同于线性媒体,它不仅需要连续且逼真的画面,还需要稳定且可复现的游戏规则、物体状态及交互结果。我们提出了Magpie,一个面向交互式游戏的实时生成式世界渲染系统。Magpie将游戏逻辑执行与视觉生成相分离。设计师在游戏引擎中定义场景与规则。运行时,游戏引擎解析玩家操作并维护世界状态,而独立的渲染服务器则根据引擎生成的白盒帧来产生视觉输出。Magpie为将生成模型应用于实时游戏渲染提供了系统级的实现路径。它保留了游戏的可设计性与可复现性,并降低了早期游戏原型对完整美术资产的依赖。
大规模视觉语言模型(VLMs)已在广泛的多模态任务中展现出卓越的多功能性。然而,理解幽默仍具挑战性,因为幽默内容往往依赖于跨图像和文本模态的实体、事件、上下文及隐含关系之间的细微交互。这些交互可能涉及复杂的推理链,难以通过常规提示或线性思维链推理加以捕获。在这项工作中,我们提出 CaRGo-T(Causal Reasoning Graph-of-Thought,因果推理思维图),一种将多模态幽默背后的因果与上下文关系表示为轻量级图结构的推理框架。该图被序列化为由 VLM 生成的基于代码的表示,随后可由相同或不同的 VLM 解释,以在零样本或上下文学习设置中产生最终预测。我们在涵盖讽刺、反讽和模因等多种喜剧形式的四个数据集上,对 CaRGo-T 进行了幽默理解与幽默检测的评估。基于最先进的商业及开源 VLM 的实验表明,CaRGo-T 持续优于现有的基于推理的基线方法,在幽默理解上取得约 1%-20% 的提升,在幽默检测上取得约 1%-3% 的提升。进一步的互信息分析表明,CaRGo-T 生成的推理表示比基线推理方法生成的表示包含更多与目标输出相关的信息。代码可在 https://github.com/abhi1nandy2/CaRGo-T 获取。
可复用技能库使大语言模型(LLM)智能体能够在不同任务间复用程序性知识,但也将记忆访问转变为具有挑战性的检索问题。全库提示在保持覆盖度的同时带来高昂的上下文成本;向量检索虽能返回紧凑的邻域,却将技能视为相互独立的文本;基于图的检索仅在携带相关性的边可靠时才能恢复工作流上下文。我们提出CaSKG,一种反事实-因果技能图框架,在检索之前对程序性关系进行校准。CaSKG首先从语义、词汇、输入/输出及结构证据构建高召回有向候选图,并通过修复证据和可选的LLM评判器进一步细化候选得分。然后,它应用方向条件的文本反事实探针,对技能对进行删除、替换和重排操作,结合贝叶斯平滑聚合证据,并发布状态过滤加权图以支持任务条件扩展。该图离线构建,使用过程中无需改变下游智能体策略或任务接口。在ALFWorld ID-140和ScienceWorld U211上的六个LLM骨干模型中,CaSKG在所有十二种模型与基准的组合中均取得最高任务得分。与Graph-of-Skills(GoS)相比,它将六个模型的ScienceWorld宏平均得分从72.62提升至80.50,ALFWorld成功率从80.01\%提升至86.79\%,同时降低了两个基准上的平均环境步数。定性与消融分析进一步表明,校准后的边有助于检索保留前置条件、状态改变动作、验证流程及最终完成步骤。这些结果证明,边置信度校准是实现大规模紧凑且可执行技能检索的有效途径。代码可于https://github.com/ZhiyuanLi218/Caskg获取。
近期,推理时扩展(inference-time scaling)方面的进展显著提升了大语言模型(LLMs)的推理性能。然而,这些方法通常依赖于重复生成或外部验证。为解决这一局限,我们提出了CritICL,一种新颖的推理时框架,能够在保持高效率的同时增强推理能力。我们的关键洞察在于,同一模型家族内,LLM的失败模式在不同规模下表现出结构化模式。CritICL不将失败视为不良输出,而是将其作为指导信息来源加以利用。具体而言,我们利用从较弱模型中获取的失败模式,通过基于批判的上下文示例将其融入推理过程。我们提出了两种变体:CritICL-dynamic,能够自适应地预测特定输入的失败模式并检索批判;以及CritICL-static,利用全局失败模式画像提供稳定的指导。实验结果表明,CritICL持续优于标准上下文学习,并以显著更少的生成次数和更低的token开销达到与测试时扩展方法相当或更优的性能。代码可在以下网址获取:https://github.com/umwyf/CRITICL
接触丰富的操作需要适应在动作时间范围内可能发生显著变化的接触状态。然而,基于分块的视觉-语言-动作模型从执行前收集的观测中预测完整的动作块,导致触觉条件在执行过程中变得过时。现有的触觉反应方法通常依赖单独的高频控制器,这增加了架构和训练的复杂度。在本文中,我们提出了TacForcing,一种流式动作生成框架,能够有效地融合执行时的触觉反馈。TacForcing不采用单独的反应式控制器,而是用流式动作专家替代标准动作专家,根据执行过程中获取的不断演化的触觉观测来生成动作。TacForcing还引入了执行感知触觉注意力机制(EATA),将触觉条件限制在接近执行的动作上,从而减少触觉获取与动作执行之间的时间不匹配。在六个模拟UniVTAC任务和三个真实世界接触丰富操作任务中,TacForcing分别实现了65%和69%的平均成功率,在两种场景下均优于强基线方法。
尽管生成式AI显著推动了视频编辑的发展,但现有方法主要聚焦于单镜头或短视频片段。使用多指令编辑长视频仍然是一项严峻的挑战。朴素的切分策略(例如固定时长分割)往往导致实体碎片化、严重的编辑幻觉以及时间连续性的破坏。为弥合这一差距,我们提出了多指令多镜头长视频编辑(MMLVE)任务,该任务围绕三个核心目标构建:跨镜头编辑一致性(CSEC)、多指令解耦(MID)和时空结构零破坏(ZDSS)。为应对这三个独特挑战,我们引入了一种智能体编辑框架,利用大语言模型(LLMs)与视觉语言模型(VLMs)的协同作用实现镜头级视频解耦和精确指令解析。此外,为全面评估该任务,我们构建了MMLVE-Bench——一个聚焦于MMLVE的数据集,其特点是包含复杂的真实世界时空动态、高密度异构指令以及稀疏随机的实体分布。我们进一步利用三个聚焦于MMLVE的评估指标来衡量编辑结果的质量。大量实验表明,我们的MMLVE-Agent优于现有的闭源SOTA方法(如Seedance 2.0),成功消除了编辑幻觉,保持了跨镜头编辑一致性,并实现了无缝的时空过渡。
显式视觉中间表示可以帮助多模态大语言模型(MLLMs)外化空间证据和更新后的视觉状态,但其效用取决于图像编辑器能否忠实地实现所需的变换。我们提出了Aphanta,一个面向MLLM → 图像编辑器 → MLLM流程的自动化任务发现与闭环诊断框架。Aphanta评估三种条件——直接推理、使用编辑器生成的中间表示进行推理、以及使用理想化参考中间表示进行推理——以将潜在的视觉提升空间与当前编辑器的实际效用分离开来。在20个候选任务和多种编辑器–大语言模型组合中,我们发现效用强烈依赖于任务条件。增益集中在视觉线索注入、视觉定位和反事实状态实现上,而需要符号敏感构造或结构外推的中间表示则可靠性显著较低。在选定的正向任务子集上,我们整合的Qwen流程将平均任务得分从0.343提升至0.445(+10.2个百分点;相对提升29.7%),同时完整研究也保留了被过滤和未成功的任务以揭示边界。这些结果将图像编辑定位为一种专门的视觉工作空间,而非通用的推理机制,并将Aphanta确立为一种可复用的协议,用于衡量任务–表征对齐、编辑器实现能力以及下游流程效用。
评测工件规定了前向计算:任务、评分器和上报指标。它们并不必然授权附加于该指标之上的声明,因为重放该声明所需的历史证据和替代语义可能是未绑定的。我们通过冻结基底D、有据族F、声明查询q以及由此产生的识别集,将这一缺失的声明重放层形式化。随后,我们对固定提交版本下全部124个机制上合格的Inspect评测单元进行普查。每个单元均获得终态判定;其中110个在确定性推理之前即停止,因为所需的历史证据或语义依据不可用。在执行闭环之处,精确数值、胜者、完整排序和两两关系随声明解析及主族与审查族之分而分离。因此,该审计返回的是类型化停止、不稳定性证例和稳定子结构,而非强行赋予单一的评测者含义或单一的稳健/非稳健标签。
传统视频编辑主要关注场景级内容,而直播则更强调人物主体。然而,将现有视频编辑方法直接应用于以人为中心的直播仍具挑战性,因为它们可能引入面部表情不一致问题,且通常依赖多个离线推理步骤,难以适用于实时交互。我们提出了EditaLive,一个用于实时流式角色视频编辑的新型框架。具体而言,我们从预训练图像动画模型(Wan-Animate)出发,该模型天然地将外观与运动解耦,我们通过参考帧编辑和视频重建,利用收集的CharEdit-50K数据集将其重新改造为基于指令的以人为中心的视频编辑基础模型。此外,我们将模型从离线双向生成适配为因果流式生成,并设计了一种对齐的自rollout蒸馏策略,将模型压缩为两步采样器,其中固定的RoPE和对齐强制减少了训练与推理之间的差异,首帧保留的稀疏注意力过滤了冗余的历史信息,以缓解外观漂移。大量实验表明,EditaLive实现了最先进的编辑性能,能够忠实保留面部表情,并支持低延迟的实时流式推理。