每日精选AI研究论文及翻译
现代AI代理的能力不仅取决于其基础模型,还取决于其调控框架(harness)——该框架负责构建提示词、管理状态、调用工具并协调执行。随着模型、API、环境和需求的变化,调控框架需要不断修改。在实施变更之前,开发人员或编码代理必须识别所有实现目标行为的代码位置。这之所以困难,是因为生产级调控框架规模庞大、耦合紧密且行为分散,而修改请求描述的是系统应该做什么,代码库却按文件和模块组织。代码搜索、代码库索引和长上下文处理虽有助于审查,但仍需手动恢复这种“行为到代码”的映射。因此,行为定位(behavior localization)成为调控框架演化的核心瓶颈。我们提出了Harness手册(Harness Handbook),这是一种通过静态分析和LLM辅助结构化从调控框架代码库中自动合成的行为中心化表示,将每种行为与其对应代码源相链接。我们还引入了行为引导渐进式披露(Behavior-Guided Progressive Disclosure, BGPD),该技术引导代理从高层行为逐步进入相关实现细节,并对照当前代码源验证候选位置。在两个开源调控框架的多样化修改请求上,基于手册辅助的规划在使用更少规划令牌的同时,提升了行为定位和编辑规划质量,在分散代码点、低频执行路径及跨模块交互场景中改进最为显著。因此,复杂代理系统的演化不仅取决于生成编辑本身,更在于确定这些编辑应作用于何处。
我们推出Boogu-Image-0.1,一个开源的统一多模态理解与生成模型系列,包含Base、Turbo、Edit和Edit-Turbo四个变体。该系列在高质量文生图、快速推理、基于指令的图像编辑以及中英文双语文字渲染方面均展现出具有竞争力的性能。像Nano-Banana-Pro和GPT-Image-2这类闭源多模态系统,其强大性能源于系统级整合而非单一模型,但内部实现细节大多未公开。在本工作中,我们证明:即使在计算预算极为有限的条件下,通过针对性地改进模型理解能力、数据质量和训练流程,并配合基于代理的推理时扩展,也能显著提升生成与编辑性能。全面评估显示,Boogu-Image-0.1在各项标准基准上持续达到或超越其他开源模型,并取得接近领先闭源系统的结果。值得注意的是,这仅使用了2.0862亿张独特图像。基础模型的理论训练成本仅为约40万美元。我们分享了对更广泛研究社区有价值的实践讨论,并根据Apache 2.0协议开源模型权重、代码及配方,以推动统一多模态理解与生成的开源生态发展。代码地址:https://github.com/Boogu-Project/Boogu-Image。
无需人工标注数据的可验证奖励强化学习(常被称为零强化学习)已成为激发思维链推理的强大范式。然而,受限于计算资源,现有研究多局限于小规模模型,大规模模型的训练动态与涌现能力尚未得到充分探索。为切实推进这一前沿领域,我们致力于引导模型生成高质量的推理行为。然而,我们发现简单的规模化扩展往往面临可读性差、标记冗余以及缺乏自适应推理深度等问题。针对这些挑战,我们提出了一种稳定高效的训练流程,集成了算法与系统层面的优化手段,包括裁剪重要性采样、训练-推理比例校正以及混合精度控制。我们的实验揭示了三个关键发现,验证了规模化扩展的“苦涩教训”:(1)将模型扩展至1万亿参数可显著提升样本效率与性能上限;(2)训练过程依次经历初始发现阶段与锐化阶段;(3)模型自发涌现出高级认知行为,包括拟人化、结构化格式、自我验证、并行推理与情境焦虑,使得人工设计的启发式策略变得多余。在七个数学基准测试上,Ring-2.5-1T-Zero取得了具有竞争力的表现。此外,为超越最终答案正确性来评估思维链质量,我们提出了一个涵盖三个维度的结构化评估框架:可理解性、可复现性与效率。在该框架下,我们的模型在生成结构化且简洁的推理轨迹方面展现出明显优势。通过分享我们观察到的涌现现象,我们希望为社区提供关于规模化行为(尤其是在万亿参数规模下)的更深入洞察。
OpenClaw已成为复杂任务自动化领域的领先智能体框架,但其在跨平台GUI交互支持与完善的自我进化机制方面仍存在不足。这些缺陷限制了它对多样化设备生态系统的适应性,并阻碍了通过持续从执行经验中学习来提升性能。为解决这些问题,我们提出了面向个人助手的"深度认知、完美行动"范式,该范式认为积累的用户交互与任务运行经验可直接提升执行准确性与效率,统一了认知理解与操作执行。基于这一范式,我们提出了KnowAct-GUIClaw——一种新颖的"知识-路由-行动-反思"框架,旨在弥补OpenClaw在GUI操作上的缺陷,突破其跨平台与递归式自我改进的瓶颈。首先,主智能体利用积累的交互经验与任务相关知识进行长周期任务分解与分配(Know)。其次,一个可插拔的GUI子智能体配备经验可归因记忆系统(Know)与自我进化的技能库(Act),从而实现无缝跨平台迁移与快速路径集成。特别地,该框架持续存储用户画像与反馈,以提升任务分解与工具调用的准确性。在Android、iOS、HarmonyOS及Windows平台上的大量实验表明,KnowAct-GUIClaw在效率、准确性与跨平台适应性方面均表现优异。尤其值得关注的是,基于开源Kimi-2.6模型的GUIClaw在长周期MobileWorld基准上取得了最佳性能(64.1%),超越了所有智能体框架及闭源智能体模型(如Seed-2.0-Pro与GPT-5.5)。此外,本框架所支持的知识型记忆与执行技能可跨多种基座模型迁移,在Kimi-2.6上带来8.5%的性能提升。
我们推出了OvisOCR2,一个0.8B参数量的文档解析模型。OvisOCR2被设计为端到端解析器:给定文档页面图像,它能够按照自然阅读顺序生成涵盖文本、公式、表格和视觉区域的Markdown表示。我们构建了一个数据引擎,融合了经过筛选的真实文档标注和合成页面——这些页面的渲染图像与Markdown目标均源自同一HTML源。训练方案包括监督微调、在4B分支上采用多组件奖励设计的强化学习、在线策略蒸馏至0.8B模型,以及模型融合。在OmniDocBench v1.6上,OvisOCR2取得了96.58的整体最佳分数,将端到端模型置于此前由流水线方法主导的排行榜首位,凸显了端到端文档解析的潜力。在PureDocBench上,OvisOCR2同样以75.06的最高Avg3分数表现优异。除这两个公开基准外,我们还在内部基准上评估了OvisOCR2,该基准旨在覆盖更广泛的长尾与高挑战性场景。OvisOCR2在所比较的方法中取得了最佳整体性能,进一步证实了其泛化能力与鲁棒性。OvisOCR2可通过https://huggingface.co/ATH-MaaS/OvisOCR2获取。
图像护栏通常在固定的安全策略下进行训练和评估,这隐含地将安全性视为图像的固有属性。然而实际部署场景中的情况有所不同:同一张图像可能在一个产品中被允许、在另一个产品中被限制,而当策略边界发生变化时,还可能被新禁止。我们研究策略自适应的图像护栏,要求模型能够判断图像是否违反当前提供的策略,并泛化至未见过的策略定义。我们提出PolicyShiftBench——一个包含265张图像、2000个策略判别实例的综合性基准测试集,每张图像平均配有7.55个策略条件化提示,用于测试模型是否根据当前生效的策略进行响应,而非依赖图像层面的安全先验知识。随后我们提出PolicyShiftGuard——一种紧凑的策略条件化护栏,采用两阶段训练方案:结合随机化策略监督微调(RP-SFT)与边界对策略自适应(BP-Adapt)。BP-Adapt针对同一图像和风险类别,通过标准标签监督和成对比较损失函数训练匹配提示,该损失函数将阻止策略与通过策略区分开来。实验表明,现有视觉语言模型和专用护栏在策略迁移下仍显脆弱,而PolicyShiftGuard显著提升了策略敏感性能。7B模型在PolicyShiftBench上达到76.9平均F1分数和72.1平均策略敏感分数(PSS)的当前最优性能,在UnSafeBench和SafeEditBench上表现出良好迁移性,并通过简洁输出格式优化了延迟-性能平衡。消融实验证实,匹配的通过/阻止边界对是实现稳定策略适应的关键要素。
当前视觉生成模型虽能生成高质量内容,但在空间结构连贯感知方面存在不足。现有的生成式新视角合成方法通常引入显式几何先验,虽能保证空间一致性,却在大视角变换场景下固有限制了泛化能力。相反,近期交互式生成方法倾向于隐式场景建模,在牺牲精确相机控制与几何一致性的前提下提供了更高灵活性。本文提出MetaView——一种基于扩散模型的单目新视角合成框架,能够从单张图像实现大视角变换下的渲染。我们的核心洞察在于将隐式几何建模与最小且必要的显式3D线索相结合:一方面通过前馈式几何感知网络引入隐式几何先验以约束结构,避免强加限制性重建流水线;另一方面利用度量深度将生成过程锚定于度量尺度。这种设计使MetaView同时实现几何一致性与精确可控性。大量实验表明,在极具挑战性的单目大视角变换场景中,MetaView显著优于现有方法,并展现出卓越的泛化能力。我们的代码已开源:https://github.com/KlingAIResearch/MetaView。
世界动作模型(WAMs)通过联合建模动作与未来视觉观测,利用未来场景演化作为物理驱动动作生成的密集监督信号,从而提升机器人策略学习效果。然而,现有WAMs的常见设计是在推理时显式生成未来视频,这不仅产生大量计算开销,还阻碍了实时闭环部署。GigaWorld-Policy通过以动作为核心的框架解决了这一问题:训练阶段利用未来视觉动态,而推理阶段仅进行动作解码。在此基础上,我们提出GigaWorld-Policy-0.5——一种面向更高效机器人控制的增强型动作中心WAM。在预训练阶段,GigaWorld-Policy-0.5采用混合的"动作条件世界建模"(AC-WM)与WAM训练策略,这强化了视觉动态与机器人动作之间的耦合,并提升了动作表示在下游策略学习中的迁移能力。为实现高效推理,GigaWorld-Policy-0.5引入混合Transformer架构,将视觉动态建模与动作生成分离为专门专家模块,从而在仅动作推理时减少活跃计算量,并在本地RTX 4090平台上实现85毫秒的推理延迟。此外,我们采用基于智能体的AutoResearch管线系统性地搜索训练配置,从而更高效地识别最优实验设置,同时减少超参数调优所需的时间与人工干预。实验与消融研究表明,GigaWorld-Policy-0.5既保留了未来视觉动态带来的训练优势,又提升了机器人控制的推理效率。
已知视觉Transformer(ViTs)会出现高范数的异常块令牌,导致特征图质量下降,而注册令牌能有效缓解这一问题。随着扩散模型越来越多采用Transformer架构并转向像素空间训练,其形态日益接近ViT,这引出一个问题:注册令牌对扩散Transformer(DiTs)是否同样有用。本研究发现,DiTs与ViTs有一个关键差异:DiTs虽不产生异常块令牌,但仍能从注册令牌中受益。有趣的是,注册令牌在像素空间DiTs中的效果优于潜在空间DiTs。通过对中间表征的分析,发现注册令牌在高噪声水平下能生成更干净的特征图,这可能有助于提升像素空间生成的效果。进一步观察到,近期像素空间DiT架构已隐式纳入类似注册令牌的机制,这或许部分解释了其出色的实证表现。基于这些发现,我们提出"注册引导"技术,通过放大负责改善视觉结构与连贯性的注册令牌贡献,来提升生成质量。
自我改进自主代理正从研究原型走向部署系统。其核心目标是通过经验实现可控演化或适应,且所需人工干预极少甚至为零。本综述将现代自我改进代理视为自适应系统,这类系统能将经验转化为持续累积的能力提升。我们提出一个系统级框架,将现代代理表征为一种将基础模型与操作支架(包含提示、记忆、工具及控制逻辑)相耦合的配置。在此框架下,自我改进被形式化为一种自诱导更新算子,该算子能够获取并提交对模型参数或支架组件的更新。我们按更新目标及驱动变化的信号对既有研究进行归类,随后回顾应用场景并讨论评估方法,最后以开放问题与未来方向作结。为便于追踪,相关技术更新可查阅 https://github.com/selfimproving-agent/awesome-Self-Improving-Agents。
尽管近期3D生成技术的进步实现了令人印象深刻的视觉合成效果,但现有方法往往依赖2D扩散监督,缺乏显式的几何一致性机制,导致产生重复结构、几何错位等空间幻觉。在4D生成中,这些问题更为严峻——需同时维持多视角与时序演变的一致性的挑战,会引发抖动、身份闪烁和结构漂移等现象。我们提出Hallo4D,一个统一且与模型无关的框架,用于缓解3D和4D内容生成中的时空幻觉。Hallo4D引入"生成-检测-修正"范式,利用大型多模态语言模型(LMM)从多视角和多帧渲染结果中识别并总结空间与时间不一致性。这些洞察引导基于共识的图像空间一致性优化,通过多模型投票机制,由LMM驱动的选择器评估候选修正方案,无需重新训练或修改模型架构。为进一步提升时间一致性与优化效率,Hallo4D融合了运动感知关键帧采样、LMM引导初始化与外观对齐技术。我们还引入曝光感知优化与可见性剪枝策略,增强对挑战性视角的鲁棒性。大量实验表明,Hallo4D在多种3D和4D生成场景中持续超越强基线方法,为一致性感知的内容生成提供了可扩展且泛化能力强的解决方案。
结构化剪枝是一种硬件友好的大语言模型压缩方法,但现有验证多集中于多项选择识别任务,而实际部署所需的自由文本生成中,相同压缩检查点可能完全失效。两种观察揭示了这一差距:首先,贪心式pass@1在压缩后几乎消失,但重复采样下pass@k显著恢复——有用生成被降级而非消除。其次,可恢复区域的主要失效模式是后缀重复。因此,恢复训练应基于压缩模型自身的在策略状态,辅以密集的令牌级监督——在策略蒸馏(OPD)通过复用压缩前模型作为冻结教师来实现这一点。然而,长序列在策略展开会将早期恢复预算浪费在低信息量的重复后缀上,延缓损失下降。为缓解此浪费,我们提出\shortopd——一种从短到长的OPD调度策略:检测经教师确认的重复后缀,将存活前缀作为每次展开的有效长度,并将未来展开预算分配给当前策略可实际使用的有效长度。在数学、代码和开放式生成任务中,\shortopd将压缩模型得分提升至未恢复值的约9倍,为标准恢复方案(无知识蒸馏的SFT、KD、SeqKD)的1.6至4.4倍;且以更少的训练时间(8.5小时 vs 35.9小时)和减少71%的展开令牌数,在固定8192令牌展开长度下实现两点内的性能匹配。我们希望这一方案能推动结构化剪枝走出仅依赖困惑度和多项选择基准的边际增益,向部署级生成质量迈进一步。
随着大型语言模型(LLMs)向自主智能体演进,构建统一的评估基础设施变得至关重要。然而,当前的评估流程高度碎片化且紧密耦合,既阻碍了可重复性,又造成了工程冗余。为解决这一问题,我们提出了AgentCompass——一款开源、轻量级且可扩展的LLM智能体评估基础设施。AgentCompass将评估流程分解为三个独立组件,即基准测试(Benchmark)、测试框架(Harness)和环境(Environment),从而在无需重新实现复杂执行逻辑的前提下实现灵活配置。此外,它采用具备容错机制的异步运行时系统,并配备全面的轨迹分析工具,可透明地诊断诸如奖励漏洞(reward-hacking)等细微故障模式。AgentCompass原生支持覆盖五大能力维度的20余项基准测试,为社区提供了可扩展且可重复的基础设施,以推动智能体研究的发展。
智能助手何时应主动发言?连续的第一人称视频提供了丰富且不断演化的上下文,使得一种新型的辅助方式成为可能:这种辅助是主动的,而不仅仅是反应式的。然而,现有方法要么被动等待用户提问,要么将每个检测到的事件都视为需要响应,而不考虑用户的历史记录、当前活动,或者这种辅助是否真的受欢迎。我们将主动辅助重新定义为一个依赖于上下文的决策问题:智能体不仅要感知正在发生的事情,还要基于累积的时间上下文进行推理,以决定何时以及是否要介入。为此,我们提出了Vinci2,一个主动的第一人称辅助系统,它将设备端助手Vinci从被动响应升级为主动交互。在评估方面,我们推出了EgoServe,这是首个用于连续第一人称视频中主动辅助的大规模基准。EgoServe包含3000多个服务实例,按照4个时间记忆范围(从即时安全警报到长期习惯辅导)组织,涵盖10个服务类别。在建模方面,我们提出了EgoMemo,这是一种无需训练、基于记忆增强的智能体,它维护三种互补的记忆表示:多尺度时间摘要、语义知识图谱和视觉嵌入档案。在每个时间步,EgoMemo通过检索增强推理来判断是否需要提供辅助,并在需要时生成基于上下文的响应。实验表明,EgoMemo在EgoServe上建立了强大的基线,同时在现有的第一人称基准上具有竞争力。我们的基准和代码公开在 https://sitonggong.github.io/EgoServe-page/{Vinci2}。
面向基于大语言模型的代理系统的故障归因(即识别故障轨迹中导致任务失败的步骤)对于调试和改进此类系统至关重要。现有方法要么依赖基于提示的流水线(计算成本高昂),要么需要对带有步骤级错误标注的故障轨迹进行后训练(标注成本高且难以扩展)。本文认为,实用的故障归因模型应具备轻量级特性,且无需基于故障数据的步骤级监督即可训练。为此,我们研究无监督故障归因问题:仅使用成功轨迹进行训练,在推理阶段识别故障轨迹中的错误步骤。我们提出OAT方法,将问题转化为基于神经控制微分方程的单类学习,在潜在空间中建模成功轨迹的动态模式。推理时,故障轨迹中每个步骤根据其与成功轨迹动态模式的偏离程度获得异常分数,并据此构建错误步骤集合。实验表明,仅需100条成功轨迹进行训练,OAT比基于提示的基线方法快200-5000倍,同时在域内数据集和域外数据集上分别以+20%和+7%的F1分数稳定超越基线方法,证明OAT是诊断代理系统故障的一种有前景且高效的方向。
离散去噪扩散模型(DDM)近期已成为离散数据自回归(AR)建模的一种引人注目的替代方案,具备并行生成和迭代全局细化能力。与状态空间固定的连续扩散不同,DDM 的形态根本上取决于离散状态空间的构建方式:包括分词方案、词汇拓扑以及领域特定的结构字母。本文提出了一个统一的概念框架,通过底层离散状态空间的构建来审视离散扩散模型。在该框架下,现有的公式(包括转移矩阵、掩码/吸收态以及分数/比率方法)均表现为共同设计空间中的不同实例。该框架进一步揭示了训练目标、推理算法、缩放行为、系统优化及评估协议中常见的设计权衡,为未来研究指出了若干有前景的方向。
大语言模型(LLM)代理已从生成回复演进到通过调用工具、观察结果并迭代决定下一步行动来执行多步骤任务。大多数代理系统运行在支持工具使用和任务自动化的桌面端或服务器上。移动设备因其广泛可用性且包含用户数据、传感器及日常应用程序,同样是重要的代理环境。现有移动代理主要通过点击、滑动和输入等图形用户界面(GUI)操作控制智能手机,这些操作通常形成冗长且依赖界面的序列,无法直接访问设备功能,且执行边界难以定义。我们提出PalmClaw,一款原生运行于手机的开源代理框架,可在设备端直接管理会话、记忆、技能、工具和代理循环。PalmClaw将设备功能暴露为具有显式参数、结构化结果和明确定义执行边界的设备工具。该设计使代理能直接调用移动设备功能,同时保持每个动作的显式性和可控性。实验结果显示,与最强基线方法相比,任务成功率相对提升11.5%,完成时间减少94.9%,且设置负担更低,追踪记录清晰展示了执行边界的应用方式。代码已开源:https://github.com/ModalityDance/PalmClaw
面向长周期智能体的优化日益依赖于基于反思的机制,其中大型语言模型(LLM)作为优化器来诊断智能体失败并改进智能体策略。然而,真实的执行轨迹难以直接用于优化:大规模轨迹集合往往冗余且异质,导致优化效率低下且容易过拟合于低价值失败案例;同时,每条单独的轨迹也包含大量无关步骤,而诸如截断或滑动窗口等朴素上下文约简方法可能丢弃因果关键证据,产生具有误导性的优化信号。为解决这一困境,我们提出STRACE(结构化轨迹分析与因果提取)框架,该框架构建高信噪比的优化上下文,以实现更精确有效的优化。在批次层面,STRACE挖掘失败模式以过滤冗余轨迹,保留具有代表性的失败案例;在每条选定轨迹内,它通过文本依赖图进行因果定位,剔除非因果步骤,并识别真正的根因模块以进行优化。实验结果表明,STRACE显著优于标准上下文过滤基线方法。值得注意的是,在一项具有挑战性的形式化验证任务(VeruSAGE-Bench)中,它成功优化了人类专家设计的智能体,将成功率提升了1.4倍(从42.5%提升至58.5%)。代码已开源在 https://github.com/moomight/STRACE 。
长度惩罚强化学习可以缩短链式推理过程,同时隐藏影响模型答案的驱动因素。在我们的实验中,即使模型在链式推理中提及提示的频率显著降低,施加长度惩罚的训练仍无法阻止误导性提示左右模型输出。若采用词元准确率评估,由于这些运行过程使用的推理词元更少且准确率损失很小,会被判定为成功;但这种方法无法判断剩余推理痕迹是否仍能揭示答案的驱动因素。我们训练了Qwen3-4B和Qwen3-14B的不同版本,使其目标链长度各异,随后在保留的MMLU-Pro-R数据集及四个迁移基准上通过引入偏颇提示进行干预评估。压缩处理显著削减了推理词元数量,基本保持了多项选择准确率,而提示影响程度与基线水平接近。在最严苛的压缩目标下,Qwen3-14B的下限忠实度降至基线的63.1%,Qwen3-4B降至69.4%;监控器对提示使用情况的原始捕捉率从69%降至49%,从60%降至48%。为分离长度与内容的影响,我们从未压缩的基线链中随机删除句子,直至剩余文本长度与压缩链匹配。即便经过长度匹配,对于两种规模的Qwen3版本及全部五个评估分布,压缩链披露提示的频率仍比随机缩短的基线链低7-35个百分点。因此,压缩的作用不仅限于缩短推理过程,更会优先移除监控器识别答案影响来源所需的线索。这些发现共同揭示了压缩-可监控性前沿:更经济的推理方式在保留答案的同时,使答案背后的影响因素更难以被检测。
AI渗透测试代理作为进攻性安全系统正日益可信,但现有基准测试在指导哪些代理能在真实目标上表现最佳方面仍存在局限。当前评估协议在简化或狭窄场景中,针对预设目标(如夺旗赛、远程代码执行、漏洞复现或轨迹相似性)进行评估与优化。这些工具虽有助于衡量受限能力,但未能充分捕捉真实渗透测试所需的复杂性、开放式探索和战略决策。本文提出一种实用评估协议,将评估重点从任务完成转向已验证的漏洞发现,从而允许在覆盖多攻击面和漏洞类型的足够复杂目标中进行评估。该协议结合结构化真实数据与基于大语言模型的语义匹配来识别漏洞,采用二分图解析在模糊性下对发现结果进行评分,持续维护真实数据,对随机代理进行重复与累积评估,引入效率指标,并通过精简套件选择实现可持续实验。该协议通过提供对AI渗透测试代理更真实、更具操作信息性的比较,扩展了现有技术水平。为确保可重复性,我们还发布了专家标注的真实数据及所提评估协议的代码:https://github.com/ethiack/ethibench。
自主无人机系统日益依赖多模态大语言模型(MLLMs)在复杂真实环境中运行。这类具身场景不仅需要理解周围空间,还需维持对代理自身的连贯表征。然而,现有面向无人机的方法与基准仍以环境为中心,主要聚焦空间理解任务,而代理的自我意识则长期隐而未现。为填补这一空白,我们提出SIS-Bench——一个基于统一“空间中的自我”框架、评估无人机场景中具身空间智能的基准。SIS-Bench沿空间与自我两个互补维度,及感知、记忆与推理三层认知层级组织评估体系。它包含从1,646段真实无人机视频中通过任务条件构建管道与专家验证生成的4,856个问答对,覆盖13项任务。广泛评估表明,当前MLLM在建模动态与以代理为中心的过程方面存在根本性局限。具体而言,我们观察到空间认知与自我意识之间明显失衡,以及认知层级间性能逐步退化。基于这些发现,我们进一步探索了一种融合光流与视觉特征的自我相关动态运动感知表征。实验结果显示,对代理运动进行建模能持续提升感知与记忆性能——不仅在空间认知方面,更在自我意识层面——并泛化至下游无人机决策任务。我们的研究结果凸显了自我意识对推进具身空间智能的重要性,并为运动感知的“空间中的自我”建模提供了新基准与实证证据。
交互式模拟器已成为训练具身智能体和生成合成视觉数据的强大工具,但现有照片级真实感模拟器存在通用性、可编程性和渲染速度方面的局限。为解决这些局限,我们提出SPEAR:一款面向逼真具身人工智能研究的模拟器。SPEAR的核心是一个Python库,可通过模块化插件架构连接并程序化控制任意虚幻引擎(UE)应用。SPEAR向Python暴露了超过1.4万个独特的UE函数,使其可编程功能数量较现有基于UE的模拟器提升了一个数量级。此外,单个SPEAR实例能以每秒73帧的速度将1920×1080分辨率的逼真美感图像直接渲染到用户的NumPy数组中——速度比现有UE插件快一个数量级——同时还能提供现有基于UE的模拟器无法获取的真值图像模态(例如非漫反射内在图像分解、材质ID及基于物理的着色参数)。最后,SPEAR引入了一种表达力强的高级编程模型,使用户能够指定包含任意数据依赖关系的复杂UE工作图,并在单个UE帧内确定性执行这些图。我们通过一系列多样化的示例应用展示了SPEAR的实用性:在多个野外UE项目中控制具有不同动作空间(如人物、汽车和机器人)的多个具身智能体;渲染逼真的城市规模环境;操控UE的流程化内容生成系统;渲染高保真人脸的多视角同步图像;与MuJoCo物理模拟器协调实现交互式协同仿真;以及通过AI编码助手对场景进行自然语言编辑。
我们提出了AffectFlow-DINO,一个面向第11届ABAW挑战赛的多任务学习系统。该系统在标准确定性架构基础上扩展了条件整流流头部,用以建模自然场景面部行为中固有的模糊性。模型不直接输出单一情感估计值,而是学习条件生成分布,通过蒙特卡洛采样实现具有不确定性感知的一对多预测。该系统能够从静态人脸图像中同时估计连续效价-唤醒度、分类八种面部表情,并检测十二个动作单元。基于冻结的DINOv3 ViT-S/16骨干网络,大量消融研究表明,整流流解码能持续提升确定性预测的性能,尤其在效价-唤醒度估计方面(CCC-V提升+0.058)。我们进一步证明,后验阈值校准无需重新训练即可有效恢复严重不平衡稀有类别的性能(例如,恐惧类别从3.8%提升至33.1%)。结合骨干网络微调与流重调,最终模型取得了P_MTL=1.177的分数,大幅超越了官方挑战基线P_MTL=0.45。
具有丰富静态语义的语言(如Rust)能为AI生成的代码提供更强的保证,但其严格性使得代码生成更加困难。现成的编译器可以在生成后提供有用的反馈,但无法指导中间生成步骤(例如自回归大语言模型解码过程中的步骤)。约束解码通过拒绝采样过程中的无效token提前介入,但需要白盒模型访问权限,且对语义约束的重新实现成本高昂。我们提出生成式编译,这是首个在生成过程中获取编译器对不完整程序反馈的方法。其核心技术装置是"sealor":一种轻量级、主要基于语法指导的变换,能将不完整程序转换为标准编译器可诊断的完整程序。该设计确保可能被补全的不完整程序永远不会被拒绝,同时保留足够的代码上下文以尽早捕获真正的死结。我们在类Rust核心演算上构建了这样一个"sealor",并证明其满足这些性质,所有证明均在Lean中机械化实现。我们将该方法扩展至首个针对真实Rust的不完整程序检查器。我们使用前沿黑盒模型与开源模型,在具有挑战性的仓库级Rust编码任务上评估了该方法。结果表明,相较于标准的事后生成反馈,生成式编译能减少非编译输出并提升功能正确性。其实现方式是:在生成过程中尽早检测接近错误源的广泛错误类型,从而减少错误级联效应并提供聚焦的诊断信息。更广泛地说,生成式编译是推动编译器成为AI辅助编程中活跃参与者的重要一步——使其在生成阶段发挥作用,而非仅作为独立的生成后检查环节。