每日精选AI研究论文及翻译
AI智能体运行于持续性环境中,早期状态变化可能对远期决策产生影响。与传统语言模型交互不同,智能体行为通过共享状态进行中介,该状态在长周期工作流中被反复修改和复用。当前的安全基准测试往往无法捕捉这些累积性风险,因为它们聚焦于短时、静态的任务。为弥补这些局限,我们提出OpenART——一个通过环境演化实现可扩展智能体红队测试的开放式竞技场。OpenART提供覆盖50个领域、超过10,000个经过验证的有状态场景,这些场景源自500,000余个工具和技能的池子。这些任务的中位数工具调用次数为97次,并支持在75种不同的智能体模型配置上进行统一评估。为系统性地探索这些不断演化的攻击面,我们提出演化马尔可夫超图攻击(EMHA)。EMHA是一种黑盒策略,通过协调授权状态转换来执行反馈驱动的环境演化,无需参数更新。在整个评估过程中,任务目标保持不变,仅环境状态发生变化。在所有配置中,EMHA实现了85.0%的汇总攻击成功率(ASR)。相较于仅依赖指令的演化,其优势从简单环境中的约2%扩展到最复杂环境中的超过17%,这表明随着任务复杂度的增长,环境演化日益有效地暴露安全漏洞。此外,我们的分析表明,智能体的具体运行时实现在安全差异中占显著比重,其影响超越了底层模型本身的能力差异。这些结果确立了OpenART作为在复杂演化环境中研究智能体安全的可扩展基础平台。
将研究想法转化为完整论文所需的不只是文本生成:系统必须检索文献、设计和执行实验、根据证据修改论断、生成达到发表标准的图表,并在整个长生成过程中保持一致性。我们提出Spark-to-Paper——一个端到端研究论文生成系统,在现有编码助手中以十三个可组合技能实现,无需单独的智能体平台或编排服务。Spark-to-Paper将基于模型的判断与可直接执行和校验的确定性操作相分离,并进一步将实验规划与报告环节分离,使得所需证据在观察结果之前即被明确规定,手稿论断则根据实测结果进行修订。为提高长研究轨迹的可靠性,系统将确定性完整性检查与自我批评相结合,并约束了一种我们称之为“自我反驳循环”的失败模式——在该模式中,重复实验持续否定原始研究目标。Spark-to-Paper还通过程序化绘图为实验结果生成可编辑矢量图,并通过基于代码的重建生成方法示意图。在八个受控研究主题上,Spark-to-Paper实现了99.5%的引用有效性和96.4%的图形可编辑性。受控消融研究将伪造检出率从单遍草稿的14%提升至完整完整性与评审栈下的92%,对抗性评审达到74%精确率。完整系统消耗1190万词元,每篇手稿成本8.1美元,平均耗时3.2小时。这些结果表明,端到端研究论文生成可以以轻量级、可组合的工作流形式在现有编码助手中实现,同时保持实验证据在论断被接受、修订或放弃过程中的核心地位。
最近关于蒸馏的研究,常常通过教师强制、在线策略蒸馏及相关训练时方法,将大模型的能力迁移到较小模型中,通常是通过更新后者的参数来实现的。在本文中,我们提出一个问题:这种迁移是否可以在测试时实现?我们研究了强到弱脚手架(strong-to-weak scaffolding):一个更强的构建者模型能否构建推理时的辅助框架,帮助更弱的目标模型更可靠地解决问题,而无需任何参数更新?我们使用四个具有代表性的心理理论(Theory-of-Mind)基准,每个构建者模型使用5%的数据作为验证集,通过多轮迭代优化其辅助框架,最终确定的框架再在完整测试集上进行评估。实验表明,这种测试时能力迁移形式非常有效,将目标模型的平均性能从0.49提高到0.91,近乎翻倍。我们的分析显示,性能提升主要源于将不稳定的模型推理卸载到确定性代码、针对特定基准的路由策略以及严格的答案格式约束上,而非通过鼓励目标模型进行更深入的推理或更广泛的采样。我们进一步发现,构建者模型的推理投入会单调地提升辅助框架的质量;相对于构建者模型自身的能力,平台效应较为有限;而更弱的目标模型获得的收益最大。这些结果表明,推理时辅助框架的设计是对传统训练时蒸馏的重要补充,使强模型能够在无需重新训练的情况下,将认知结构迁移给更弱的模型。
AI模型在众多领域取得了显著成功,然而其能力背后的机制及其可能带来的风险仍鲜为人知。随着AI开发速度日益加快且日趋自动化,机制性探索在很大程度上仍依赖人工操作,这导致模型的能力与我们理解和控制它们的能力之间的差距不断扩大。为弥合这一差距,我们引入了Mechanist——一个智能体系统,将AI作为科学仪器,用于自主发现AI智能背后的机制。为支持自主机制发现,我们构建了一个以可解释性为核心的知识图谱,涵盖约13,000篇论文,并将其与一个涵盖26个领域、包含4,300万篇论文的多学科数据库相整合。我们还精选了一个包含32种基础方法的工具库,用于机制分析、因果干预和验证。与Claude Code及现有的AI科学家系统相比,Mechanist能够产生更有价值的机制假设,并更可靠地执行实验。Mechanist还展示了从发现模型行为到解释和控制AI模型的递进过程。具体而言,Mechanist首先揭示了科学实验室中一个反直觉的安全风险,表明不安全特质可以通过表面安全的训练数据在不同模态之间转移。随后,Mechanist发展了一套信念的机制理论,揭示了模型如何表征世界知识、形成信念、推断他人信念,以及这些机制如何在预训练过程中涌现。最后,Mechanist将这些机制性洞见转化为实际干预措施,在多种场景下提升了模型性能,并引导科学基础模型生成具有指定属性的DNA序列。
大语言模型(LLMs)越来越多地充当智能体,其程序性知识以可复用的技能包形式存储,并在推理时加载。随着技能库的不断增长,一个核心挑战是在有限的上下文预算下暴露最小且充分的可执行上下文。现有系统难以复用整体技能级别以下的例程、在压缩期间保持程序性契约、保持压缩例程的可执行性和可扩展性,以及随技能演进更新压缩后的技能库。这些挑战揭示了单元错配问题:技能以包的形式被检索、以文本形式被压缩,并仅在检索之后才转换为执行图,而可靠的复用需要承载契约的程序性单元。为此,我们提出 SkillZip,一种具有执行感知能力的程序性抽象框架,在节级图上执行保持契约的压缩。SkillZip 将重复出现的契约有效模式重写为可逆的移植宏,同时保持边界签名、依赖闭包、验证器可达性和源码级展开。在推理时,它仅激活紧凑且依赖封闭的上下文,并在需要时展开宏。ReZip 进一步集成新技能,并利用执行证据修正有风险的宏。在技术类和具身智能体基准上的综合实验¹表明,SkillZip 始终优于最强基线,最高领先 12.2 个点,同时实现 3.46 倍的压缩率、99.2% 的依赖保持率和 98.7% 的验证器可达率。扩展性分析进一步证实,SkillZip 在 200 至 10 万个技能规模的技能库范围内均能实现稳健的检索。
大型语言模型(LLMs)的快速发展正在通过实现开放式、流畅的交互式叙事,彻底改变游戏人工智能领域。然而,现有研究在很大程度上忽视了在不受约束的用户干预下,维持长期逻辑一致性与叙事完整性的关键挑战。为解决这一问题,我们将该挑战形式化为叙事承诺保持(Narrative Commitment Preservation, NCP),并以交互式叙事作为测试平台。我们提出了NCP-Bench,一个包含100个源自电影梗概的叙事环境的基准测试集。每个环境都包含一个结构化的叙事规范(轨迹、承诺和初始事实),我们可以在玩家智能体与叙述者智能体的整个交互过程中对其进行自动检查。跨最先进LLMs的实验揭示了一个显著的长期一致性差距:高语言质量并不能保证承诺的保持;即使是强大的模型,在对抗性干预下也频繁生成逻辑冲突的内容,其中表现最佳的模型(GPT-5.2)在20轮后的存活率仅为42%,各模型的事实冲突率介于40%至68%之间,且仅有个别运行能在100轮限制内满足所有成就承诺。
预可视化是电影、游戏、建筑和城市设计中连接创意与制作之间的中间层,使创作者能够迭代式地打磨场景、动作、相机以及时空动态。然而,现有生成方法仅依赖简单提示词,通过一次性图像或视频合成来联合控制所有这些因素,导致可控性弱且对迭代式编辑的支持有限。从根本上说,一个世界由多个具有几何、外观及其他属性的元素以及相机共同组成,不同帧通过对这一共享状态进行局部修改或重新组合而生成,而该状态在其余情况下基本被复用。因此,我们认为所缺失的组件是一个显式的、持久的工作状态。为解决这一问题,我们提出StateFlow,一种以状态为中心的生成式预可视化框架。StateFlow并非一次性生成视频,而是利用一个可编辑的3D世界来组织场景结构、演化过程及相机配置,同时在需要更高保真度时借助现成的视频模型来增强视觉质量。这个世界以场景元素与相机配置的持久化结构化3D状态形式得以维护,作为预可视化的核心工作表示。基于这一洞察,StateFlow包含三个阶段来构建、演化并访问世界状态。状态构建通过先验引导的、冲突感知的双视图初始化,将生成的2D内容提升为连贯的3D世界;状态演化则在保留世界记忆的同时,将用户意图转化为结构化的状态转换,避免每次编辑都触发全场景重新生成;状态访问利用渲染反馈反思将相机规划精炼为视觉上可行的轨迹,避免仅依赖视觉语言模型的语义判断。实验表明,StateFlow能够为视频创作和类游戏原型设计生成高质量的3D世界。
近期视觉基础模型(VFMs)在单次前向传播中预测深度、相机位姿和点图,无需逐场景优化,实现了强大的泛化能力。然而,强制显式的多视图几何一致性(例如通过光束法平差)计算成本高昂,因此在VFM预训练期间未施加,从而可能出现这种不一致性。为了解决此问题,从模型输出(如点图、特征)导出的隐式自一致性,尽管先前工作是在测试时强制执行,但带来的性能提升本质上有限,尤其是在预训练VFM高度不准确的场景中。与这种隐式信号相比,我们提出了自几何(Self-Geometry),一种即插即用的测试时自适应流水线,直接利用2D像素对应关系作为伪真值施加显式的多视图几何约束。我们提出的Self-Geometry包括:几何解耦优化(Geometric Disentanglement Optimization),结合多视图一致性和对极一致性损失,并通过梯度解耦防止梯度冲突;帧角度邻域(Frame Angular-Neighbor),一种基于SO(3)测地距离的视图采样器,用于轻量施加这些约束;以及轻量级TTA,通过LoRA自适应VFMs。我们的方法在六个VFM(VGGT、π³、DA3-Giant/Large/Base/Small)和四个基准(7Scenes、ETH3D、ScanNet++、HiRoom)上的位姿和几何估计均实现了一致的改进。
世界建模是一个尚未定型的领域:架构、训练目标与状态表示之间以复杂的方式相互作用,且没有任何单一方案能在各类环境中占据主导地位。这使得它成为检验AI编码智能体作为自主研究者的理想试验场——在这一设定中,改进方向并非预先指定,这与当前智能体基准中以按规格工程为主的任务形成鲜明对比。我们提出AutoWorldModel-Bench,一个闭环基准测试,在此基准中,前沿编码智能体在固定计算预算下自主改进所提供的世界模型起点代码。该基准涵盖八个游戏环境,并采用统一的结构化状态表示——从每个游戏中提取的真实实体状态,通过共享的张量格式进行消费——从而将动力学建模与感知相分离,使每次运行仅需数分钟即可完成迭代。在64次会话中,Codex-5.4和Claude Opus 4.6在63次中改进了起点模型;在91%的会话中,获胜的修改是非平凡的科研式改动——新的目标函数、表示方式、 rollout 过程或架构变更——而非超参数调整。我们的基准提供了一个在开放式研究中评估前沿编码智能体的场景,而非按规格工程问题。
具身智能体日益构建为基础模型的系统,其性能不仅取决于模型权重,还取决于模型周围的技能、上下文、动作接口和执行框架。虽然监督微调和强化学习可以使智能体适应新环境,但它们需要额外的数据、奖励和训练过程;与此同时,许多免训练的以代码为中心的方法依赖可编程的机器人API,而这些API在固定接口场景中可能不可用。我们提出SHAPER,一个用于免训练具身适应的自进化框架,通过冻结模型参数并利用目标环境交互来进化可复用技能和上下文代码执行框架,从而改进非参数化智能体系统。在SHAPER中,同一个冻结模型既可以作为规划器也可以作为优化器,在不更新参数的情况下优化其外部技能和上下文代码执行框架。我们在VLABench和ESI-Bench上评估SHAPER,覆盖具有不同低层动作接口的具身智能体,并与纯执行、监督微调以及无验证器选择和投票等测试时扩展基线进行比较。我们的结果表明,在模型训练昂贵、不可用或不理想时,技能与执行框架优化是实现自进化具身智能体的实用途径。
集成外部工具的大语言模型(LLM)智能体容易遭受环境状态中嵌入的间接提示注入攻击。然而,现有研究大多依赖手动实现或复用的环境、基于LLM的随机工具模拟以及预定义的注入位置,限制了跨更广泛领域的可扩展安全研究。为弥合这一差距,我们提出**ToolHazard**,一个可扩展的对抗环境合成框架,该框架减少了人工工程投入,并支持通过额外的种子领域和算力进行扩展。通过环境模拟器、攻击者智能体和用户模拟器,ToolHazard合成可执行的有状态环境,发现可行的注入点并生成环境特定的攻击载荷,同时构建基于状态的长程任务。基于ToolHazard,我们构建了**ToolHazard-Bench**,用于在复杂工作流程和多样化环境攻击下对智能体进行压力测试。实验揭示了智能体的重大安全漏洞,并表明注入时机和位置会影响攻击效果。此外,ToolHazard生成的对齐数据在ToolHazard-Bench和AgentDojo上均提升了安全性,同时保持了良性任务的效用。
世界按照其动力学,即运动规律,持续演化。然而,主流视频扩散模型主要拟合像素,而不对像素随时间的变化过程进行建模。因此,它们能生成视觉上合理的帧,但可能无法精确遵循运动规律。为了纯从像素中捕捉动力学,我们提出了潜变量动力学推理(Latent Dynamics Reasoning, LDR)。LDR将潜变量转移建模为显式的运动学积分,其中低阶动力学通过数值积分求解,模型仅回归驱动推演的第三阶及更高阶残差。为使该积分具有更好的外推能力,LDR在结构化潜表示上执行积分,而非密集卷积特征。参照PhyWorld,我们在一个受控的白盒物理基准上验证LDR,该基准涵盖五项任务(匀速运动、抛物线、碰撞、弹跳、逼近),重点关注能揭示模型是否真正学习了底层动力学的分布外场景。LDR对外推所学动力学的表现远优:在256²分辨率下,无论是单任务训练还是多任务联合训练,其分布内与分布外误差之间的差距比视频扩散基线小20倍以上,同时参数量减少26倍,运行速度快143倍。LDR甚至能在剧烈分布偏移下泛化:例如,仅在红球从左向右运动的数据上训练后,它能正确预测蓝方块从右向左的运动。据我们所知,这是首个能够将所学动力学外推至训练分布之外的视频世界模型。项目主页:https://lat-dyn-reason.github.io/
通过玻璃拍摄的视频常常包含反射,这些反射会降低视觉质量并干扰下游视觉任务。尽管单幅图像反射去除已被广泛研究,但视频反射去除仍很大程度上未被充分探索,原因在于缺乏成对视频数据、时序连贯的去除模型以及专门的评估基准。我们提出了一个闭环框架,统一了基于物理的反射模拟、基于扩散的视频去反射以及基准评估。我们的 S2R-Synthesis 管线通过在结构空间中执行基于物理的增强,并使用训练好的视频扩散渲染器渲染逼真的反射视频,来生成成对的含反射与无反射视频;该增强模拟了关键的玻璃相关效应,包括粗糙度引起的模糊、厚度引起的重影以及反射率变化。基于合成数据,我们提出了 S2R-Removal,这是首个基于扩散的视频反射去除模型,它通过反射感知的潜在适配和单步像素-几何细化来适配预训练的视频扩散先验,在单次去噪步骤中恢复干净的透射。我们进一步构建了 S2R-Bench,这是首个用于视频反射去除的基准,支持全参考评估和真实世界的人类感知评估。在 S2R-Bench 和多个公开图像基准上的实验表明,该方法取得了最先进的性能,且推理速度甚至快于非扩散基线,同时验证了 S2R-Synthesis 的有效性。项目页面:https://codingwzp.github.io/VideoDereflection_S2R。
"用图像思考"范式赋予多模态大语言模型主动视觉操作能力,如裁剪与缩放。然而,使用这些操作的模型相较于直接推理往往只获得边际增益甚至负增益,却付出高得多的词元成本。它们还可能反复裁剪无关区域,并在直接推理能正确回答的问题上失败。我们探究返回的视觉证据是否对答案产生因果影响。为回答这一问题,我们将视觉工具使用形式化为一个因果图,将观测中介路径与动作诱导捷径区分开来。随后,我们通过三个层面的干预对其进行审计:策略层面(比较工具使用与直接推理)、轨迹层面(在推演中破坏所有观测)以及步骤层面(在固定前缀下反事实地替换单个观测)。我们提出的步骤级估计目标——视觉证据增益——分离出每个返回观测的贡献。在六个代表性模型和五个细粒度感知基准上,我们揭示了策略失准的两种失败模式:在"不看就调用"中,返回的观测对答案没有因果影响;在"不规划就看"中,观测具有信息量,但调用调度不连贯。轨迹层面的诊断将策略层面的准确率增益分解,表明增益集中在少数校准良好的样本上。我们将这一差异称为视觉工具使用的幻觉:尽管总体准确率有所提升,视觉工具使用在广泛的推演范围中并非因果有效。代码见 https://github.com/OpenCausaLab/CauAudit。
由大语言模型(LLM)驱动的智能体系统为商业构思开辟了新的机遇。然而,尽管现实世界情境本质上具有多模态特性,现有方法仍局限于纯文本范式。为此,我们提出MBA-Bench,这是首个用于训练和评估商业构思智能体的多模态基准测试,包含六个领域的30K个样本,每个领域具有独特的视觉线索,这些线索无法仅通过文本完整传达。具体而言,我们自动为图像生成字幕,并通过检索查询生成、市场证据检索和证据增强合成三个步骤,使用GPT-4o为三个商业问题各生成五个参考构思。遵循先前工作,我们使用MLLM-as-a-Judge(MLLM作为评审)方法,依据六项面向商业的准则对智能体进行评估。针对准则隐藏或公开的不同场景,我们分别提出MBA-b(盲评)和MBA-k(已知准则)。两者均使用两个新颖的奖励目标进行训练——创造性和可行性——而MBA-k进一步优化六项公开准则,共计八项目标。两者均通过基于LoRA的监督微调,随后结合特定场景奖励进行群体相对策略优化(GRPO)来训练。为在MBA-Bench上进行全面实验,我们设置了两个基线,分别适应仅字幕输入和多模态输入,其中后者在若干指标上接近闭源模型性能。MBA-b和MBA-k相较于字幕基线分别提升63.9%和77.1%,相较于多模态基线分别提升25.6%和35.8%。
复杂软件系统的发展时间尺度超过了任何单个编码代理的生命周期。大多数代理式软件系统通过持久化会话、记忆、管理器或共享上下文来保持连续性。我们引入EvoX Genesis(以下简称Genesis),它反其道而行之:使软件项目保持持久化,同时允许本地代理保持有限的生命周期。Genesis将软件表示为持久化的递归世界:每个本地世界由已接受的版本和仓库路径定位,有限生命周期的代理提出局部变更,递归委派将工作跨路径移动,只有被接受的变更结果才能推进持久化的版本历史。我们分别在形成、延续和再开发三个层面评估了这种组织方式。 从一个没有编译器实现的仓库出发,Genesis使用DeepSeek V4 Flash构建了一个基于Rust的C编译器,包含约25万行被跟踪的代码;该运行持续超过120小时,存档了超过1,000次代理回合,仅产生44美元的模型令牌费用。该编译器通过了完整的c-testsuite以及大多数LLVM和Csmith测试。在使用GLM 5.2生成的另一个编译器世界中,尽管代理被反复更换,开发工作仍得以延续,同时保持了完整的测试性能。Genesis还将13个MESA模块(超过10万行Fortran代码)重新实现为一个Rust工作区,包含近9万行Rust代码;在六个数值工作负载中,实现了1.55至6.87倍的中位加速比。这些结果表明,长周期软件开发可以围绕持久化的项目来组织,而非围绕持久化的代理。
探索长期以来一直是强化学习研究的重点。近期,越来越多的证据表明,它也是大语言模型强化学习训练流程中的一个重要组成部分,能够显著影响下游性能。许多现有方法在动作空间层面控制探索,例如使用温度缩放。然而,这些方法无法对词元进行重新排序,只能影响输出分布的方差。这限制了探索能力,并可能导致训练发散或停滞。在本研究中,我们探讨了参数空间探索,即通过从后验分布中采样不同的策略来生成轨迹,每个策略可能探索不同的轨迹。采样多样性较低或较高的策略因此成为探索的互补控制手段。我们提出了一族名为扰动参数策略优化(3PO)的方法,该方法使用不同的采样策略和不同的轨迹分组方式进行奖励估计。在OLMo-3-1025-7B和Qwen2.5-Math-7B上进行的数学推理和代码生成任务实验表明,这些方法在几乎相同的FLOPs成本下,持续优于标准GRPO的平均下游性能。此外,与GRPO和动作空间基线相比,使用多个参数样本在训练过程中始终产生更少的零优势组以及格式错误或错误的轨迹。总体而言,我们的工作为参数空间探索能够改进大语言模型的强化学习提供了证据。
用于类别生成的离散扩散模型由一个损坏核定义,该核决定了中间状态空间以及相应的反向预测问题。我们研究均匀离散扩散,并探讨能否在不改变底层类别损坏过程的前提下,丰富其训练目标和反向转移。我们提出 Simplax,一种精确的 Dirichlet-类别增强方法,它将每个被损坏的类别状态与一个辅助的单纯形值变量耦合,同时保持原始均匀扩散过程作为其类别边际。这种增强产生了一个可解的 Rao-Blackwell 化反向桥目标函数,以及相应的随机反向采样器,同时保留被损坏的类别状态作为去噪器输入。实验上,Simplax 在无条件 OpenWebText 生成上改善了生成困惑度-熵的权衡。在数独任务上,仅在 30 线索谜题上训练的模型在所有评估的线索密度中取得了对比方法中的最高准确率,包括最小唯一可解的 17 线索情形,并且在无条件生成中也实现了最高的有效性。
主流范式将AI安全视为在模型训练阶段通过RLHF、DPO或宪法AI注入模型的一种属性。我们认为,对于能够执行代码、修改文件、发送消息和变更数据库的自主智能体而言,这种范式在结构上是不充分的。智能体安全应当是由执行框架(harness)强制实施的运行时契约,该契约包含两个互补的面向。预防性面向通过沙箱、权限门控、输出过滤器和轨迹监控器,在危险行为发生之前予以阻断;证据性面向则要求可验证的证据证明良好行为确实发生,并以测试运行、日志捕获、文件差异和引用溯源等硬性证据作为任务提交的门控条件。我们以四类公开证据支撑这一立场,行级协议和数据见补充JSON文件:对52起有记录的AI智能体与LLM安全事故的调查、一项包含31个无争议核心案例及1个有争议示例性案例的虚假完成审计、对12个公开智能体系统和执行框架的轨迹模式审计,以及对NeurIPS、ICML和ICLR 2023-2025年录用的全部28,560篇论文的标题级审计(显示训练时与部署时发表数量之间存在8至12倍的合并失衡)。两个先前的社区——计算机安全和实验科学——在需要强制安全时,都收敛到了兼具预防性和证据性要素的运行时契约;智能体AI如今正面临同样的压力。我们形式化了智能体轨迹模式和证据链,基于标准监控器组合提出了一个组合式门控命题,并概述了一项研究议程。智能体AI中正确的安全单元是“带可核查证据的轨迹”,而非模型本身。
大语言模型(LLMs)的多模态扩展赋予了模型新的感知能力,但往往以牺牲预训练阶段习得的语言智能为代价。在本工作中,我们从内部适应动力学的视角探究这一现象,并发现预训练LLM中的神经元在多模态学习过程中表现出异质的可塑性:部分神经元对保持语言能力至关重要,而其他神经元则更适应多模态知识的获取。基于这一洞察,我们提出NeuPAT(神经元感知的可塑性分配微调),一种轻量级且架构无关的框架,在多模态指令微调过程中分配神经元级别的更新约束。NeuPAT通过一个小规模的探测阶段来估计神经元的适应模式,有选择地保护语言敏感神经元,同时通过更具可塑性的神经元促进多模态适应。跨多种LLM家族的实验表明,NeuPAT在11个语言基准上恢复了由标准微调导致的94.5%的语言能力退化,同时保持了相当的多模态性能,为能力保持的多模态扩展提供了一种有效方法。
从真实场景图像中估计人类注视目标是一项重要且艰巨的任务。现有方法主要采用脆弱的多阶段流程,需要诸如头部边界框和人体姿态等显式输入,以识别注视分析的主体。因此,检测错误可能级联传播并导致失败。此外,这些先前的工作缺乏通过自然语言提示来指定注视分析任务的灵活性,而这种方法已被证明在其他图像分析任务中在便利性和可扩展性方面具有显著优势。为了克服这些限制,我们提出了可提示注视目标估计(PGE)任务,这是一种新的端到端、概念驱动的注视分析范式。PGE 根据灵活的用户文本或视觉提示(例如“穿红衬衫的男孩”或“位于点[0.52, 0.48]的人”)来调节注视预测,以识别用于注视分析的特定主体。该方法将主体定位与注视估计相结合,并消除了对中间分析阶段的刚性依赖。我们开发了一个可扩展的数据引擎,用于生成 Gaze-Co(基于概念的注视估计),这是一个包含 12 万对高质量、带提示标注图像对的数据集和基准。我们还提出了 GazeAnywhere,这是首个为 PGE 设计的模型。GazeAnywhere 使用基于 Transformer 的检测器来融合来自冻结编码器的特征,并同时解决主体定位、是否在画面内以及注视目标热图估计的问题。GazeAnywhere 在多个 PGE 基准上取得了最先进的性能,即使是在困难的跨域真实世界临床数据集上,也为这一新问题树立了强大的基线。GazeAnywhere 已在 github.com/IrohXu/GazeAnywhere 开源。
模拟由众多大型语言模型(LLM)智能体组成的社会成本高昂,然而对此类模拟提出的问题通常是宏观层面的:相行为、典型化事实,以及随智能体数量 N 的标度行为,而非单个智能体的认知。我们将一个统计物理学观察转化为一种方法:用低参数模型替代每个 LLM 智能体,该模型从几百到几千次廉价查询中拟合得到,然后即可在笔记本电脑上以任意 N 运行该社会模拟。该方法是否有效,在模拟运行之前便已确定,主要取决于每个智能体的感知内容。我们引入了一种「交互阶数 × 记忆」分类法,将感知和记忆映射为一种有效理论,并预测替代模型误差随 N 变化的趋势。我们在对 LLM 宏观经济学模型 EconAgent 的忠实重新实现,以及其他七个已命名的 LLM 模拟上验证了该分类法,智能体决策克隆自真实 LLM 的引出(主要为 DeepSeek),成本仅数美元;预测的误差趋势逐格成立,而两个被推翻的预测——均涉及强饱和响应,且归因于其曲率——也被该理论在无自由参数的情况下定量匹配。
尽管视觉-语言-动作(VLA)模型推动了具身AI的发展,但其本质上的反应式范式严重制约了在部分可观察和长时程任务中的表现。当仅依赖单个腕部摄像头时,模型不可避免地会因物体移出视野而产生感知遗忘,并在多步执行过程中出现时序任务进度遗忘。为克服这些瓶颈,我们提出AtlasVLA——一种全新框架,通过持久的“世界-自我”状态实现从直接反应式操作向主动推理的转变。AtlasVLA采用双记忆架构:4D持久世界状态记忆将瞬时的2D观测提升为全局更新的体素哈希空间状态,以解决视觉盲区问题;自我工作状态记忆则跟踪历史自我状态与任务进度。通过以联合的“世界-自我”状态为条件引导扩散变换器(DiT),AtlasVLA实现了鲁棒的空间推理。在LIBERO、RLBench及真实世界基准上的广泛评估表明,AtlasVLA仅使用腕部摄像头即可达到最先进的性能。值得注意的是,它显著优于多视角基线方法,在LIBERO-Long上实现了9.4%的绝对成功率提升,在真实世界长时程任务中实现了17.5%的提升。
LLM智能体服务在模型调用与工具调用之间反复执行小型确定性状态转换:对结果进行路由、更新状态并发出下一个效应。我们探究该控制路径在何种条件下能为GPU执行暴露足够的并发工作,以及当由GPU计算的路由决策保留在设备上时会发生什么变化。我们使用固定分区份额F、精确离线份额P*、局部上界U和在线达成份额A来形式化就绪队列边界。在零服务时间、无限容量和相同相对启动截止时间的条件下,一个专门的动态规划程序可精确计算P*。在对一个固定的851会话公共轨迹面板进行平稳泊松重放时,在100,000个目标活跃会话、K=256和50毫秒启动截止时间的主要条件下,F=30.19%,P*=43.00%,U=45.85%。精确打包恢复了因固定窗口边界而损失的81.83%的机会。由结果派生的路由键是条件化代理,而非可执行身份的证明。一项独立的机制研究将GPU计算的二元决策保留在设备上,而不是向主机返回四个字节并重新调度。在四个命名的GPU放置方案中,设备驻留路径在所有36种配置中均更快;放置方案内的行中位数比率范围为1.19倍至2.39倍。在两种可接受的机制中,所有14,557,440次测试的批量调用均与单独实现的主机预言机匹配。一个不移除任何主机决策的固定嵌套设备图在五种放置方案的所有60种配置中均较慢。综合来看,这些研究确立了GPU智能体控制的两个可测量门控:满足截止时间的队列供给和观测放置。需要一个联合有限在线运行时来测量A、CPU置换和服务级收益。
手部姿态估计(Hand Pose Estimation,HPE)是增强现实/虚拟现实(AR/VR)和机器人等多种应用的基础技术。在这些应用中,图像中每个手部关节点的可见性对于评估遮挡条件下估计结果的可靠性至关重要。然而,大多数现有的HPE方法仅输出关节点位置,并未明确指示其可见性。尽管某些方法考虑了遮挡或可见性因素,但可见性估计主要被用作改进姿态估计的辅助信号。据我们所知,手部逐关节可见性估计尚未作为独立任务被系统性地研究。在这项工作中,我们提出了Hand Visibility Detector(手部可见性检测器),一个用于估计单个手部关节点可见性的模型,并首次将可见性估计作为独立任务进行系统性研究。我们证明,利用在大规模数据上预训练的HPE模型作为骨干网络所蕴含的先验知识,能够在该任务中取得优异性能。我们进一步展示了Hand Visibility Detector在通过多视角三角化二维关键点进行三维手部姿态标注这一下游任务中的实用性,结果表明可见性加权三角化能够有效降低重投影误差。我们的方法已作为可直接使用的软件包发布,代码和演示可在 https://github.com/ryhara/hand_visibility_detector 获取。
ReRound(重建式舍入)是一种训练后量化方法,旨在解决标准最近舍入(RTN)方案在对接近量化区间中心的权重进行量化时所固有的中点模糊性问题。 该方法从预训练的大语言模型(LLM)出发,训练一个条件扩散模型,为LLM的低比特权重生成连续重建。这些重建权重充当引导信号,用于消除接近区间中点的权重在舍入方向上的歧义。 为了将这种重建引导的舍入与常规RTN相结合,ReRound引入了一种容差度量,用于衡量量化权重(而非最终量化整数)偏离中点的程度:位于中点附近容差区域内的量化权重,使用基于扩散的重建结果进行量化;而更接近量化边界的权重则使用RTN进行量化。通过扫描容差参数,ReRound生成多个候选的量化整数权重矩阵,并选择其反量化权重矩阵的前导奇异值与原始全精度权重最接近的那个候选。该选定候选决定了ReRound所使用的容差参数。 ReRound对较小规模的LLM尤为有效。在一系列此类模型上,它在3比特和4比特权重量化方面均稳定优于标准RTN。与大量无需校准的方法相比,ReRound取得了更优的精度,同时与依赖校准的方法保持竞争力,并且完全离线运行,在低比特推理过程中不引入任何额外开销。 ReRound策略为低比特量化提供了一种新方法。该方法也适用于LLM之外的AI模型。本文重点探讨其在小型LLM上的应用。