ChatPaper
2026-07-17 · 每天 5 分钟,读懂今天最值得知道的论文
想象一下,一台小排量汽车却在山路赛道上跑赢了大马力跑车。VideoChat3 就是这样的 AI 模型:仅 4B 参数量,却在视频理解任务上超越了许多更大参数的模型。它采用全新的 3D 视觉变换器和自适应帧分辨率技术,能高效处理各种长度的视频。同时,通过合成三大类训练数据(学术短片段、长视频、开放式问答),它学会了广泛适应的能力。这意味着,高效且通用的视频 AI 不再是少数巨头的专利。
就像学生自己总结错题本,SEED让AI从过去的行动中提取经验,写成自然语言的「技能」——比如「先检查工具再执行」。传统强化学习需要大量试错,而SEED让AI边做边分析:它先微调策略,从完整轨迹中找出可复用的流程、关键观察或避免失败的方法。然后,这些技能被用来重新评估行动选择,产生密集的逐令牌蒸馏信号,指导策略更新。关键创新:分析器就是策略本身,所以监督信号能随策略进化,而不是固定不动。这意味着AI能在稀疏奖励的长期任务中(如多轮对话、工具使用)自己生成中间指导,学习更高效。
就像做菜时把步骤写下来比凭记忆更靠谱,多智能体搜索框架SearchOS把隐式的搜索进度变成显式、持久、共享的状态。这样一来,智能体不会再绕圈子,搜索效率和结果质量都大幅提升——在基准测试中,它的综合表现超过了所有单智能体和多智能体基线。简单说,它让信息搜索变得更可靠、不白费力气。
想象一下,教AI读一本长篇小说,传统方法要求它一口气背完整本书才能回答问题。LongStraw把书拆成共享背景和短问答,只记住当前需要的部分,大幅降低显存。通过将共享提示不计算梯度、单独回放短回答分支,在8张H20 GPU上实现了210万位置的Qwen评分和反向传播,每增加一个回答组仅多占0.21 GB显存。在32张H20上验证了GLM-5.2全部78层、210万token的提示长度。这意味着AI智能体现在能用更长的上下文进行强化学习,提升复杂决策能力。
想象一下,自动驾驶汽车能准确预测前方路况,但方向盘却失控地转向另一侧——这就是世界-动作模型的新漏洞。BadWAM攻击通过在输入中施加微小扰动,让模型正常构想未来,却执行错误的动作。在一项模拟任务中,仅针对动作的攻击就让成功率从96.5%降至43.1%。这意味着,即便模型看起来在合理推演,实际动作可能已被劫持。这对依赖可信可视化决策的具身AI系统敲响了安全警钟。