ChatPaper
近 7 天全球 AI 研究者都在点赞的论文,人话解读
想象一下,一台小排量汽车却在山路赛道上跑赢了大马力跑车。VideoChat3 就是这样的 AI 模型:仅 4B 参数量,却在视频理解任务上超越了许多更大参数的模型。它采用全新的 3D 视觉变换器和自适应帧分辨率技术,能高效处理各种长度的视频。同时,通过合成三大类训练数据(学术短片段、长视频、开放式问答),它学会了广泛适应的能力。这意味着,高效且通用的视频 AI 不再是少数巨头的专利。
就像顶级厨师不用亲自研发新菜,只需翻看实习生改进的笔记就能进步——Direct-OPD让强模型从弱模型的强化学习经历中偷师。它不直接复制弱模型的最终策略,而是提取它训练前后的相对变化(log-ratio),当作一个密集奖励信号来指导强模型。结果:Qwen3-1.7B在AIME 2024上从48.3%跃升至58.3%,训练仅需4小时(8块A100 GPU)。这意味着,以后提升大模型可以复用小模型的计算成本,又快又省。
就像人在陌生城市会先看地图再规划路线,而非闷头乱撞,ABot-N1模型把“思考指令”和“控制行动”彻底分开。它用“像素目标”作为通用接口——先在脑海中清晰锁定目的地图像,再指挥身体移动。结果在城市级导航中,到达指定地点的成功率从约57%跃升至77.3%;室内外复杂场景下,成功率也高达95.4%和92.9%。这意味着未来服务机器人能更可靠、更透明地理解并执行你的指令,不再“迷路”或“犯糊涂”。
就像人通过犯错成长,机器人也能利用记忆错误自我升级。ABot-AgentOS是一个通用机器人操作系统,配备终身多模态记忆。在含16个场景200+任务的EmbodiedWorldBench上,它的长期任务执行能力远超传统控制器。关键创新是失败驱动自我进化:诊断记忆故障后生成改进资产,且仅在后续评估中使用,避免数据污染。静态版本记忆评分87.5,自我进化后提升至88.7。这意味着机器人能持续适应真实世界,更靠谱。
就像学生自己总结错题本,SEED让AI从过去的行动中提取经验,写成自然语言的「技能」——比如「先检查工具再执行」。传统强化学习需要大量试错,而SEED让AI边做边分析:它先微调策略,从完整轨迹中找出可复用的流程、关键观察或避免失败的方法。然后,这些技能被用来重新评估行动选择,产生密集的逐令牌蒸馏信号,指导策略更新。关键创新:分析器就是策略本身,所以监督信号能随策略进化,而不是固定不动。这意味着AI能在稀疏奖励的长期任务中(如多轮对话、工具使用)自己生成中间指导,学习更高效。
就像做菜时把步骤写下来比凭记忆更靠谱,多智能体搜索框架SearchOS把隐式的搜索进度变成显式、持久、共享的状态。这样一来,智能体不会再绕圈子,搜索效率和结果质量都大幅提升——在基准测试中,它的综合表现超过了所有单智能体和多智能体基线。简单说,它让信息搜索变得更可靠、不白费力气。