一个没做过任何机器人训练的聊天模型,在一次状态不错的尝试里,自己写好工具、下载部署,慢慢让四足机器人走过迷宫,把盘子从台面拿起放到炉子上。
这是 Anthropic 七月报告《Claude plays robotics》的开场。但同一份报告也给出了另一面:当模型必须亲自驱动关节时,它几乎总是失败。可靠性上的差距正随着每一代模型缩小,但方向比速度更值得看清。
亲自驱动关节,几乎全败
报告让多个前沿模型控制 Unitree Go2 四足机器人和 G1 仿人机器人。结果残酷:没有任何模型成功让 G1 从趴倒姿势站起来,一次都没有。
厨房操作任务上,直接控制下最好模型的端到端成功率在 0% 到 5.5% 之间——能碰到、能抓起,但完整任务极少走完。
原因不复杂:实时控制要求约 83 Hz 的响应频率,而当前模型非推理状态下的推理速度只有 0.2–0.4 Hz,差了两个数量级。微小的失误若不立即修正,整个机身就会失稳。让模型逐毫秒指挥电机,今天就是死路。
图注:经典控制测试:同一模型直接输出力矩(左列)与编写控制器代码(右列)的得分差距,远大于模型之间的差距(来源:Anthropic《Claude plays robotics》)
能力不在模型里,在接口里
报告最重要的发现是:同一个模型,换一种连接机器人的方式,表现判若两模。
直接设电机力矩、写 Python 控制器、监督预训练策略、用强化学习从零训练——四种"接口"对得分的影响,比模型代际差异更大。最难控的仿人机器人,模型只在高层接口上取得进展,因为底层物理交给了预训练策略。
用程序化接口,Opus 4.6 能让 Go2 稳定平衡近两秒;配上预训练步态策略,它甚至能完成简单导航。高层运动的 11 项综合任务里,模型代际出现两次明显跃升:Opus 4.1 到 4.5,以及 4.7 到 Mythos Preview。模型不需要懂每个关节,它需要懂任务。
正确姿势:当主管,不当司机
当模型被允许监督一个预训练视觉-语言-动作策略(VLA)时,成功率整体跳升。
更有意思的是细节:较新的 Opus 4.5/4.6 更擅长识别"策略何时会失败",不再不加甄别地交出控制权;最好的监督者已弥合了与策略单独运行之间的大部分差距,在 VLA 不会的任务上还能提供净增益。
一个小工具也说明了问题:给模型一个"光标",告诉它夹爪指向的物体和距离,Mythos Preview 在 10 任务子集上的成功率从 6% 提升到 32%;运动任务里,一个只显示朝向度数的"指南针"轻松胜出深度热图、第三人称相机等所有视觉辅助。模型缺的往往不是智力,是方位感。
报告还测了"听话"与"判断"的区别。在 VLA 会失败的三个新任务里,早期模型和 GPT-5.4 仍紧贴策略指令,Opus 4.5/4.6/4.7 则更少依赖它,更善于识别策略何时失灵。更早的模型跟随率不低,成绩却更差——高跟随率不等于好判断,不加甄别的顺从反而是缺陷。
物理世界里的花絮更直白:Opus 4.6 控制真实 Go2 时,看到垃圾桶在十字准星左侧,自信判断"不碍事",结果垃圾桶就在正前方,它撞上去拖着走了几米。
图注:操作任务成功率:加上 VLA 监督后各模型大幅提升,连较早模型也拿到有意义的成绩(来源:同上报告)
真正的差距在"读世界"
报告还做了一组对照:用强视觉模型生成的文字描述替换相机画面。旧模型反而变好,Opus 4.6/4.7 却变差。
这说明新模型已经能从原始像素里读出比前代更多的空间信息——压缩成语言反而丢了东西。视觉理解的差距,正在比控制能力的差距收缩得更快。
另一个反直觉的结论:给更多推理预算,多数任务上帮助很小,在经典控制上甚至让新模型退步——对简单问题过度规划,反而碍事。想得多不如看得准,机器人世界对"反应"的奖励高于"深思"。
图注:文字描述替换图像后旧模型提升、新模型下降,说明新一代模型已能直接用原始视觉(来源:同上报告)
源势AI 观点
这份报告点破了一件事:模型的物理能力,取决于它如何连接世界,而不只取决于模型本身。孤立测试模型能力,会低估它嵌入机器人栈之后能做到的事。
企业落地是同一逻辑。我们做智能体项目,不让大模型"直接驱动关节"——不让它裸算每一步业务动作;而是让它当主管:调用专业系统,判断策略何时出错,知道何时干预、何时放手。
模型当主管,系统当执行者。这条分工,是今天智能体走进真实业务、走进物理世界最短的路。
报告也提醒了安全一侧:预训练策略正是现实部署系统会提供的东西,模型不需要亲自驱动关节就能在世界上有能力地行动。评估模型风险时,同样不能只看它"裸奔"的能力,要看它接入系统后的能力。这对企业选型智能体方案,是同一个提醒。
数据来源:Anthropic《Claude plays robotics》(2026-07-09)