科研议题知乎 - Naiyan Wang
文章以 GPT-6 Astra 控制机械臂的实验为引,提出具身智能中与 feed-forward 先验同等重要的 Feedback Learning,即模型在同一次任务中利用失败反馈调整后续行为。作者从系统辨识、误差修正和 Few-shot 示教三类用法展开:通过试探运动估计工具或本体参数,在插装等任务中根据失败观测修正偏移,并把示范作为起点结合在线交互继续适应。文中引用笔尖标定、Agent as Policy 约 9 mm 偏移、RoboDojo 约 129 mm 扰动、RoboICL 叠塔分数从 0.04 到 0.82 等证据,说明失败反馈可转化为纠正依据;但重试后能否反超专用模型仍需同任务、同交互预算的成功率曲线验证。结论强调应研究数据、表示和训练目标如何让模型利用自身反馈持续适应,而非只保留成功轨迹或仅归因于更强 3D 理解。当前局限是证据多来自案例观察和项目视频,系统性对照评测不足。
推荐收录。文章不是罗列机器人实验,而是把系统辨识、失败修正和示范学习串成“上下文反馈学习”的研究议程,并给出论文出处与量化证据。适合做 VLA/机器人学习、Agent 研究或评测设计的读者,可迁移到数据构造、训练目标和交互预算评测;主要风险是结论仍偏案例观察,尚缺统一对照实验支撑。
科研议题知乎 - Naiyan Wang
作者对近期具身智能 In-Context Learning 工作(GEN-1.5、Skild S1、HOST、Zero-WAM)作出判断:除 GEN-1.5 按公开描述最接近 GPT-3 式涌现外,其余三者都显式把 ICL 行为写进数据、目标函数和模型结构,属于伪 ICL,工程上有效但不能证明机制层面涌现了通用学习算法。文章区分 ICL 的外观与机制,认为真正的 ICL 应是通用序列建模持续 scaling 的副产品,而非把 episodic training 当作优化目标;并逐一分析 S1 的 amortized meta-learning、HOST 的 progress alignment 与预测级联,以及 Zero-WAM 中消融恰好证明行为由专门 loss 塑造。作者进一步指出扩大 paired data 只扩大 coverage,不改变泛化类型,并建议从改变 episode 构造规则、任务格式和输入输出因果等角度检验 task-agnostic 学习。结论是 ICL 应作为 scaling 的诊断信号,而不应成为直接优化目标。
本文提供了区分“设计出来的 ICL 行为”与“从 scaling 中涌现的 ICL 机制”的可操作判据,并逐一落在具体工作上,论证严谨、边界明确。适合机器人学习、基础模型评估与 AI scaling 研究方向的读者,能帮助他们准确解读公司技术博客中的实证数据并建立批判性实验思维。该判断框架也可迁移到其他宣称涌现能力的模型分析中。
技术文章知乎 - Naiyan Wang
本文提出一个2×2分析框架,从“离线/在线”和“开环/闭环”两个正交维度出发,将物理AI中的世界模型(World Model)划分为四个应用象限(L1-L4)。作者以POMDP循环为底座,强调真正的世界模型必须建模State×Action→NextState的映射关系,并逐象限剖析了其在感知数据增广、闭环仿真、在线条件辅助、以及在线闭环推理中的角色与工程约束。文章指出,L4在线闭环是激活“系统2”深度思考的终极形态,但面临高精度价值函数和4D时空表征的双重壁垒。最后将本框架与李飞飞的三分类框架(Renderer/Simulator/Planner)进行映射,明确各象限的对应关系。本文为梳理世界模型的概念混乱提供了清晰的认知地图,但讨论聚焦于概念框架与工程定位,未涉及具体算法实现细节。
推荐收录,因为文章从第一性原理出发,提出了一个清晰且可迁移的分析框架,有效澄清了World Model领域的概念混乱。适合从事物理AI、机器人决策与仿真、以及强化学习的研究者和工程实践者阅读,能帮助他们对齐不同技术路线的定位,并思考L4在线闭环的落地挑战。