Robotics

12 篇内容

科研议题Microsoft Research Blog

Offloaded inference for real-world physical AI robotics

微软研究博客挑战物理AI推理必须全部运行在机器人板载GPU上的假设,围绕移动操作任务中的语义建图与规划、导航和操作,系统比较板载、边缘与云端GPU的推理表现。评测显示,将推理卸载到边缘/云GPU可提升任务成功率、响应速度与准确率,并支持更大的VLA等模型;较弱板载GPU会使建图与规划最多变慢383%,导航障碍及时检测下降30%,VLA准确率下降50%,Jetson Thor等还会使续航缩短最多160%。作者发布基于Kubernetes的Physical AI Toolchain,可用声明式方式自动容器化、部署和编排机器人AI工作负载,并集成ROS2、LeRobot与仿真器。结论主要适用于移动操作类物理AI工作负载,卸载仍面临性能、网络延迟/带宽与GPU资源间的复杂权衡,且结果依赖具体硬件配置,完整证据需参考其技术报告。

推荐收录。文章基于微软研究院对移动操作工作负载的系统测量,给出板载与边缘/云GPU在任务成功率、时延、VLA准确率和续航上的具体数据,并开源基于Kubernetes的Physical AI Toolchain,可直接指导物理AI推理架构和卸载策略设计。适合机器人、边缘/云推理基础设施与MLOps工程师阅读;需注意其结论依赖特定硬件与网络条件,且本质是厂商研究博客,完整实验细节应以技术报告为准。

科研议题知乎 - Naiyan Wang

In-context feedback learning is all you need

文章以 GPT-6 Astra 控制机械臂的实验为引,提出具身智能中与 feed-forward 先验同等重要的 Feedback Learning,即模型在同一次任务中利用失败反馈调整后续行为。作者从系统辨识、误差修正和 Few-shot 示教三类用法展开:通过试探运动估计工具或本体参数,在插装等任务中根据失败观测修正偏移,并把示范作为起点结合在线交互继续适应。文中引用笔尖标定、Agent as Policy 约 9 mm 偏移、RoboDojo 约 129 mm 扰动、RoboICL 叠塔分数从 0.04 到 0.82 等证据,说明失败反馈可转化为纠正依据;但重试后能否反超专用模型仍需同任务、同交互预算的成功率曲线验证。结论强调应研究数据、表示和训练目标如何让模型利用自身反馈持续适应,而非只保留成功轨迹或仅归因于更强 3D 理解。当前局限是证据多来自案例观察和项目视频,系统性对照评测不足。

推荐收录。文章不是罗列机器人实验,而是把系统辨识、失败修正和示范学习串成“上下文反馈学习”的研究议程,并给出论文出处与量化证据。适合做 VLA/机器人学习、Agent 研究或评测设计的读者,可迁移到数据构造、训练目标和交互预算评测;主要风险是结论仍偏案例观察,尚缺统一对照实验支撑。

工程实践NVIDIA Technical Blog

Accelerating a ROS 2 Node with an AI Agent and NVIDIA Isaac ROS

NVIDIA 技术博客讲解如何借助 AI 编码代理,把已有的 CUDA 加速 ROS 2 节点迁移到 rosidl::Buffer 抽象与 CUDA buffer backend。该后端基于 CUDA 虚拟内存管理实现零拷贝:当发布者与订阅者同主机、同 CUDA 设备、同 Linux 用户且使用受支持 RMW 实现时,可直接交换 GPU 常驻数据,否则回退 CPU 路径,并保持标准 ROS 2 消息接口不变。文章以 Depth Anything 3 TensorRT 节点为例,展示 migrate-node-to-rosidl-buffer 技能如何审计数据流、规划最小改动:订阅声明接受 cuda、输出消息分配 CUDA 缓冲、TensorRT 推理直接写入,点云与调试等可选 CPU 路径保持独立。验证用 Nsight Systems 确认 ROS 边界不再有载荷级主机-设备拷贝,并以 get_backend_type() 是否为 cuda 判断协商结果。内容依赖 ROS 2 Lyrical、Isaac ROS 5.0 与 NVIDIA 生态,未给出量化性能收益。

推荐收录:文章给出从依赖添加、订阅选项、CUDA 缓冲分配到推理直写与验证的完整迁移路径,并明确零拷贝生效前提(同主机、同 CUDA 设备、同用户、受支持 RMW)和 CPU 回退机制,可直接借鉴到 GPU 加速 ROS 2 节点与机器人数据通路优化。适合机器人中间件、边缘推理和 CUDA 数据流方向的工程师,其“审计—最小改动—验证”方法可迁移到其他节点。风险是依赖 NVIDIA 生态、缺少量化性能数据。

工程实践NVIDIA Technical Blog

How to Use AI Agents to Prepare 3D Scenes for Simulation

文章讲解如何用多智能体工作流把 Blender 场景准备成可供机器人仿真的 SimReady OpenUSD 世界:Codex/Claude 作编排主智能体,NVIDIA NemoClaw 部署 Hermes 子智能体,Omniverse Libraries(OpenUSD、ovphysx、ovrtx)作为可调用工具层。流程依次为通过 Blender MCP 盘点场景、以 USD 作为共享契约层、添加语义标签与仿真感知材质、提前配置相机和激光雷达、用 ovphysx 补碰撞体与刚体属性、用 ovrtx 做视觉预检,最后以 SimReady 校验作为验收门,并把依赖开发者意图的歧义决策升级给人工。作者强调 USD 的非破坏性分层可保留层级与元数据,安全机械问题自动修复,同时给出结构化产物与常见失败清单。但全文强绑定 NVIDIA 自有产品栈,缺少与其他方案的对比及量化效果验证。

推荐收录:文章给出可迁移的多智能体编排范式——编排层、专用子智能体、真实工具调用、验证门与人工升级,并用 8 步流程及场景清单、材质元数据、物理就绪报告、视觉 QA、SimReady 报告等结构化产物说明仿真场景准备的工程细节。适合做 agentic AI、机器人仿真与 3D 数据流水线的工程师参考;需注意其强绑定 NVIDIA 工具链,缺少方案对比与量化结果,迁移时需自行验证。

科研议题知乎 - Naiyan Wang

ICL,具身智能的GPT3时刻已经到来了吗?

作者对近期具身智能 In-Context Learning 工作(GEN-1.5、Skild S1、HOST、Zero-WAM)作出判断:除 GEN-1.5 按公开描述最接近 GPT-3 式涌现外,其余三者都显式把 ICL 行为写进数据、目标函数和模型结构,属于伪 ICL,工程上有效但不能证明机制层面涌现了通用学习算法。文章区分 ICL 的外观与机制,认为真正的 ICL 应是通用序列建模持续 scaling 的副产品,而非把 episodic training 当作优化目标;并逐一分析 S1 的 amortized meta-learning、HOST 的 progress alignment 与预测级联,以及 Zero-WAM 中消融恰好证明行为由专门 loss 塑造。作者进一步指出扩大 paired data 只扩大 coverage,不改变泛化类型,并建议从改变 episode 构造规则、任务格式和输入输出因果等角度检验 task-agnostic 学习。结论是 ICL 应作为 scaling 的诊断信号,而不应成为直接优化目标。

本文提供了区分“设计出来的 ICL 行为”与“从 scaling 中涌现的 ICL 机制”的可操作判据,并逐一落在具体工作上,论证严谨、边界明确。适合机器人学习、基础模型评估与 AI scaling 研究方向的读者,能帮助他们准确解读公司技术博客中的实证数据并建立批判性实验思维。该判断框架也可迁移到其他宣称涌现能力的模型分析中。

科研议题Microsoft Research Blog

MindTopo reveals VLMs’ spatial reasoning abilities

文章介绍MindTopo基准,用于评估多模态大模型的拓扑推理能力,将任务分为连续性、分离、顺序、封闭性和绳结五类,并区分静态推理与交互规划两个认知层次。所有场景由可控模拟器生成,提供精确真值和难度调节,以分离视觉复杂度与结构维持能力两类失败。研究发现当前模型在静态识别上明显强于交互规划,且均低于人类;规划错误多发生在理解之后,表现为多步丢失结构或违反物理约束。图像或视频生成辅助并不可靠,无法在动作序列中保持拓扑关系。作者认为机器人等交互系统需要显式拓扑状态或拓扑保持的世界模型,该基准定位为受控诊断工具。

推荐收录,因为文章提出了一个清晰定义的拓扑推理基准,并用控制仿真区分感知失败与规划失败,对评估多模态模型的深层空间能力有直接价值。适合关注视觉语言模型、机器人规划与AI评测的研究者,其五类任务划分和失败模式分析可迁移到交互式智能体的诊断与改进。

技术文章知乎 - Naiyan Wang

World Model 的 四个象限

本文提出一个2×2分析框架,从“离线/在线”和“开环/闭环”两个正交维度出发,将物理AI中的世界模型(World Model)划分为四个应用象限(L1-L4)。作者以POMDP循环为底座,强调真正的世界模型必须建模State×Action→NextState的映射关系,并逐象限剖析了其在感知数据增广、闭环仿真、在线条件辅助、以及在线闭环推理中的角色与工程约束。文章指出,L4在线闭环是激活“系统2”深度思考的终极形态,但面临高精度价值函数和4D时空表征的双重壁垒。最后将本框架与李飞飞的三分类框架(Renderer/Simulator/Planner)进行映射,明确各象限的对应关系。本文为梳理世界模型的概念混乱提供了清晰的认知地图,但讨论聚焦于概念框架与工程定位,未涉及具体算法实现细节。

推荐收录,因为文章从第一性原理出发,提出了一个清晰且可迁移的分析框架,有效澄清了World Model领域的概念混乱。适合从事物理AI、机器人决策与仿真、以及强化学习的研究者和工程实践者阅读,能帮助他们对齐不同技术路线的定位,并思考L4在线闭环的落地挑战。

科研议题Google DeepMind Blog

Gemini Robotics 2 brings whole body intelligence to robots

文章介绍了Gemini Robotics 2系列模型,包括用于全身控制的视觉-语言-动作模型(VLA)、用于具身推理的视觉-语言模型(ER)以及可在设备端高效运行并快速适应新机器人形态的轻量VLA。核心进展在于实现了人形机器人的全身协调控制、多指与夹爪的灵巧操作、多机器人协作以及数百步长时任务规划。文中给出了在多种机器人平台上的基准测试结果,展示了不同技能类别的成功率,同时也指出多指灵巧操纵仍具挑战。此外,文章强调了安全框架,引入了ASIMOV-Agentic基准来衡量推理模型的安全编排和不确定性处理能力。该工作面向通用物理智能,但当前成果仍处于研究阶段,运动速度和复杂任务的成功率有待进一步提升。

本文系统地介绍了Gemini Robotics 2的技术架构、关键能力、实验评估与安全设计,具备研究发布所要求的明确问题定义、方法依据和局限分析。对机器人学、具身AI、多模态模型及安全领域的研究者和工程师有直接参考价值,其多模型协作和快速适应新形态的技术思路可迁移到相关工程实践。

技术文章NVIDIA Technical Blog

Integrate NVIDIA Omniverse RTX Sensor Simulation Into Existing Apps

文章介绍NVIDIA CTK Sensor RTX Python API,该独立安装包允许开发者在现有应用中集成基于物理的RTX传感器模拟功能,生成带标签的合成数据,如摄像头图像、激光雷达点云和雷达数据,用于感知AI训练与测试。文中通过代码示例展示配置传感器与环境、渲染数据、应用颜色映射、生成实例分割掩码和深度图等关键步骤。方案无需完整Omniverse套件,支持自定义OpenUSD场景、SimReady资产或导入自有数据,但要求系统配备NVIDIA RTX GPU并限定于物理精确渲染任务。适用于希望在现有工具链中嵌入传感器模拟的机器人、数字孪生和自动驾驶工程师。

该文提供了将RTX传感器模拟集成到非Omniverse应用的实用API和完整示例,技术细节清晰,直接支撑合成数据生成工作流。对计算机视觉、机器人及自动驾驶领域的开发者,能显著降低独立环境搭建的成本,迁移价值高。

科研议题NVIDIA Technical Blog

How to Evaluate General-Purpose Robot Policies for Real-World Deployment

文章聚焦机器人基础模型在真实世界部署中的评估难题,指出当前评估基准往往脱离实际环境,无法可靠衡量通用策略的性能。作者系统梳理了评估面临的挑战,包括任务多样性、环境动态性、安全约束和策略鲁棒性等维度,并提出一种结合仿真与真实测试的评估框架。该框架强调基准设计需贴近真实部署场景,并融入可重复性和可迁移性考量。文章还讨论了评估指标的选择和不同评估方法的适用边界,为机器人策略从实验室走向实用化提供了方法论参考。

推荐收录,因为它直面机器人策略评估这一核心瓶颈,不是简单罗列基准,而是从真实部署需求出发,剖析现有方法的局限并提炼系统性评估思路。对从事机器人学习、AI系统评估和自动驾驶等领域的工程与研究读者,文中的挑战分解与框架设计可直接启发实验设计,并能迁移到其他具身智能系统的可靠性验证中。

科研议题Amazon Science

Amazon and University of Michigan give robots a sense of touch

文章提出一种名为 HydroShear 的触觉仿真方法,在现有水弹性接触模型中增加路径依赖的力追踪机制,从而准确模拟剪切力,用于训练机器人灵巧操作策略。该方法通过采集真实传感器数据校准关键参数,并支持 GPU 并行,能以低成本在仿真中大规模训练强化学习策略。在四个接触密集型任务上,仿真训练的策略直接部署到真实机器人,平均成功率达 93%,远超简化力近似和基于学习的基线方法。实验表明,精确模拟触觉剪切对于需要感知滑动、对准和接触力的任务至关重要。当前方法基于 GelSight 视觉触觉传感器,未来可扩展到更高分辨率或其他触觉模态。

本文详细阐述了一种新颖的触觉仿真方案,提供从问题建模、参数校准到真机验证的完整技术链路,实证结果扎实。适合从事机器人灵巧操作、仿真到真实迁移或强化学习应用的研究者和工程师阅读。其路径依赖力追踪的设计思想和低成本训练范式,对开发类似触觉感知系统具有明确的借鉴价值。

科研议题美团技术团队

LARYBench 发布:定义具身动作表征 ImageNet,首次度量从人类视频学习的泛化表征

这篇文章介绍了 LARYBench,一个面向具身智能隐式动作表征的系统化评测基准,试图解决“人类视频如何转化为机器人可用动作表征”这一长期存在的评测空白。文章详细定义了本体动作、原子语义动作和复合语义动作三层任务,构建了覆盖多视角、多本体、多场景的大规模数据集,并通过浅层探测头分别评估表征的回归和分类能力。实验结果显示,通用视觉基础模型在动作泛化和控制精度上整体优于专门的具身动作模型,说明从大规模人类视频中学习通用动作表征是可行的,但也揭示了当前隐式动作模型在表征质量和跨本体泛化上的边界。

推荐收录,因为它不是简单的模型宣传,而是提出了一个可复用的研究基准、明确的评测协议和有辨识度的实验结论,能够长期服务于具身智能与视觉表征研究。对关注机器人学习、视频表征和基准设计的读者来说,这篇内容具有很强的参考价值和方法迁移价值。