NVIDIA Halos:为什么规模化部署物理 AI 需要全栈安全
NVIDIA 推出 Halos,称其为首个也是唯一的物理 AI 全栈安全系统,覆盖设计、验证与部署各层。
NVIDIA 推出 Halos,称其为首个也是唯一的物理 AI 全栈安全系统,覆盖设计、验证与部署各层。
Google 发布研究原型 AgentHands,可将 LLM 的高层推理映射为与语音同步的 XR 手势,让智能体在真实空间中边讲解边指向物体。系统包含环境感知、手势事件库和手势嵌入推理,并已在 Android XR 上演示兰花养护、3D 打印机操作等场景。12 人用户研究显示,相比纯语音基线,空间定位效果显著提升。
Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,作为高层大脑负责对话、理解物理世界并规划多步任务,再交由底层 VLA 模型执行动作。
推荐理由:官方给出进度分类、时刻定位与多机协作的量化结果,可对照上一代了解具身推理的实际提升幅度。
Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,首次实现对人形机器人从脚到指尖的全身控制。
推荐理由:官方给出了全身控制、22 自由度手部操作与多机器人协作的能力边界,并说明首个具身推理模型已开放入口。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,每帧潜变量最少只需 2 步去噪。
Hugging Face 发布开源系统 Grabette,用手持夹爪在几分钟内录制操作任务,并自动转换为可训练的 LeRobot 数据集。Grabette 配备广角鱼眼相机与 RGBD 相机,硬件 BOM 成本约 490€,配套的机器人夹爪 Gripette 成本约 120€,硬件、采集软件、处理流程均已开源。
推荐理由:原文给出了一套低成本采集操作数据的完整开源方案,读者可以据此了解机器人学习数据瓶颈的另一种解法。
Mistral AI 发布 Robostral Navigate,这是其首个面向具身导航的 8B 模型,仅凭单张 RGB 图像和自然语言指令即可让机器人自主导航,无需 LiDAR 或深度传感器。
推荐理由:原文给出单 RGB 相机实现具身导航的基准数据和训练方法,读者可了解紧凑模型如何完成复杂导航任务。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、一批新 VLA(GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:原文给出世界模型策略、奖励模型 API 与六套仿真基准的完整清单,读者可据此判断机器人学习闭环的现状与可用入口。
Google DeepMind 推出为期三个月的 Accelerator: Robotics 项目,从欧洲选出 15 家早期机器人初创公司,提供技术指导并开放 AI 技术栈与 Gemini 机器人模型。
Google DeepMind 为实验性原型 Project Genie 上线 Street View grounding 能力,用户可选取美国境内真实地点并叠加“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格,再描述角色生成可交互世界,该能力由 Maps Imagery Grounding 技术支持。
Google DeepMind 推出 Gemini Robotics-ER 1.6,定位为机器人的高层推理模型,强化空间推理与多视角理解,可通过 Gemini API 和 Google AI Studio 供开发者使用。