Destro AI 用智能层让机器人与人类协同一体
Destro 结束隐身并以 800 万美元种子轮融资亮相,它不做机器人本体,而是构建 AI 智能层,让机器人也能指挥人类工人在物流场景中协同作业。该方案基于开源权重视觉-语言-动作模型的 Vision 操作系统,由 Mothership 系统统一调度人、货架与卡车,已在 Yusen Logistics 试点,正扩展至 26 台机器人并启动新试点。
Destro 结束隐身并以 800 万美元种子轮融资亮相,它不做机器人本体,而是构建 AI 智能层,让机器人也能指挥人类工人在物流场景中协同作业。该方案基于开源权重视觉-语言-动作模型的 Vision 操作系统,由 Mothership 系统统一调度人、货架与卡车,已在 Yusen Logistics 试点,正扩展至 26 台机器人并启动新试点。
AMD 以 82 亿美元收购 World Labs,后者由李飞飞创立,专注空间智能。World Labs 近期发布 Atlas,这是一种从零训练的 omni 模型架构,能从 2D 图像输入预测新视角,性能超过专用模型,解决了计算机视觉中长期存在的稀疏重建问题,潜在应用覆盖机器人仿真、设计工程、科学等领域。
Import AI 第 474 期聚焦三项进展。Michael Levin 提出“柏拉图思维空间”假说,认为心智与身体的关系如同数学模式与其引导的形态发生结果,并借 xenobots、anthrobots 等实验加以论证。同期内容还包括 TPU 上太空,以及智谱启动外层 RSI 循环。
特斯拉在得州和加州工厂让工人穿特制动作捕捉服为 Optimus 人形机器人采集训练数据,部分工人因担心最终被机器人取代而抵触,特斯拉随后把数据采集转交给专门团队并设立"训练中心"。
NVIDIA 推出 Halos,称其为首个也是唯一的物理 AI 全栈安全系统,覆盖设计、验证与部署各层。
Google 发布研究原型 AgentHands,可将 LLM 的高层推理映射为与语音同步的 XR 手势,让智能体在真实空间中边讲解边指向物体。系统包含环境感知、手势事件库和手势嵌入推理,并已在 Android XR 上演示兰花养护、3D 打印机操作等场景。12 人用户研究显示,相比纯语音基线,空间定位效果显著提升。
Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,作为高层大脑负责对话、理解物理世界并规划多步任务,再交由底层 VLA 模型执行动作。
推荐理由:官方给出进度分类、时刻定位与多机协作的量化结果,可对照上一代了解具身推理的实际提升幅度。
Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,首次实现对人形机器人从脚到指尖的全身控制。
推荐理由:官方给出了全身控制、22 自由度手部操作与多机器人协作的能力边界,并说明首个具身推理模型已开放入口。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,每帧潜变量最少只需 2 步去噪。
Hugging Face 发布开源系统 Grabette,用手持夹爪在几分钟内录制操作任务,并自动转换为可训练的 LeRobot 数据集。Grabette 配备广角鱼眼相机与 RGBD 相机,硬件 BOM 成本约 490€,配套的机器人夹爪 Gripette 成本约 120€,硬件、采集软件、处理流程均已开源。
推荐理由:原文给出了一套低成本采集操作数据的完整开源方案,读者可以据此了解机器人学习数据瓶颈的另一种解法。
Mistral AI 发布 Robostral Navigate,这是其首个面向具身导航的 8B 模型,仅凭单张 RGB 图像和自然语言指令即可让机器人自主导航,无需 LiDAR 或深度传感器。
推荐理由:原文给出单 RGB 相机实现具身导航的基准数据和训练方法,读者可了解紧凑模型如何完成复杂导航任务。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、一批新 VLA(GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:原文给出世界模型策略、奖励模型 API 与六套仿真基准的完整清单,读者可据此判断机器人学习闭环的现状与可用入口。
Google DeepMind 推出为期三个月的 Accelerator: Robotics 项目,从欧洲选出 15 家早期机器人初创公司,提供技术指导并开放 AI 技术栈与 Gemini 机器人模型。
Google DeepMind 为实验性原型 Project Genie 上线 Street View grounding 能力,用户可选取美国境内真实地点并叠加“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格,再描述角色生成可交互世界,该能力由 Maps Imagery Grounding 技术支持。
Google DeepMind 推出 Gemini Robotics-ER 1.6,定位为机器人的高层推理模型,强化空间推理与多视角理解,可通过 Gemini API 和 Google AI Studio 供开发者使用。