Import AI 463:NVIDIA 打造机器人自我改进闭环、中国 1 万卡 GPU 集群与人类时代挽歌
NVIDIA 研究者发布 ENPIRE,一套让真实机器人通过自动重置、策略改进、并行评估和进化四个模块自主迭代的智能体框架,在 PushT、整理销钉、剪断扎带等任务上达到 99% 成功率。
NVIDIA 研究者发布 ENPIRE,一套让真实机器人通过自动重置、策略改进、并行评估和进化四个模块自主迭代的智能体框架,在 PushT、整理销钉、剪断扎带等任务上达到 99% 成功率。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主 Flash 模型,读者可据此了解智能体跨平台操作的能力与安全设计。
Mistral AI 宣布 Connectors 多项新能力:管理员可按 workspace 或组织设置连接器访问、逐工具开关,带连接器作用域的 API key 和服务账号防止自动化任务冒用身份,多账号连接器支持一个连接器绑定多个账号,Connectors Debugger 处于公开预览,可对 MCP 连接做 11 步根因分析。
推荐理由:从权限管理、密钥作用域到连接调试,这组功能给出了企业级智能体接入外部数据的治理路径。
Mistral 发布文档解析模型 OCR 4,在提取文本之外新增边界框、区块分类和内联置信度评分,支持 170 种语言并可单容器自托管部署。官方称独立标注者在 600+ 份、12+ 种语言的文档对比中平均 72% 情况下更偏好 OCR 4,该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07。
推荐理由:Mistral OCR 4 在文本框选、区块分类和自托管上的变化,让文档解析可直接进入 RAG 与智能体管线。
Google DeepMind 正与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,基于 Gemini 共同开发 AI 规划原型工具,目标将房屋规划申请审批时间缩短 50%。
Google DeepMind 推出 AI Control Roadmap,用纵深防御思路保障内部部署的 AI 智能体安全,即便模型对齐不完美也能提供保障。该框架将不可信智能体视为"内部威胁",借鉴 MITRE ATT&CK 拆解攻击手法,并用可信 AI 监督工作智能体的推理与行动。团队已分析 100 万个编码智能体任务,并为 Gemini Spark 智能体搭建实时监控,防范数据误删等问题。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,称"对齐尚未走上正轨",计划两三年内扩至 40-80 名全职员工,初期募资 $100–150M。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA,并在 Google.org 支持下发起最高 1000 万美元的多智能体 AI 安全研究资助征集,面向全球研究者开放。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的无编码器多模态模型,视觉与音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型的表现,同时总内存占用不到其一半,并首次在中等规模 Gemma 中支持原生音频输入。
推荐理由:原文给出无编码器架构的视觉与音频直连设计和 16GB 显存本地运行门槛,可据此判断端侧多模态智能体的落地条件。
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果:使用 Gemini Guided Learning 的学生数学成绩比对照组提升 +0.258 个标准差,约相当于常规学习 1.2 至 1.7 年的进度,若教师将 Gemini 融入约一半课程,提升可达约 1.8 至 2.5 年。
Google 在 Gemini Enterprise Agent Platform 上线基于 Agentic RAG 的 Cross-Corpus Retrieval,用多智能体协作处理多源、多跳查询。相比标准 RAG,该框架在事实性数据集上准确率最高提升 34%,并新增 Sufficient Context Agent,在信息不足时判断缺口并持续检索,而非直接给出不完整答案。
Google Research 在 I/O 2026 发布 Gemini for Science,一套与 Google Cloud、Google DeepMind。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,同时保证对专有数据和 IP 的控制。
推荐理由:Mistral 一次性公布工业工程 AI 栈、统一智能体 Vibe 与自建 10 MW 推理数据中心,可据此观察其企业级全栈布局。
Mistral 将 Le Chat 更名为 Vibe,定位为同时覆盖工作与编码的统一 AI 智能体,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 更名并统一为工作与编码两种模式的智能体,读者可据此判断企业办公与编码流程的整合路径。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 密集架构模型,在 SWE-Bench Verified 上得分 77.6%,以修改版 MIT 许可证开放权重,API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。
推荐理由:Mistral Medium 3.5 以 128B 密集架构开源并成为 Vibe 与 Le Chat 默认模型,读者可据此判断云端异步编码智能体的可用性。
Mistral 在 Studio 发布 Connectors,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型与智能体调用,该功能处于 Public Preview。
推荐理由:官方给出连接器在 Studio 中的注册、直接调用与人审流程,读者可据此判断企业工具接入方式的变化。
Google 宣布将基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,并推出由 ERA 和 AlphaEvolve 构建的 Computational Discovery,通过 Gemini for Science 逐步开放访问。
推荐理由:原文给出 ERA 在 Nature 发表后的八篇应用论文与 Computational Discovery 的开放入口,便于判断科研智能体的实际落地边界。
Google DeepMind 为实验性原型 Project Genie 上线 Street View grounding 能力,用户可选取美国境内真实地点并叠加“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格,再描述角色生成可交互世界,该能力由 Maps Imagery Grounding 技术支持。
Google DeepMind 发布 Gemini for Science,在 Google Labs 上线三个实验性原型:基于 Co-Scientist 的 Hypothesis Generation。
Google DeepMind 的 Co-Scientist 被 Calico Life Sciences 用于衰老生物学研究,帮助从混杂的文献中筛出值得验证的新假设。Calico 团队借助它提出了一条关于整合应激反应(ISR)如何受代谢调控的新假设,并借助 Co-Scientist 优化实验设计、随结果迭代。相关实验产生了对 ISR 在健康与疾病中作用具有重要意义的发现,团队计划发表结果。
爱丁堡大学 Filippo Menolascina 团队用 Google Co-Scientist 研究肝病 MASH,该系统整合肝脏生物学与药理学证据、锁定候选联合疗法并解释了药物 resmetirom 为何仅对少数合格患者有效。Co-Scientist 提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁这一假设,随后经实验验证,或为靶向双重疗法铺路。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,能够迭代地生成、辩论并演化针对复杂科学问题的新假设。
推荐理由:Nature 论文与多智能体架构细节同时公开,读者可据此了解假设生成类科研智能体的具体设计与落地方式。
Import AI 456 讨论了“激进可选性”监管思路,主张政府短期避免过度监管、同时加快建设机构、信息渠道与法律授权以应对强大 AI 带来的冲击。同期介绍了 Meta 与 KAIST 的 Neural Computers 论文,提出用神经计算机在学习的运行时状态中统一计算、内存与 I/O。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,覆盖科研与基础设施优化。
推荐理由:官方汇总了 AlphaEvolve 在基因组、电网、TPU 与商业客户上的落地数据,可据此判断编码智能体的跨领域迁移空间。
Import AI 作者认为,到 2028 年底前出现"无需人类参与的 AI 研发"(能自主构建后继模型的 AI 系统)的概率超过 60%,但预计 2026 年内不会发生,一两年内或先看到非前沿模型端到端训练后继模型的概念验证。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下参与患者诊疗的三人协作模式。在 98 条真实初级保健问题的盲评中,该系统 97 例无关键错误,优于医生常用的两个 AI 系统;与哈佛、斯坦福合作的 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家。
推荐理由:Google DeepMind 的医疗智能体研究给出了盲评、随机仿真等量化结果,可了解 AI 与医生协作的当前边界。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,用于把 AI 流程从概念验证推进到生产,ASML、ABANCA、CMA-CGM、France Travail 等组织已用它自动化关键流程。
推荐理由:原文给出 Workflows 的持久化执行、可观测与人审暂停机制及已落地客户,便于判断企业级 AI 编排如何从 PoC 走向生产。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作,属于其 National Partnerships for AI 计划的一部分,将在首尔办公室设立 AI Campus,面向韩国学界和研究机构开放。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中提炼高层结构化记忆的智能体记忆框架,代码已开源。
推荐理由:论文提出从成功与失败经验中提炼结构化记忆的框架,读者可了解智能体测试时自我进化的具体做法与实测增益。
Google DeepMind 与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 达成合作,推动前沿 AI 在企业级场景落地。合作三方包括:共同开发面向行业的规模化 AI 能力、让合作伙伴提前使用 Gemini 系列前沿模型并反馈优化、以及对接高层领导与客户 CEO 和董事会。目前仅 25% 的组织成功将 AI 规模化投入生产。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建多轮对话模拟环境,评估高中与大学生面向未来的技能,现以英文开放注册。该系统由 Executive LLM 动态引导对话,AI Evaluator 依据评估量表与人工专家打分,并与纽约大学合作对 188 名 18-25 岁美国测试者开展验证。
Google Research 推出 ConvApparel,一个覆盖服饰购物场景的 4000 余段、近 15000 轮人机多轮对话数据集,用于量化 LLM 用户模拟器与真实用户的真实感差距。
Google 发布两款面向学术研究流程的 AI 智能体:PaperVizAgent 负责从论文正文生成出版级图表,ScholarPeer 则自动完成论文同行评审。
Mistral AI 推出内部平台工具 Spaces CLI,可为项目脚手架、启动开发环境并部署到 staging,典型流程只需 init、dev 三条命令。它把所有交互式提问都设计成等价的 flag(如 --components、-y),因此 AI 智能体也能自主完成端到端操作。
Google 宣布 Vibe Coding XR,将 Gemini 作为创作伙伴配合其基于 Web 的 XR Blocks 框架,把自然语言直接转成具备物理感知的 Android XR 应用,耗时不到 60 秒。
Mistral AI 发布 Forge,一套让企业基于专有知识训练前沿级 AI 模型的系统。Forge 覆盖预训练、后训练和强化学习等模型生命周期阶段,支持 dense 与 MoE 架构及多模态输入,并可由 Mistral Vibe 等智能体用自然语言完成微调和调参。
推荐理由:原文给出企业用私有数据训练前沿模型的分阶段方案与多个行业落地场景,可据此判断企业自建模型的能力边界。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展 AMIE 对话诊断 AI 的前瞻性单中心可行性研究,让 100 名成人在门诊预约前先与 AMIE 进行文本问诊。
推荐理由:Google 与 BIDMC 公布 AMIE 在真实门诊的前瞻性可行性研究结果,包含安全监督、诊断准确率与患者态度变化等具体数据。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,能读取 Rails 源码文件、生成或改进 RSpec 测试并在 CI/CD 流水线中无需人工干预地运行,多个实例可并行处理不同文件。通过引入 AGENTS.md 和分类 SKILLS 文件,其质量分数从 0.68 提升至 0.74。