Google Research 将 Heat Resilience 反照率数据扩展至 50+ 全球城市
Google Research 将建筑级屋顶反照率数据集从 2024 年试点的 14 座城市扩展至 50+ 全球城市,并同步上线高分辨率 Heat Resilience Earth Engine App。
Google Research 将建筑级屋顶反照率数据集从 2024 年试点的 14 座城市扩展至 50+ 全球城市,并同步上线高分辨率 Heat Resilience Earth Engine App。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:同属 Nano Banana 家族的三档模型首次给出速度、成本与质量的分工定位,可作为选型参照。
Dharmam AI 解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,指出专业化是有限资源下的必然结果。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:TabFM 把零样本思路带到表格分类与回归,读者可据此了解免训练预测在企业数据场景的落地方式。
Every Eval Ever(EEE)与 Hugging Face Community Evals 实现互通,评测结果可以跨平台发布并互相解读。EEE 的标准化 JSON 记录可与 Community Evals 的 YAML 结果对接,提交后分数会显示在模型页和基准榜单上,并带有指向完整 EEE 记录的来源徽章。
Google Research 发布一种将多 Token 预测(MTP)改造到已冻结的 Gemini Nano v3 上的新架构,已在 Pixel 9 和 10 系列上线。
推荐理由:读者可以看到冻结主干加 MTP 头的架构取舍,以及它在 Pixel 端侧推理上的速度与内存收益。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存占用降 15.5%、缓存未命中仅增 5.5%、总拥有成本降约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时回退到 LRU 策略,无需按峰值需求预分配内存。论文已在 CIDR 发表。
Google Research 在 COLM 2026 论文《Thinking to Recall》中提出,让 LLM 生成推理轨迹能解锁原本无法触及的参数化事实,且这一效应在简单单跳问题上同样成立。研究用 Gemini-2.5 Flash/Pro 和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上对比推理开关,识别出计算缓冲与事实启动两种机制。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主 Flash 模型,读者可据此了解智能体跨平台操作的能力与安全设计。
Mistral AI 宣布 Connectors 多项新能力:管理员可按 workspace 或组织设置连接器访问、逐工具开关,带连接器作用域的 API key 和服务账号防止自动化任务冒用身份,多账号连接器支持一个连接器绑定多个账号,Connectors Debugger 处于公开预览,可对 MCP 连接做 11 步根因分析。
推荐理由:从权限管理、密钥作用域到连接调试,这组功能给出了企业级智能体接入外部数据的治理路径。
Mistral 发布文档解析模型 OCR 4,在提取文本之外新增边界框、区块分类和内联置信度评分,支持 170 种语言并可单容器自托管部署。官方称独立标注者在 600+ 份、12+ 种语言的文档对比中平均 72% 情况下更偏好 OCR 4,该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07。
推荐理由:Mistral OCR 4 在文本框选、区块分类和自托管上的变化,让文档解析可直接进入 RAG 与智能体管线。
Google DeepMind 正与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,基于 Gemini 共同开发 AI 规划原型工具,目标将房屋规划申请审批时间缩短 50%。
Google Research 发布矢量化数据集,把此前 Farmscapes 2020 中像素化的英国树篱、石墙和树丛转成可直接用于土地规划与碳核算的矢量清单。
Google DeepMind 推出 AI Control Roadmap,用纵深防御思路保障内部部署的 AI 智能体安全,即便模型对齐不完美也能提供保障。该框架将不可信智能体视为"内部威胁",借鉴 MITRE ATT&CK 拆解攻击手法,并用可信 AI 监督工作智能体的推理与行动。团队已分析 100 万个编码智能体任务,并为 Gemini Spark 智能体搭建实时监控,防范数据误删等问题。
Google Research 公布多项皮肤科 AI 研究,其中发表于 JAMA Dermatology 的大规模调查显示,2,345 名参与者借助 AI 工具猜测皮肤状况名称的准确率从对照组的 8% 提升至 23%,"Wizard of Oz"组为 36%。
加州大学圣地亚哥分校在 Google 支持下,将退役智能手机的主板拆出组成集群,部署一个由 2000 台 Pixel 手机搭建的数据中心,为数百名研究者与学生提供低成本、低碳的云计算。研究显示 25-50 台手机约等于一台现代服务器,20 台手机的小型集群已能支撑 75 人以上课程的评分负载,且延迟低于 AWS 默认后端。该系统预计 2026 年秋季全面上线。
Google 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘:通过相对距离检验判断模型分布更接近安全重训模型还是原始受损模型。该框架基于 f-divergence,支持 Chi-squared、KL 和 Hockey-stick 散度,并用核正则化高效估计高维数据差异,自动选择散度与超参数、无需样本切分。
Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。
推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA,并在 Google.org 支持下发起最高 1000 万美元的多智能体 AI 安全研究资助征集,面向全球研究者开放。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款可自动识别 70 多种语言并做近实时语音到语音翻译的音频模型,能保留说话人的语调、节奏和音高,并持续生成语音、始终比说话人慢几秒。
推荐理由:官方给出 70+ 语言、流式连续翻译与多渠道开放的细节,读者可据此判断实时语音翻译的可用边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的无编码器多模态模型,视觉与音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型的表现,同时总内存占用不到其一半,并首次在中等规模 Gemma 中支持原生音频输入。
推荐理由:原文给出无编码器架构的视觉与音频直连设计和 16GB 显存本地运行门槛,可据此判断端侧多模态智能体的落地条件。
Google DeepMind 推出为期三个月的 Accelerator: Robotics 项目,从欧洲选出 15 家早期机器人初创公司,提供技术指导并开放 AI 技术栈与 Gemini 机器人模型。
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果:使用 Gemini Guided Learning 的学生数学成绩比对照组提升 +0.258 个标准差,约相当于常规学习 1.2 至 1.7 年的进度,若教师将 Gemini 融入约一半课程,提升可达约 1.8 至 2.5 年。
Google 在 Gemini Enterprise Agent Platform 上线基于 Agentic RAG 的 Cross-Corpus Retrieval,用多智能体协作处理多源、多跳查询。相比标准 RAG,该框架在事实性数据集上准确率最高提升 34%,并新增 Sufficient Context Agent,在信息不足时判断缺口并持续检索,而非直接给出不完整答案。
Google Research 在 Nature 发表论文,提出研究系统 PHRM,利用手机前置摄像头在面部解锁后的数秒内拍摄视频,在后台估计心率与每日静息心率。
推荐理由:Google 用手机前摄在日常解锁后被动测心率,读者可据此判断摄像头健康监测的可行性与肤色公平性进展。
Google Research 在 GitHub 上以 Apache 2.0 许可证开源其水文建模框架,让各国气象与水文机构能把 AI 洪水预报集成进自身工作流。
Google Research 在 I/O 2026 发布 Gemini for Science,一套与 Google Cloud、Google DeepMind。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,同时保证对专有数据和 IP 的控制。
推荐理由:Mistral 一次性公布工业工程 AI 栈、统一智能体 Vibe 与自建 10 MW 推理数据中心,可据此观察其企业级全栈布局。
Mistral 将 Le Chat 更名为 Vibe,定位为同时覆盖工作与编码的统一 AI 智能体,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 更名并统一为工作与编码两种模式的智能体,读者可据此判断企业办公与编码流程的整合路径。
Mistral AI 发布公开预览版 Search Toolkit,这是一个用于构建 AI 应用生产级检索管线的可组合框架,开源且支持云端、本地和边缘部署,将摄取、检索与评测统一到共享接口下。
Google 公布一套面向私有分析的零信任聚合新方案,用新型密码学聚合协议保护用户数据,设备只需发送单条消息、无需多轮在线交互,Google 只能得到匿名化的群体聚合结果。该方案将密码学层与 TEE 结合,在硬件保护失效时数据仍不会被还原,并借助 TEE 远程证明向参与者验证协议按公开代码正确执行。
Mistral 宣布将 Emmi AI 团队并入公司,推出物理 AI 能力,用数据驱动模型从几何与边界条件直接预测物理场,单次前向推理在单 GPU 上以秒级完成,而不是传统 CFD/FEM 的数小时到数周。
推荐理由:Mistral 把物理仿真做成企业平台的一层能力,并给出合作伙伴与适用行业,可用于判断工业 AI 落地路径。
Mistral 已收购 Emmi AI,并将其工作纳入自身,专注为航空航天、汽车、半导体和能源等行业构建基础 Physics AI。双方此前发布的成果包括 AB-UPT——可在单张 GPU 上处理 900 万表面单元与 1.4 亿体积单元的原始几何、无需重新划分网格,以及首个端到端深度学习代理模型 NeuralDEM。
Mistral AI 宣布已就收购 Physics AI 公司 Emmi AI 达成最终协议,以强化其面向工业企业的 AI 转型能力。Emmi AI 成立于奥地利,专注 Physics AI 并开发大型工程模型,可实现实时仿真、替代多日计算并构建数字孪生;其 30 多名研究人员与工程师将在 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 收购 Physics AI 公司 Emmi,说明其正把物理建模能力与工程工具接入纳入工业 AI 路线。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 密集架构模型,在 SWE-Bench Verified 上得分 77.6%,以修改版 MIT 许可证开放权重,API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。
推荐理由:Mistral Medium 3.5 以 128B 密集架构开源并成为 Vibe 与 Le Chat 默认模型,读者可据此判断云端异步编码智能体的可用性。
Mistral 在 Studio 发布 Connectors,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型与智能体调用,该功能处于 Public Preview。
推荐理由:官方给出连接器在 Studio 中的注册、直接调用与人审流程,读者可据此判断企业工具接入方式的变化。
Google DeepMind 在亚太地区启动首个加速器计划,聚焦“AI for the Planet”,为期三个月,面向该地区初创公司、研究团队和非营利组织,用前沿 AI 解决自然、气候、农业、能源等问题。入选机构将获得专家指导、定制支持,以及 Google AI 专家协助把前沿 AI 和科学 AI 模型整合进其项目或产品。计划以在新加坡举办的线下训练营启动,现已开放注册意向。
Google 宣布将基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,并推出由 ERA 和 AlphaEvolve 构建的 Computational Discovery,通过 Gemini for Science 逐步开放访问。
推荐理由:原文给出 ERA 在 Nature 发表后的八篇应用论文与 Computational Discovery 的开放入口,便于判断科研智能体的实际落地边界。
Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室筛选逆转细胞衰老的基因靶点:它扫描数万篇论文并提出 20 多个新的候选遗传因子,实验室验证其中几个成功将细胞推向更年轻状态。Co-Scientist 还将原本长达六个月的筛选数据分析缩短至几天。
Google DeepMind 为实验性原型 Project Genie 上线 Street View grounding 能力,用户可选取美国境内真实地点并叠加“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格,再描述角色生成可交互世界,该能力由 Maps Imagery Grounding 技术支持。