Google DeepMind 用 Street View 为 Project Genie 加入真实地点生成能力
Google DeepMind 为实验性原型 Project Genie 上线 Street View grounding 能力,用户可选取美国境内真实地点并叠加“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格,再描述角色生成可交互世界,该能力由 Maps Imagery Grounding 技术支持。
Google DeepMind 为实验性原型 Project Genie 上线 Street View grounding 能力,用户可选取美国境内真实地点并叠加“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格,再描述角色生成可交互世界,该能力由 Maps Imagery Grounding 技术支持。
Google DeepMind 推出 Gemini Omni 系列,首个模型 Gemini Omni Flash 可组合图像、音频、视频和文本输入,生成并对话式编辑高质量视频。
推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。
Google DeepMind 发布 Gemini for Science,在 Google Labs 上线三个实验性原型:基于 Co-Scientist 的 Hypothesis Generation。
Google 扩大内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到 Search,并将在未来数周进入 Chrome。
推荐理由:原文给出了内容溯源工具从 Gemini 扩展到 Search 和 Chrome 的路径,读者可据此判断合成内容核验的可用范围。
Google DeepMind 与新加坡政府启动国家 AI 合作,在新加坡推出多项计划,覆盖医疗与生命科学、教育及可持续发展。合作探索 AI 辅助临床的「三方照护」模式,并借助 AlphaFold、Google Earth 等工具推进东南亚传染病研究与疫情防控,Google.org 为此出资 700 万美元。
剑桥大学 Clare Bryant 教授用 Google DeepMind 的 Co-Scientist 研究流感等病原体跨物种传播引发败血症的分子机制。Co-Scientist 在未公开数据辅助下将候选靶点从蛋白质细化到具体氨基酸,团队正据此构建含氨基酸突变的细胞系验证假设。Bryant 称,原本需两到三年的精确氨基酸定位工作,若靶点正确,实验室有望在六个月内完成。
Google DeepMind 的 Co-Scientist 被 Calico Life Sciences 用于衰老生物学研究,帮助从混杂的文献中筛出值得验证的新假设。Calico 团队借助它提出了一条关于整合应激反应(ISR)如何受代谢调控的新假设,并借助 Co-Scientist 优化实验设计、随结果迭代。相关实验产生了对 ISR 在健康与疾病中作用具有重要意义的发现,团队计划发表结果。
爱丁堡大学 Filippo Menolascina 团队用 Google Co-Scientist 研究肝病 MASH,该系统整合肝脏生物学与药理学证据、锁定候选联合疗法并解释了药物 resmetirom 为何仅对少数合格患者有效。Co-Scientist 提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁这一假设,随后经实验验证,或为靶向双重疗法铺路。
Google DeepMind 的 Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关文献,将想法转化为可检验假设并按可行性排序。其最优线索指向细胞表面分子交互,促成 Raman 与波士顿儿童医院化学生物学家 Ryan Flynn 合作,结合组织模型与 RNA 图谱寻找可用于靶向 ALS 的新型 RNA 机制及潜在 RNA 药物。
Google DeepMind 的 Co-Scientist 帮助斯坦福大学医学院遗传学家 Gary Peltz 筛选可老药新用治疗肝纤维化的药物。Peltz 自己挑选的两款候选药在活体人类肝细胞测试中无效,而 Co-Scientist 提出的三款候选药中有两款阻断了纤维化并促进肝细胞再生,其中癌症药物 vorinostat 阻断了 91% 可致肝疤痕的损伤反应。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度 80%,三天前升至接近 100%。
推荐理由:读者可以看到 WeatherNext 在真实飓风预报中同时预测路径与强度的表现,以及 NHC 年度验证报告的对比结论。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,能够迭代地生成、辩论并演化针对复杂科学问题的新假设。
推荐理由:Nature 论文与多智能体架构细节同时公开,读者可据此了解假设生成类科研智能体的具体设计与落地方式。
Import AI 456 讨论了“激进可选性”监管思路,主张政府短期避免过度监管、同时加快建设机构、信息渠道与法律授权以应对强大 AI 带来的冲击。同期介绍了 Meta 与 KAIST 的 Neural Computers 论文,提出用神经计算机在学习的运行时状态中统一计算、内存与 I/O。
一篇综述分析了并行推理领域的最新进展,重点讨论自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文中梳理了自一致性、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild!
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,覆盖科研与基础设施优化。
推荐理由:官方汇总了 AlphaEvolve 在基因组、电网、TPU 与商业客户上的落地数据,可据此判断编码智能体的跨领域迁移空间。
Import AI 作者认为,到 2028 年底前出现"无需人类参与的 AI 研发"(能自主构建后继模型的 AI 系统)的概率超过 60%,但预计 2026 年内不会发生,一两年内或先看到非前沿模型端到端训练后继模型的概念验证。
Google Research 称其开源工具与开放数据集已支持全球逾 25 万名研究人员和开发者。其基因组学工具 DeepVariant、DeepConsensus、DeepPolisher 助力社区处理了 250 万人的外显子组与全基因组,医学基础模型 MedGemma 下载量超 480 万次。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下参与患者诊疗的三人协作模式。在 98 条真实初级保健问题的盲评中,该系统 97 例无关键错误,优于医生常用的两个 AI 系统;与哈佛、斯坦福合作的 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家。
推荐理由:Google DeepMind 的医疗智能体研究给出了盲评、随机仿真等量化结果,可了解 AI 与医生协作的当前边界。
Google Research 科学家正用 Empirical Research Assistance(ERA)开展真实科研:为流感、COVID-19 和 RSV 每周提交全美各州、最长提前四周的住院预测,在流感与 COVID-19 公开排行榜上处于或接近首位。
Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,用于把 AI 流程从概念验证推进到生产,ASML、ABANCA、CMA-CGM、France Travail 等组织已用它自动化关键流程。
推荐理由:原文给出 Workflows 的持久化执行、可观测与人审暂停机制及已落地客户,便于判断企业级 AI 编排如何从 PoC 走向生产。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作,属于其 National Partnerships for AI 计划的一部分,将在首尔办公室设立 AI Campus,面向韩国学界和研究机构开放。
Google Photos 的 Auto frame 新增一项自动重构图能力,将照片理解为 3D 场景并自动调整相机位置与焦距,从而改变视角。该方法分两步:先用内部 3D 点图估计模型还原人体与人脸并推算原始焦距,再用生成式潜扩散模型补全换视角后露出的空白区域。该功能现已上线,只处理含人物的合格照片,重构图版本作为 Auto frame 候选中的第二个方案,一步即可应用。
推荐理由:Google Photos 把拍照后的视角问题交给 3D 估计加扩散补全处理,读者可了解这套两阶段方法如何改变自动修图流程。
Google DeepMind 发布新论文提出 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为相互解耦的计算岛屿并以异步数据流连接,从而隔离局部硬件故障。
推荐理由:原文给出跨数据中心异步训练的低带宽与容错实测数据,读者可据此判断分布式预训练的工程可行边界。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中提炼高层结构化记忆的智能体记忆框架,代码已开源。
推荐理由:论文提出从成功与失败经验中提炼结构化记忆的框架,读者可了解智能体测试时自我进化的具体做法与实测增益。
Google DeepMind 与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 达成合作,推动前沿 AI 在企业级场景落地。合作三方包括:共同开发面向行业的规模化 AI 能力、让合作伙伴提前使用 Gemini 系列前沿模型并反馈优化、以及对接高层领导与客户 CEO 和董事会。目前仅 25% 的组织成功将 AI 规模化投入生产。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态、在状态迭代上直接加入随机性、重塑梯度三招,让基于世界模型的长时程规划更稳健。GRASP 把轨迹提升到虚拟状态,使优化可跨时间并行,同时避免经由高维视觉模型的脆弱状态输入梯度。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 合作完成。
Google Research 发布推理优先框架 Simula,将合成数据生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和 dual-critic 质量检查四个可控维度从零构建数据集,无需种子数据。
Google Research 提出神经元形态生成模型 MoGen,用点云流匹配生成合成神经元形状,加入 PATHFINDER 训练管线后使小鼠轴突重建错误率降低 4.4%,主要来自合并错误的减少。在完整小鼠脑规模下,这相当于节省 157 人年的手动校对。MoGen 已开源,论文将在 ICLR 2026 展示。
Google DeepMind 推出 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 排行榜上取得 1,211 Elo 成绩。
推荐理由:Gemini 3.1 Flash TTS 给出了 Elo 成绩、音频标签控制和多语言覆盖,可据此判断语音生成的可控性变化。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建多轮对话模拟环境,评估高中与大学生面向未来的技能,现以英文开放注册。该系统由 Executive LLM 动态引导对话,AI Evaluator 依据评估量表与人工专家打分,并与纽约大学合作对 188 名 18-25 岁美国测试者开展验证。
Google DeepMind 推出 Gemini Robotics-ER 1.6,定位为机器人的高层推理模型,强化空间推理与多视角理解,可通过 Gemini API 和 Google AI Studio 供开发者使用。
Google Research 推出 ConvApparel,一个覆盖服饰购物场景的 4000 余段、近 15000 轮人机多轮对话数据集,用于量化 LLM 用户模拟器与真实用户的真实感差距。
Google 发布两款面向学术研究流程的 AI 智能体:PaperVizAgent 负责从论文正文生成出版级图表,ScholarPeer 则自动完成论文同行评审。
Google Research 提出一套框架,用心理学问卷改写成情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见分布。
Google Research 用模拟器研究 AI 评测中「标注多少条目(N)」与「每条目标注多少人(K)」的权衡,发现常见的每条目 1、3、5 名标注者往往不够,反映人类观点细微差异常需每条目 10 名以上标注者。若只关心多数投票,增加条目更有效;若想捕捉观点分布,则必须增加标注者;在约 1000 条总标注的适度预算下,按指标选对比例即可获得高可复现结果。该模拟器已在 GitHub 开源。
Mistral AI 推出内部平台工具 Spaces CLI,可为项目脚手架、启动开发环境并部署到 staging,典型流程只需 init、dev 三条命令。它把所有交互式提问都设计成等价的 flag(如 --components、-y),因此 AI 智能体也能自主完成端到端操作。
Google Quantum AI 发布白皮书,给出破解 256 位椭圆曲线离散对数问题(ECDLP-256)的更新资源估算:两条实现 Shor 算法的量子电路。
Google 宣布 Vibe Coding XR,将 Gemini 作为创作伙伴配合其基于 Web 的 XR Blocks 框架,把自然语言直接转成具备物理感知的 Android XR 应用,耗时不到 60 秒。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区将建筑、道路等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量,可预测人口密度、房价、碳排放等指标。