Google Research 提出 SensorFM:面向可穿戴健康数据的通用智能与接口
Google Research 提出 SensorFM,一个直接从人群规模无标注可穿戴数据中学习的大型传感器基础模型,在超过一万亿分钟多模态传感器信号上预训练,数据来自五百万名知情同意的参与者。
推荐理由:SensorFM 用一万亿分钟无标注穿戴数据预训练,读者可了解单个生理表征如何跨多类健康任务迁移。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google Research 提出 SensorFM,一个直接从人群规模无标注可穿戴数据中学习的大型传感器基础模型,在超过一万亿分钟多模态传感器信号上预训练,数据来自五百万名知情同意的参与者。
推荐理由:SensorFM 用一万亿分钟无标注穿戴数据预训练,读者可了解单个生理表征如何跨多类健康任务迁移。
Hugging Face 与 Cerebras 联合演示了一条实时语音到语音流水线,采用开源可替换的级联架构。语音识别用 Nvidia 的 Parakeet,语言模型用 Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,文本转语音用 Alibaba 的 Qwen3TTS。
推荐理由:Hugging Face 与 Cerebras 联合演示开源语音到语音流水线,读者可了解各层组件如何组合与何处替换。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:同属 Nano Banana 家族的三档模型首次给出速度、成本与质量的分工定位,可作为选型参照。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:TabFM 把零样本思路带到表格分类与回归,读者可据此了解免训练预测在企业数据场景的落地方式。
Google Research 发布一种将多 Token 预测(MTP)改造到已冻结的 Gemini Nano v3 上的新架构,已在 Pixel 9 和 10 系列上线。
推荐理由:读者可以看到冻结主干加 MTP 头的架构取舍,以及它在 Pixel 端侧推理上的速度与内存收益。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型提供。
推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主 Flash 模型,读者可据此了解智能体跨平台操作的能力与安全设计。
Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。
推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款可自动识别 70 多种语言并做近实时语音到语音翻译的音频模型,能保留说话人的语调、节奏和音高,并持续生成语音、始终比说话人慢几秒。
推荐理由:官方给出 70+ 语言、流式连续翻译与多渠道开放的细节,读者可据此判断实时语音翻译的可用边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的无编码器多模态模型,视觉与音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型的表现,同时总内存占用不到其一半,并首次在中等规模 Gemma 中支持原生音频输入。
推荐理由:原文给出无编码器架构的视觉与音频直连设计和 16GB 显存本地运行门槛,可据此判断端侧多模态智能体的落地条件。
Google Research 在 Nature 发表论文,提出研究系统 PHRM,利用手机前置摄像头在面部解锁后的数秒内拍摄视频,在后台估计心率与每日静息心率。
推荐理由:Google 用手机前摄在日常解锁后被动测心率,读者可据此判断摄像头健康监测的可行性与肤色公平性进展。
Google 宣布将基于 Gemini 的科研工具 Empirical Research Assistance(ERA)开放给科学家使用,并推出由 ERA 和 AlphaEvolve 构建的 Computational Discovery,通过 Gemini for Science 逐步开放访问。
推荐理由:原文给出 ERA 在 Nature 发表后的八篇应用论文与 Computational Discovery 的开放入口,便于判断科研智能体的实际落地边界。
Google DeepMind 推出 Gemini Omni 系列,首个模型 Gemini Omni Flash 可组合图像、音频、视频和文本输入,生成并对话式编辑高质量视频。
推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。
Google 扩大内容透明度与验证工具,把 SynthID 的图像、视频和音频验证从 Gemini 应用扩展到 Search,并将在未来数周进入 Chrome。
推荐理由:原文给出了内容溯源工具从 Gemini 扩展到 Search 和 Chrome 的路径,读者可据此判断合成内容核验的可用范围。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度 80%,三天前升至接近 100%。
推荐理由:读者可以看到 WeatherNext 在真实飓风预报中同时预测路径与强度的表现,以及 NHC 年度验证报告的对比结论。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,这是一个基于 Gemini 构建的多智能体 AI 系统,能够迭代地生成、辩论并演化针对复杂科学问题的新假设。
推荐理由:Nature 论文与多智能体架构细节同时公开,读者可据此了解假设生成类科研智能体的具体设计与落地方式。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,覆盖科研与基础设施优化。
推荐理由:官方汇总了 AlphaEvolve 在基因组、电网、TPU 与商业客户上的落地数据,可据此判断编码智能体的跨领域迁移空间。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下参与患者诊疗的三人协作模式。在 98 条真实初级保健问题的盲评中,该系统 97 例无关键错误,优于医生常用的两个 AI 系统;与哈佛、斯坦福合作的 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但识别危险信号和指导关键体格检查仍不如专家。
推荐理由:Google DeepMind 的医疗智能体研究给出了盲评、随机仿真等量化结果,可了解 AI 与医生协作的当前边界。
Google Photos 的 Auto frame 新增一项自动重构图能力,将照片理解为 3D 场景并自动调整相机位置与焦距,从而改变视角。该方法分两步:先用内部 3D 点图估计模型还原人体与人脸并推算原始焦距,再用生成式潜扩散模型补全换视角后露出的空白区域。该功能现已上线,只处理含人物的合格照片,重构图版本作为 Auto frame 候选中的第二个方案,一步即可应用。
推荐理由:Google Photos 把拍照后的视角问题交给 3D 估计加扩散补全处理,读者可了解这套两阶段方法如何改变自动修图流程。
Google DeepMind 发布新论文提出 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为相互解耦的计算岛屿并以异步数据流连接,从而隔离局部硬件故障。
推荐理由:原文给出跨数据中心异步训练的低带宽与容错实测数据,读者可据此判断分布式预训练的工程可行边界。