跳到正文

#Google

今日 1 条
今天10月1日周四
9月30日周三
  1. Google DeepMind65

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质与结构加水印

    Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,在生物代码中嵌入不可感知的签名,使其不只在数字模型上、也能在合成出的实体蛋白质上被验证,同时保留其生物功能。

    推荐理由:Google DeepMind 把水印技术从图像扩展到蛋白质与 3D 结构,读者可看到生物安全筛查的一层新验证思路。

  2. Google Research39

    Google Research 提出 Diffusion Controller,统一并简化 AI 图像生成控制

    Google Research 发布 Diffusion Controller 框架,把扩散模型的去噪过程重新定义为连续控制问题,主模型完全冻结,仅用轻量"转向阻尼"网络注入微调修正。该框架在 Stable Diffusion v1.4 上用 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持 PPO 策略梯度与奖励加权损失两种微调方式,可在不接触底层代码的情况下定制闭源模型。

9月16日周三
9月3日周四
9月2日周三
  1. Google DeepMind71

    Google DeepMind 为 Gemini 推出智能体视频理解功能

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。

    推荐理由:官方给出视频分析在 token、成本与准确率上的量化变化,并说明可用入口和启用方式,便于开发者评估是否迁移现有视频处理流程。

9月1日周二
  1. Google Research66

    Google 发布 TimesFM-3:面向多变量预测的零样本基础模型

    Google 发布 TimesFM-3,这是其时间序列基础模型的新一代版本,原生支持多变量预测,参数规模 3.3 亿,在超过 1 万亿个时间点的真实与合成时序语料上预训练。

    推荐理由:TimesFM-3 从单变量扩展到原生多变量预测,读者可了解一次前向传播完成多序列预测的架构取舍。

8月28日周五
8月27日周四
  1. Google DeepMind62

    Google DeepMind 联合新加坡 AI Safety Institute 试点全球首个双盲 AI 评测

    Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在加密环境中,使模型无法提前接触测试题目。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。

    推荐理由:DeepMind 与新加坡 AI 安全研究所等机构用加密隔离环境对 Gemini Flash Lite 做双盲评测,读者可了解基准污染之外的技术性解决路径。

8月26日周三
  1. Google Research47

    Google 推出 AgentHands:为 XR 智能体对话生成空间化手势

    Google 发布研究原型 AgentHands,可将 LLM 的高层推理映射为与语音同步的 XR 手势,让智能体在真实空间中边讲解边指向物体。系统包含环境感知、手势事件库和手势嵌入推理,并已在 Android XR 上演示兰花养护、3D 打印机操作等场景。12 人用户研究显示,相比纯语音基线,空间定位效果显著提升。

8月22日周六
8月21日周五
8月17日周一
8月14日周五
8月12日周三
  1. Google DeepMind67

    Google DeepMind 发布手语转文本模型 SL2T,首发落地 Gboard 与 Live Transcribe

    Google DeepMind 发布手语转文本模型 SL2T,以超过 10 万小时、50 多种手语的数据训练,实现手语到文本的机器翻译。该模型首先在 Pixel 11 的 Gboard 与 Live Transcribe 中上线,支持美国手语(ASL)转英文,可用来搜索、写消息或向 Gemini 提问,更多设备和语言将后续支持。

    推荐理由:官方披露 SL2T 的训练规模、手语到文本的翻译路径与隐私处理方式,可了解手语 AI 首次落地消费产品的工程取舍。

  2. Google Research71

    Google 发布 AMIE (Video):实时视频问诊达到专家级表现

    Google Research 发布 AMIE (Video),在 Gemini 与 Project Astra 之上实现同步临床视频问诊,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。

    推荐理由:AMIE (Video) 用三智能体异步架构支撑实时视频问诊,并在 300 场随机 OSCE 研究中与初级保健医生对比,适合了解医疗多模态智能体的设计与评测方式。

8月6日周四
  1. Google DeepMind76

    Google DeepMind 开源 WeatherNext 气象模型,气旋预测多出一天预警时间

    Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到 SOTA,平均可多提供一天预报时效,三天预报精度相当于此前模型的两天水平。

    推荐理由:官方给出气旋路径与强度预测多出一天预警时间的评估结果,并同时开源模型与权重,可据此判断气象预报模型的可用边界。

7月31日周五
7月30日周四
  1. Google DeepMind60

    Google DeepMind 在 Flow Music 上线音乐生成模型 Lyria 3.5

    Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线,覆盖音乐性、歌词、人声和创作控制四方面。官方称其旋律结构更复杂自然,歌词质量与提示词遵循度提升,人声更具情感与发音准确度,同时可更简便地控制输出时长与节奏。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声和控制项上的具体变化,可用于对比上一代音乐生成能力。

7月28日周二
  1. Google DeepMind77

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,首次实现对人形机器人从脚到指尖的全身控制。

    推荐理由:官方给出了全身控制、22 自由度手部操作与多机器人协作的能力边界,并说明首个具身推理模型已开放入口。

7月23日周四
  1. Google Research44

    Google Research 用强化学习让量子计算机从错误中学习

    Google Research 在 Nature 发表研究,提出用强化学习框架让自主智能体从量子纠错检测事件中持续学习,实时调节数千个控制参数以对抗硬件漂移。在 Willow 超导处理器上,该 RL 控制将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%,把量子存储器的逻辑错误压至历史最低。

7月22日周三
7月21日周二
7月17日周五
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用 CodeMender 的方式取得与更大模型相当的表现。

    推荐理由:官方给出了新模型在真实代码库漏洞挖掘上的基准与落地案例,可据此判断轻量安全模型的能力边界。

7月16日周四
7月13日周一
7月9日周四
  1. Google Research62

    Google Research 提出 SensorFM:面向可穿戴健康数据的通用智能与接口

    Google Research 提出 SensorFM,一个直接从人群规模无标注可穿戴数据中学习的大型传感器基础模型,在超过一万亿分钟多模态传感器信号上预训练,数据来自五百万名知情同意的参与者。

    推荐理由:SensorFM 用一万亿分钟无标注穿戴数据预训练,读者可了解单个生理表征如何跨多类健康任务迁移。

7月8日周三
  1. Google Research31

    Google Research 在 10 座美国城市实验用 Google Maps 改道缓解拥堵

    Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,在 10 座美国城市开展为期六个月的实验。不足 2% 的行程收到改道建议,目标路段行驶速度中位数提升约 2%,油耗中位数下降 0.5% 至 1.0%,每座城市每年可减少数千吨 CO2e 排放。

7月3日周五
  1. Google DeepMind20

    Google DeepMind 与 A24 宣布首个研究型合作伙伴关系

    Google DeepMind 与 A24 宣布达成首个聚焦研究的合作伙伴关系,双方将围绕多个项目展开长期研发协作,让 A24 的导演直接在创作流程中参与塑造新技术。Google 同时宣布对 A24 进行投资。该合作初期目标是连接前沿技术与下一代娱乐,具体目标、技术产出和创作里程碑将随时间演变。

7月1日周三
  1. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 联合演示了一条实时语音到语音流水线,采用开源可替换的级联架构。语音识别用 Nvidia 的 Parakeet,语言模型用 Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,文本转语音用 Alibaba 的 Qwen3TTS。

    推荐理由:Hugging Face 与 Cerebras 联合演示开源语音到语音流水线,读者可了解各层组件如何组合与何处替换。