OpenAI 为何缺席英伟达牵头的智能体安全联盟
英伟达宣布成立由100多家公司组成的联盟,推动其 Open Agent Safety Platform 智能体安全技术,OpenAI、Amazon、Google、Apple 均未加入,而 Anthropic 是支持方。
英伟达宣布成立由100多家公司组成的联盟,推动其 Open Agent Safety Platform 智能体安全技术,OpenAI、Amazon、Google、Apple 均未加入,而 Anthropic 是支持方。
美国政府本周二上线官方 AI 聊天机器人 America.gov,由 Google 和 SpaceXAI 合作参与构建,目前较难被越狱。用户询问 Minecraft 时,它会输出约 1800 词的《End Poem》改写版,原诗由 Julian Gough 创作、在通关游戏后出现,因此并非模型幻觉。特朗普称 20 岁程序员 Edward Coristine 是该项目的首席工程师之一。
Google 母公司 Alphabet 发布新模型 Gemini 4 Argon,可处理编码、研究和写作等任务,并针对防御性网络安全工作专门训练,公司称其能自主发现、验证并修补关键软件漏洞。
Google 发布新一代前沿模型 Gemini 4 Argon,在部分关键基准上超过 OpenAI 和 Anthropic 的竞品,但并未取得明显领先。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作以及网络安全防御等复杂工作流中具备前沿性能。该模型初期只开放给一批可信网络安全防御者,Google 表示正参与美国政府的前置发布模型访问自愿流程,并将逐步扩大开放,同时强化防滥用、防提示词注入和失准监测等前沿保障措施。
Google 发布 Gemini 4 Argon,宣称在编码、知识工作和网络安全上达到业界领先性能,但目前仅限内部有限测试,外部用户尚不能使用。在软件工程评测 DeepSWE v1.1 上得分 77.9%,高于 GPT-6 Astra、Fable 5.1 和 Opus 5.5。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将陆续提供给开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 的评测成绩与内部落地数据,可据此判断前沿模型在长周期工程与网络安全任务上的进展。
美国卫生部长小罗伯特·肯尼迪在 MAHA 活动上称,特朗普政府正"让每个美国人轻松使用 AI",AI 将把人们从医生和卫生专家的"医学暴政"中解放出来,他还建议用 AI 获取医疗"第二意见"。但实测 Google Gemini 和 ChatGPT 均表示口罩和社交距离能有效减少传染病传播,与其说法相反。
特朗普周二与二十余家科技公司达成自愿协议,企业承诺实施白宫建议的管控措施,包括接受独立安全审计,审查重点涵盖网络安全、生物安全、化学威胁以及 AI 模型意外行为等风险。
Google 在 Gemini 聊天中全球上线 Skills,用详细提示词承载特定任务,用户以“/”加名称调用,并可由历史对话生成、检测到匹配提示时自动运行。Skills 格式源自 Anthropic 并以开放标准提供,支持文本文档、PDF 和图片作为参考材料,还可将多个 Skill 串联完成任务。
谷歌的 Sundar Pichai、Anthropic 的 Dario Amodei、Meta 的 Mark Zuckerberg、OpenAI 的 Greg Brockman。
美国联邦贸易委员会正就潜在消费者保护违规行为调查 OpenAI、Anthropic 等领先 AI 实验室。FTC 主席 Andrew Ferguson 计划通过具有法律约束力的“民事调查令”强制相关方移交文件并问询高管,命令预计数周内发出,调查在 Hugging Face 遭攻击事件之前就已启动。
推荐理由:从监管动作切入,可看到 AI 实验室在消费者保护与智能体责任上的合规压力如何升级。
Google 的 AI 贡献试点已吸纳约 100 家出版商,当网站内容对 AI Overview 等 Gemini 驱动的搜索结果有实质贡献时即可获得付费。但多家中小出版商反映,这笔收入仅约为其广告收入的千分之一,部分大型出版商已拒绝参与,希望以此迫使 Google 给出更优厚条件。
Google DeepMind 团队发表研究,提出给 AI 设计的蛋白质序列加上水印,通过与 ProteinMPNN 配合的 SynthIDBio 在序列中嵌入可检测信号,且不破坏蛋白质功能,用于帮助 DNA 合成方识别来自可信研究者的 AI 设计蛋白。
Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,在生物代码中嵌入不可感知的签名,使其不只在数字模型上、也能在合成出的实体蛋白质上被验证,同时保留其生物功能。
推荐理由:Google DeepMind 把水印技术从图像扩展到蛋白质与 3D 结构,读者可看到生物安全筛查的一层新验证思路。
据 The Information 报道,Google 已启动试点项目,为内容被用于 AI 搜索功能的出版方付费,约 100 家出版方参与。该试点由 Digiday 最早报道,启动不到一年,Google 按出版方内容对 AI Overviews、AI Mode 以及 Gemini 聊天机器人的贡献程度付费。
特朗普昨日宣布的“有道德约束力”AI 安全协议全文公开,正式名称为《前沿责任联合承诺》(Joint Commitment on Frontier Responsibilities)。
Google 正为 AI Overviews、AI Mode 和 Gemini 聊天机器人使用的内容向约 100 家数字出版商付费,据 The Information 报道,部分小型和中型博客获得的费用不足其广告收入的 0.1%,有小型网站数月收入不到 1000 美元,另有一家出版商几个月获得 5 万至 6 万美元,还有一家年收入超过 100 万美元。
Google Research 发布 Diffusion Controller 框架,把扩散模型的去噪过程重新定义为连续控制问题,主模型完全冻结,仅用轻量"转向阻尼"网络注入微调修正。该框架在 Stable Diffusion v1.4 上用 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持 PPO 策略梯度与奖励加权损失两种微调方式,可在不接触底层代码的情况下定制闭源模型。
Simon Willison 用 GPT-6 Astra 做出了实验性工具 Photo Scrubber,可自动识别人脸并打码,同时清除照片元数据。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,全部在本地运行。
AINews 汇总 9/24-9/25 动态,Claude Opus 5.5 本周发布后反响积极,以 88.4% 领跑 SimpleBench,并被指在生成讲解视频上表现突出。
推荐理由:汇总一周内多个模型与工具的动态,便于快速了解前沿模型在基准、成本和视频生成上的位置。
Runway 推出 GWM Worlds 2 研究预览,将高保真视频与音频生成变为实时交互式模拟,并提出 WorldPrompt 输入格式,可固定环境的部分要素(包括首帧)再生成带时间戳的事件,事件可在实时中提示。
Meta 在 Connect 2026 上把个人智能体 Muse 作为硬件加智能体战略的核心,发布相关智能体功能与新眼镜,仅预告而未发布新前沿模型。Muse 现已支持语音与实时视频,可后台持续处理任务,并将在所有 Meta 眼镜上以唤醒词激活;每台 Muse 拥有独立邮箱地址,Mac 版 Muse 支持计算机使用。
Simon Willison 用 GPT-6 Astra 开发了一个 Gemini 3.8 TTS Playground,可组合单人旁白或多说话人对话、预览音频并查看请求响应细节,设置可保存为可分享的 URL。
John Platt 在 Latent Space 播客介绍了 Google 的 Empirical Research Assistance(ERA):它用 Gemini 维护一张实验 notebook 树,并用类似蒙特卡洛树搜索的 UCB 规则挑选 notebook 进行变异,把可写成打分函数的科学问题自动化求解。
Anthropic 为 Claude Code 推出 Projects,单次对话可派生多个并行云端会话、在线程间传递上下文,用户离开后仍继续运行,本地工作流后续支持。
Steve Yegge 关停了 Gas Town,并承认每月花费数千美元订阅编码智能体,却只做出这一个项目。Databricks 向约 3500 名工程师铺开 GPT-6 Astra,表示其在复杂长周期任务上"明确"优于 Opus 5 / Sol 5.6,但整体编码支出增加约 60%。OpenAI 发布模型失准事件追踪与披露框架,并附上过去六个月的六份案例报告。
Emerald AI、Google 和 NVIDIA 宣布成立 AI 能源管理联盟(AEMA),推动数据中心根据电网状况动态调节用电。该联盟采取技术中立、基于性能的方式,聚焦响应速度、持续时间和紧急状态下的行为等可衡量指标,并要求在设施接入前明确穿越、限电与应急响应义务。
TypeSafe 发布名为 Jev 的决策模型,官方称其专为分类、路由与打分等决策任务优化,采用 RLCD 训练,比小型前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
Google DeepMind 发表论文,用 100 个基于 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,并设置公告板、私信与共享知识库三种协调方式。
Google DeepMind 推出 Fairwind Program 有限访问计划,向 Google Cloud 客户、政府机构和网络安全伙伴开放其最先进的网络防御能力。
推荐理由:官方披露 Fairwind 计划的能力组合与准入范围,读者可据此判断前沿网络防御能力的开放节奏。
Google DeepMind 发布 Gemini 3.8 系列,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,二者共用同一底层智能。
推荐理由:官方给出了两款 Gemini 3.8 Flash 的评测成绩与定价,可对照 3.7 Flash 判断智能体编码与网络安全任务上的取舍。
Google Research 发布 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化并定位全球甲烷点源,在专家标注羽流上召回率达 84%,信噪比优于现有匹配滤波方法。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出视频分析在 token、成本与准确率上的量化变化,并说明可用入口和启用方式,便于开发者评估是否迁移现有视频处理流程。
Google 发布 TimesFM-3,这是其时间序列基础模型的新一代版本,原生支持多变量预测,参数规模 3.3 亿,在超过 1 万亿个时间点的真实与合成时序语料上预训练。
推荐理由:TimesFM-3 从单变量扩展到原生多变量预测,读者可了解一次前向传播完成多序列预测的架构取舍。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供给开发者,新增场景延长、首尾帧插值、360p 快速草稿和 4K 放大等能力。
推荐理由:原文列出场景延长、首尾帧插值和 4K 放大等具体能力与价格入口,可据此判断生成视频工作流的变化。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在加密环境中,使模型无法提前接触测试题目。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。
推荐理由:DeepMind 与新加坡 AI 安全研究所等机构用加密隔离环境对 Gemini Flash Lite 做双盲评测,读者可了解基准污染之外的技术性解决路径。
Google 发布 GlucoFM,一个采用双流设计的自监督基础模型,将较慢的血糖基线趋势与短期波动分离,并保留时间与缺失信息,用潜在预测目标学习日常血糖上下文与时间演化。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,并在 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 开放公开预览。
推荐理由:原文给出两个 API 的延迟与 WER 数字,读者可据此比较它相对上一代 Chirp 3 在实时语音场景的可用性。
Google 发布研究原型 AgentHands,可将 LLM 的高层推理映射为与语音同步的 XR 手势,让智能体在真实空间中边讲解边指向物体。系统包含环境感知、手势事件库和手势嵌入推理,并已在 Android XR 上演示兰花养护、3D 打印机操作等场景。12 人用户研究显示,相比纯语音基线,空间定位效果显著提升。