Google DeepMind 发布 Gemini 4 Argon 前沿模型,输出 token 上限提至 1M
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将陆续提供给开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 的评测成绩与内部落地数据,可据此判断前沿模型在长周期工程与网络安全任务上的进展。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将陆续提供给开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 的评测成绩与内部落地数据,可据此判断前沿模型在长周期工程与网络安全任务上的进展。
AWS 官方博客演示如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例自带的 NVIDIA L4 上运行开源音乐生成模型 ACE-Step,20 秒 48kHz 立体声渲染约 9 秒。
推荐理由:文章给出三智能体共享 GPU 实例视频/音频流水线的完整代码与踩坑点,可迁移到其他长时任务编排。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统在 CoreWeave Cloud 上线,并搭配 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该平台、支撑 Devin 的客户。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,定位为 GPT-6 Sol 的升级版,面向智能体编码、computer use 与专业工作负载提供更强推理能力。
推荐理由:材料给出 GPT-6.1 Sol 在 Bedrock 上线后的能力定位与成本对比,读者可据此判断强推理模型的落点。
亚马逊 AWS 发布 Amazon Quick 提示词工程基础指南(Part 1),给出跨组件通用的提示词设计原则与可复用框架。文章涵盖清晰具体、业务上下文和示例教学等核心原则,以及用于复杂请求的 CRISPE 框架,Part 2 将讲解 Research、Flows、Sight、Chat Agents 和 Action Integrations 的组件专属技巧。
AWS 发文拆解 Amazon Quick 各组件如何解读提示词,并给出对应写法。Quick Research 需明确目标、受众与范围,自行拆解子问题并收窄数据源;Quick Flows 要写清时间、数据源与输出格式,复杂逻辑用编号步骤,并可在 agentic runtime 中对话式微调;Quick Sight 的查询需含业务问题、指标、维度和可视化偏好。
AWS 展示了一套合同智能平台架构:AI 智能体从合同 PDF 中提取八个关键字段并给出置信度,由较轻量的 Claude Haiku 智能体独立复核,签名识别分歧时交由 Amazon Textract 用计算机视觉确定。核验结果写入 Amazon Aurora PostgreSQL,用户可通过嵌入仪表板和自然语言对话查询合同组合级聚合数据与单份合同细节,典型条件下单份合同处理只需数秒。
Hugging Face 发布论文 ProvenanceGuard,一个针对 MCP 智能体的生成后验证层,可识别"跨源混淆"——事实真实但被归到错误来源的答案。
OpenAI 发布 DevDay 2026 回顾,汇总了 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者构建者的新工具。
OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、电脑操作和专业工作,接近 Astra 的智能水平。其标准 API 输入和输出 token 价格为 Astra 的五分之一。
推荐理由:官方公布 GPT-6.1 Sol 的定位与定价,读者可据此判断它在编码和电脑操作上的价格取舍。
OpenAI 发布 dots,一种可跨复杂项目和日常任务持续推进工作的主动式助手。官方称 dots 让用户在工作推进过程中仍保持掌控。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置提供,并支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度成本权衡,可供工程选型参考。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、多数任务单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作,如告警首响应、智能体常驻监控、SQL 生成、UI/UX 测试和 IDE 内快速编码。
推荐理由:官方给出 Sonnet 5.5 的定位、适用任务和与 Opus 5.5 的分工,可据此判断该把哪些工作交给它。
AWS 介绍基于 Amazon Nova Act 和 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 依赖的 DOM 选择器,UI 变化时无需改脚本。
NarrateAI 在 Amazon Bedrock 上落地五项质量保障技术,为 4,000 多名 AWS 高管提供实时数据问答,数值准确率约 99%。这五项技术分别是自适应流水线编排、跨账号多模型故障转移、实时流式评估、复合评估框架和数据准确性校验;其中约 90% 的查询走单次快速路径,仅约 10% 超出上下文窗口的复杂查询触发并行批处理。
Ringg 借助 GPT-5.6 让 AI 智能体处理最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页等多语言场景。相比 GPT-4.1,其成本降低 90%。
Airbnb 正在扩大工程团队对 GPT-6 Astra 及 OpenAI 前沿模型的接入,用于排查 bug、设计系统和加快交付。该举措旨在让更多工程团队借助这些模型提升开发效率。
Parallel 的智能体借助 GPT-6 Astra 完成劳动力市场数据的检索与综合,相比此前模型将时间和成本各降低一半。
NVIDIA 提出把 AI 安全当作工程问题来对待:Agent 栈从模型、harness 到运行时环境每一层都需有可执行的边界、明确责任人和验证证据。其开源的 NVIDIA OpenShell 提供策略在 Agent 触及范围之外强制生效的安全运行时,并支持沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。
V7 使用 GPT-5.6 处理分散的公司文件,将其转化为智能体可用的上下文,以完成复杂的、可溯源到来源的工作,同时成本降低 78%、准确率提升。
OpenAI 发布 Astra for Law,为法律行业提供前沿智能,支持律所自定义工作流、连接法律数据源,并针对保密客户工作提供法律级管控。该产品名为 OpenAI for Law。
OpenAI 推出 AI 驱动的广告体验,其中包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,用一年英国逐小时污染模拟数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 单节点八卡上仅用两天完成训练并一次成功。
Salesforce 在 Dreamforce 上发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 在后训练阶段基于近三十年企业 CRM 部署的专有合成数据集构建,采用监督微调与 NVIDIA NeMo RL、NeMo Gym、NeMo AutoModel 的强化学习。
Hugging Face 发布 altk-evolve 的"一致性指南"(consistency guidelines),配合 Consistency Analyzer 定位 Agent 决策中易翻转的步骤。
Fyxer 基于 OpenAI 模型构建 AI 行政助理,结合微调、记忆能力与真实用户反馈,帮助用户整理收件箱并按每位用户的语言风格起草邮件。
Perplexity 用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,对模型的检查频率远低于早期模型。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户可用自然语言连接公司数据、挖掘洞察并构建交互式仪表盘。该功能面向所有用户开放,让数据分析和可视化不再依赖专业工具或技能。
OpenAI 发布 ChatGPT for Financial Services,内置金融数据并整合 GPT-6 Astra,用于研究、建模和生成面向客户的材料。原文仅给出这一句产品说明,未披露定价、上线时间或具体数据来源。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于编排、长时间运行的会话和工具调用,让开发者构建并上线云端智能体。
推荐理由:原文给出了 Agents API 的托管定位与 Codex harness 支撑,读者可据此判断云端智能体的构建方式。
OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上有提升,同时支持自定义音色和电话语音(telephony)接入。
推荐理由:OpenAI 把全双工语音对话开放到 API,开发者可据此评估实时语音应用的改造路径。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 水库模拟器迁移到 C++,该代码库没有测试套件,也没有集中文档。做法是先搭数值一致性校验框架,用自研 parser 生成调用树并让上百个智能体借助 Mistral OCR 归档散落文档,再以 coder、tester、reviewer 加人工检查点的结构化工作流逐模块迁移。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备更强的推理能力、计算机操作能力,以及更强的写作与设计判断力。
推荐理由:OpenAI 官方发布面向企业场景的新一代模型,读者可据此了解其在推理与计算机操作上的定位。
GitHub Copilot 在 CLI 中通过 /experimental 开放 Project HydraFusion 研究预览,用户在 /model 中选择后由运行时编排多模型完成任务。
推荐理由:GitHub Copilot 官方给出多模型编排研究预览的三种执行模式与三个基准的成本质量数据,可据此判断路由策略的取舍。
GitHub Copilot app 支持同时运行多个 AI 智能体会话,每个会话运行在独立的 Git worktree 上、彼此互不干扰,并各自保留上下文,可随时切换而无需重新解释任务。会话视图中每张卡片显示任务标题和智能体完成进度,用户可在同一项目上并行推进多项任务,把时间花在审查和决策上。官方建议先从两个小任务同时开始试用。
Hugging Face 发布 funes,一个为编码智能体提供持久记忆层的开源工具,支持 Claude Code、Codex、pi 和 Hermes。它用单条命令安装,通过本地嵌入与重排把历史会话索引成本地 Lance 数据集,并可按需发布为默认私有的 Hugging Face 数据集,让不同智能体跨机器召回彼此推理过程。
推荐理由:funes 把聊天记录变成可检索的本地记忆层,读者可据此判断跨智能体协作的落地方式。
Google DeepMind 推出 Fairwind Program 有限访问计划,向 Google Cloud 客户、政府机构和网络安全伙伴开放其最先进的网络防御能力。
推荐理由:官方披露 Fairwind 计划的能力组合与准入范围,读者可据此判断前沿网络防御能力的开放节奏。
Google DeepMind 发布 Gemini 3.8 系列,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,二者共用同一底层智能。
推荐理由:官方给出了两款 Gemini 3.8 Flash 的评测成绩与定价,可对照 3.7 Flash 判断智能体编码与网络安全任务上的取舍。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,并在 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 开放公开预览。
推荐理由:原文给出两个 API 的延迟与 WER 数字,读者可据此比较它相对上一代 Chirp 3 在实时语音场景的可用性。
Google 发布研究原型 AgentHands,可将 LLM 的高层推理映射为与语音同步的 XR 手势,让智能体在真实空间中边讲解边指向物体。系统包含环境感知、手势事件库和手势嵌入推理,并已在 Android XR 上演示兰花养护、3D 打印机操作等场景。12 人用户研究显示,相比纯语音基线,空间定位效果显著提升。