Google DeepMind 发布 Gemini 4 Argon 前沿模型,输出 token 上限提至 1M
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将陆续提供给开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 的评测成绩与内部落地数据,可据此判断前沿模型在长周期工程与网络安全任务上的进展。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将陆续提供给开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 的评测成绩与内部落地数据,可据此判断前沿模型在长周期工程与网络安全任务上的进展。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,定位为 GPT-6 Sol 的升级版,面向智能体编码、computer use 与专业工作负载提供更强推理能力。
推荐理由:材料给出 GPT-6.1 Sol 在 Bedrock 上线后的能力定位与成本对比,读者可据此判断强推理模型的落点。
OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、电脑操作和专业工作,接近 Astra 的智能水平。其标准 API 输入和输出 token 价格为 Astra 的五分之一。
推荐理由:官方公布 GPT-6.1 Sol 的定位与定价,读者可据此判断它在编码和电脑操作上的价格取舍。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置提供,并支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度成本权衡,可供工程选型参考。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、多数任务单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作,如告警首响应、智能体常驻监控、SQL 生成、UI/UX 测试和 IDE 内快速编码。
推荐理由:官方给出 Sonnet 5.5 的定位、适用任务和与 Opus 5.5 的分工,可据此判断该把哪些工作交给它。
OpenAI 启动 Codex Originals 计划征集,寻找使用 Codex 的开发者、研究者与创作者分享真实项目故事。有意者可在下方提交自己的故事与项目介绍,参与该计划下一阶段。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,更快地构建、运营并销售现代车队管理方案,销售提升 60%,节省 75+ 小时。
Cognition 借助 GPT‑6 Astra 提升 Devin 测试软件并验证其可用的能力,目标是让工程师减少代码审查、交付更多。
César de la Fuente 的实验室正用 Codex 和 ChatGPT 在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 水库模拟器迁移到 C++,该代码库没有测试套件,也没有集中文档。做法是先搭数值一致性校验框架,用自研 parser 生成调用树并让上百个智能体借助 Mistral OCR 归档散落文档,再以 coder、tester、reviewer 加人工检查点的结构化工作流逐模块迁移。
一位 MIT 研究员用 GPT-5.6 Sol 配合 Codex 自主运行量子计算实验,完成结果分析与量子比特校准。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到可投产状态,工程效率提升 21%。
GitHub Copilot 在 CLI 中通过 /experimental 开放 Project HydraFusion 研究预览,用户在 /model 中选择后由运行时编排多模型完成任务。
推荐理由:GitHub Copilot 官方给出多模型编排研究预览的三种执行模式与三个基准的成本质量数据,可据此判断路由策略的取舍。
GitHub Copilot app 支持同时运行多个 AI 智能体会话,每个会话运行在独立的 Git worktree 上、彼此互不干扰,并各自保留上下文,可随时切换而无需重新解释任务。会话视图中每张卡片显示任务标题和智能体完成进度,用户可在同一项目上并行推进多项任务,把时间花在审查和决策上。官方建议先从两个小任务同时开始试用。
Google DeepMind 发布 Gemini 3.8 系列,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,二者共用同一底层智能。
推荐理由:官方给出了两款 Gemini 3.8 Flash 的评测成绩与定价,可对照 3.7 Flash 判断智能体编码与网络安全任务上的取舍。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码与智能体场景的最强主力模型,距离 Gemini 3.6 Flash 发布仅三周。
推荐理由:Google DeepMind 公布 3.7 Flash 的基准提升与降价幅度,可据此判断它在编码和智能体工作流中的性价比。
Berkeley Sky Lab 将进化式 kernel 搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,把已有 CUDA kernel 当作知识库适配为 Apple Silicon 上的高质量 kernel。
Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用 CodeMender 的方式取得与更大模型相当的表现。
推荐理由:官方给出了新模型在真实代码库漏洞挖掘上的基准与落地案例,可据此判断轻量安全模型的能力边界。
Hugging Face 发布开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark)。
Mistral 将 Le Chat 更名为 Vibe,定位为同时覆盖工作与编码的统一 AI 智能体,原有对话、设置和订阅方案全部保留。
推荐理由:Mistral 把 Le Chat 更名并统一为工作与编码两种模式的智能体,读者可据此判断企业办公与编码流程的整合路径。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 密集架构模型,在 SWE-Bench Verified 上得分 77.6%,以修改版 MIT 许可证开放权重,API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。
推荐理由:Mistral Medium 3.5 以 128B 密集架构开源并成为 Vibe 与 Le Chat 默认模型,读者可据此判断云端异步编码智能体的可用性。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。
Google DeepMind 汇总了 Gemini 驱动的编码智能体 AlphaEvolve 发布一年来的应用成果,覆盖科研与基础设施优化。
推荐理由:官方汇总了 AlphaEvolve 在基因组、电网、TPU 与商业客户上的落地数据,可据此判断编码智能体的跨领域迁移空间。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,以 Apache 2.0 许可开放权重,并集成进 Mistral Vibe 与免费 API。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,能读取 Rails 源码文件、生成或改进 RSpec 测试并在 CI/CD 流水线中无需人工干预地运行,多个实例可并行处理不同文件。通过引入 AGENTS.md 和分类 SKILLS 文件,其质量分数从 0.68 提升至 0.74。
Mistral AI 发布 Devstral 2 编码模型家族,包括 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出了 Devstral 2 的 SWE-bench Verified 成绩、参数规模与定价,可据此判断开源编码模型的性价比位置。
Berkeley AI Research 的新论文为 word2vec 给出了定量可预测的学习理论:在合理实用条件下,其学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学存在闭式解,最终学到的嵌入等价于对目标矩阵 M* 做 PCA。
Mistral AI 发布 Codestral 25.08 代码补全模型,并推出覆盖补全、代码库语义检索与智能体工作流的企业级编码栈。官方数据显示 Codestral 25.08 的补全接受量提升 30%,保留代码增加 10%,失控生成减少 50%,支持云、VPC 和本地部署。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级开源版 Devstral Small 1.1。
推荐理由:Devstral 新版本给出了 SWE-Bench Verified 分数、开源许可与 API 定价,读者可据此比较开源代码智能体的性能与成本。
Mistral AI 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型、IDE 内助手、本地部署选项与企业管控工具,基于开源项目 Continue 构建。
推荐理由:官方给出模型组合、部署形态和三家大企业落地细节,可据此判断企业级 AI 编码工具的选型与合规边界。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出 SWE-Bench Verified 46.8% 的横向对比与单卡本地部署门槛,便于判断开源编码智能体的可用边界。
Mistral AI 发布 Mistral Medium 3,官方称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格低至每 M token 输入 $0.4、输出 $2。
推荐理由:官方给出 Mistral Medium 3 在成本、部署门槛与专业任务上的定位,可与 Claude、Llama 4、DeepSeek v3 对比。