Google DeepMind 发布 Gemini 4 Argon 前沿模型,输出 token 上限提至 1M
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将陆续提供给开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 的评测成绩与内部落地数据,可据此判断前沿模型在长周期工程与网络安全任务上的进展。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将陆续提供给开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 的评测成绩与内部落地数据,可据此判断前沿模型在长周期工程与网络安全任务上的进展。
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首个模型,官方称多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:同日两家发布新模型并同步降价,材料给出第三方评测与按任务成本拆解,可对照能力与价格的实际取捨。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高为 2.5 倍。
推荐理由:NVIDIA 官方首次公布 Vera Rubin NVL72 的 MLPerf 推理成绩,并给出跨机架扩展与软件迭代的量化对比,可供判断推理经济学走向。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备更强的推理能力、计算机操作能力,以及更强的写作与设计判断力。
推荐理由:OpenAI 官方发布面向企业场景的新一代模型,读者可据此了解其在推理与计算机操作上的定位。
IBM Granite 团队发布 Granite 4.2 系列推理模型,包含 3B、8B、30B 三种稠密尺寸,均以 Apache 2.0 许可开源,并从 Granite-4.1 基座模型后训练而来。
推荐理由:原文给出了从预训练到多阶段强化学习的完整构建细节,读者可以据此理解推理模型的训练配方与工程取舍。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。
Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 两款开源多模态大模型。
推荐理由:原文列出了 Inkling 与 Inkling-Small 的架构参数、部署显存门槛和多引擎支持,读者可据此判断自部署可行性。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、总参数 119B、激活 6B 的形式化验证模型,miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34%。
推荐理由:官方给出多基准成绩、训练流程和每解题成本,读者可对照其开源权重与免费 API 判断形式化验证的实用门槛。
Google Research 发布一种将多 Token 预测(MTP)改造到已冻结的 Gemini Nano v3 上的新架构,已在 Pixel 9 和 10 系列上线。
推荐理由:读者可以看到冻结主干加 MTP 头的架构取舍,以及它在 Pixel 端侧推理上的速度与内存收益。
Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。
推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中提炼高层结构化记忆的智能体记忆框架,代码已开源。
推荐理由:论文提出从成功与失败经验中提炼结构化记忆的框架,读者可了解智能体测试时自我进化的具体做法与实测增益。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。
Mistral 发布 Mistral 3 系列,包含 3B、8B、14B 三个 Ministral 3 密集模型,以及总参数 675B、激活 41B 的稀疏 MoE 模型 Mistral Large 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性放出从 3B 到 675B 的全系开源模型,读者可据此判断小模型与 MoE 大模型的分工。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和更强的企业版 Magistral Medium。
推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开 AIME2024 成绩和训练细节,便于比较其与现有推理模型的定位。