Google DeepMind 发布 Gemini 4 Argon 前沿模型,输出 token 上限提至 1M
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将陆续提供给开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 的评测成绩与内部落地数据,可据此判断前沿模型在长周期工程与网络安全任务上的进展。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将陆续提供给开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 的评测成绩与内部落地数据,可据此判断前沿模型在长周期工程与网络安全任务上的进展。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行后训练,在固定 64 个迷宫评测集上把迷宫求解率从 43.75% 提升到 95% 以上。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高为 2.5 倍。
推荐理由:NVIDIA 官方首次公布 Vera Rubin NVL72 的 MLPerf 推理成绩,并给出跨机架扩展与软件迭代的量化对比,可供判断推理经济学走向。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备更强的推理能力、计算机操作能力,以及更强的写作与设计判断力。
推荐理由:OpenAI 官方发布面向企业场景的新一代模型,读者可据此了解其在推理与计算机操作上的定位。
OpenAI 分享了一份 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。该问题属于千禧年大奖难题之一。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型写 JavaScript 绘制水彩画的方案,数据集、RL 环境、训练脚本和模型全部开源。
IBM Granite 团队发布 Granite 4.2 系列推理模型,包含 3B、8B、30B 三种稠密尺寸,均以 Apache 2.0 许可开源,并从 Granite-4.1 基座模型后训练而来。
推荐理由:原文给出了从预训练到多阶段强化学习的完整构建细节,读者可以据此理解推理模型的训练配方与工程取舍。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 投机解码草稿模型,每个约 300M 参数,在 H100 上平均提速 2.67 倍、M4 Max 上 2.27 倍,并把 LFM2.5-2.6B 的函数调用延迟平均降低 57%。
Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 两款开源多模态大模型。
推荐理由:原文列出了 Inkling 与 Inkling-Small 的架构参数、部署显存门槛和多引擎支持,读者可据此判断自部署可行性。
Hugging Face 发布 PyTorch 性能分析系列第三篇,聚焦注意力机制。文章从朴素注意力实现出发,展示矩阵乘法、缩放、因果掩码等操作在 profiler 中的 kernel 表现,并指出将 masked_fill 改为原地操作 masked_fill_ 可省去每次前向的 Memcpy kernel。所有脚本在 NVIDIA A100-SXM4-80GB 上运行。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、总参数 119B、激活 6B 的形式化验证模型,miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34%。
推荐理由:官方给出多基准成绩、训练流程和每解题成本,读者可对照其开源权重与免费 API 判断形式化验证的实用门槛。
Google Research 发布一种将多 Token 预测(MTP)改造到已冻结的 Gemini Nano v3 上的新架构,已在 Pixel 9 和 10 系列上线。
推荐理由:读者可以看到冻结主干加 MTP 头的架构取舍,以及它在 Pixel 端侧推理上的速度与内存收益。
Google Research 在 COLM 2026 论文《Thinking to Recall》中提出,让 LLM 生成推理轨迹能解锁原本无法触及的参数化事实,且这一效应在简单单跳问题上同样成立。研究用 Gemini-2.5 Flash/Pro 和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上对比推理开关,识别出计算缓冲与事实启动两种机制。
Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。
推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。
Google Research 在 I/O 2026 发布 Gemini for Science,一套与 Google Cloud、Google DeepMind。
一篇综述分析了并行推理领域的最新进展,重点讨论自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文中梳理了自一致性、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild!
Google Research 在 ICLR 论文中提出 ReasoningBank,一个从成功和失败经验中提炼高层结构化记忆的智能体记忆框架,代码已开源。
推荐理由:论文提出从成功与失败经验中提炼结构化记忆的框架,读者可了解智能体测试时自我进化的具体做法与实测增益。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态、在状态迭代上直接加入随机性、重塑梯度三招,让基于世界模型的长时程规划更稳健。GRASP 把轨迹提升到虚拟状态,使优化可跨时间并行,同时避免经由高维视觉模型的脆弱状态输入梯度。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 合作完成。
Google Research 发布推理优先框架 Simula,将合成数据生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和 dual-critic 质量检查四个可控维度从零构建数据集,无需种子数据。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据和模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步引入层次结构,仅需约 10 倍更少的消融即可达到 SPEX 的性能。
Mistral 发布 Mistral 3 系列,包含 3B、8B、14B 三个 Ministral 3 密集模型,以及总参数 675B、激活 41B 的稀疏 MoE 模型 Mistral Large 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性放出从 3B 到 675B 的全系开源模型,读者可据此判断小模型与 MoE 大模型的分工。
Berkeley AI Research 提出一种基于分治法(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。该工作与 Aditya 共同主导,在 goal-conditioned RL 上首次实现了分治法价值学习的规模化扩展,利用三角形不等式构造传递式 Bellman 更新规则。
Berkeley AI Research 的新论文为 word2vec 给出了定量可预测的学习理论:在合理实用条件下,其学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学存在闭式解,最终学到的嵌入等价于对目标矩阵 M* 做 PCA。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和更强的企业版 Magistral Medium。
推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开 AIME2024 成绩和训练细节,便于比较其与现有推理模型的定位。