跳到正文

#推理

今日 1 条
今天10月1日周四
9月26日周六
9月16日周三
  1. NVIDIA Blog62

    NVIDIA Vera Rubin NVL72 首登 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍

    NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高为 2.5 倍。

    推荐理由:NVIDIA 官方首次公布 Vera Rubin NVL72 的 MLPerf 推理成绩,并给出跨机架扩展与软件迭代的量化对比,可供判断推理经济学走向。

9月9日周三
9月8日周二
9月3日周四
8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型反超其全精度版本

    Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。

    推荐理由:论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。

8月21日周五
7月15日周三
7月10日周五
7月2日周四
6月27日周六
6月25日周四
  1. Google Research41

    Google Research 研究:推理如何解锁 LLM 的参数化知识回忆

    Google Research 在 COLM 2026 论文《Thinking to Recall》中提出,让 LLM 生成推理轨迹能解锁原本无法触及的参数化事实,且这一效应在简单单跳问题上同样成立。研究用 Gemini-2.5 Flash/Pro 和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上对比推理开关,识别出计算缓冲与事实启动两种机制。

6月11日周四
  1. Google DeepMind74

    Google DeepMind 发布 DiffusionGemma:文本生成最高提速 4 倍

    Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。

    推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。

5月29日周五
5月8日周五
  1. Berkeley AI Research33

    自适应并行推理:高效推理扩展的下一个范式

    一篇综述分析了并行推理领域的最新进展,重点讨论自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。文中梳理了自一致性、Best-of-N、Tree/Graph of Thoughts、MCTS、ParaThinker、GroupThink 和 Hogwild!

4月22日周三
4月20日周一
  1. Berkeley AI Research42

    GRASP:面向世界模型长时程规划的梯度规划器

    Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态、在状态迭代上直接加入随机性、重塑梯度三招,让基于世界模型的长时程规划更稳健。GRASP 把轨迹提升到虚拟状态,使优化可跨时间并行,同时避免经由高维视觉模型的脆弱状态输入梯度。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 合作完成。

4月16日周四
3月17日周二
  1. Mistral AI74

    Mistral 发布 Mistral Small 4 开源模型,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。

    推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。

3月13日周五
12月3日周三
11月1日周六
  1. Berkeley AI Research30

    Berkeley AI Research:不依赖 TD 学习的强化学习,用分治法扩展长时程任务

    Berkeley AI Research 提出一种基于分治法(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。该工作与 Aditya 共同主导,在 goal-conditioned RL 上首次实现了分治法价值学习的规模化扩展,利用三角形不等式构造传递式 Bellman 更新规则。

9月1日周一
6月10日周二