Diffusers 原生支持 Nunchaku 4-bit 扩散推理
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 SVDQuant 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的原生加载方式和显存与延迟对比,读者可据此判断是否替换现有量化后端。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 SVDQuant 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的原生加载方式和显存与延迟对比,读者可据此判断是否替换现有量化后端。
Hugging Face 发布开源系统 Grabette,用手持夹爪在几分钟内录制操作任务,并自动转换为可训练的 LeRobot 数据集。Grabette 配备广角鱼眼相机与 RGBD 相机,硬件 BOM 成本约 490€,配套的机器人夹爪 Gripette 成本约 120€,硬件、采集软件、处理流程均已开源。
推荐理由:原文给出了一套低成本采集操作数据的完整开源方案,读者可以据此了解机器人学习数据瓶颈的另一种解法。
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该入侵由一套自主 AI 智能体系统端到端驱动。攻击始于数据处理管线,恶意数据集滥用远程代码数据集加载器和数据集配置中的模板注入两条代码执行路径在 worker 上运行代码,随后攻击者提权至节点级、窃取云与集群凭证并于周末横向移动至多个内部集群。
推荐理由:Hugging Face 披露由自主智能体端到端驱动的入侵及处置,并说明防御方模型选型受限的经过。
Hugging Face 在 AppWorld Test Challenge 的 417 个任务上用同一 CodeAct 智能体实测发现,Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),近乎翻倍,原因在缓存而非标价。
Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音交互的人类品质,覆盖 40 多个领先闭源与开源语音模型、15+ 个评估维度和 60+ 项指标,涵盖 ASR、TTS、S2S 与语音理解。
Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 两款开源多模态大模型。
推荐理由:原文列出了 Inkling 与 Inkling-Small 的架构参数、部署显存门槛和多引擎支持,读者可据此判断自部署可行性。
Hugging Face 发布 PyTorch 性能分析系列第三篇,聚焦注意力机制。文章从朴素注意力实现出发,展示矩阵乘法、缩放、因果掩码等操作在 profiler 中的 kernel 表现,并指出将 masked_fill 改为原地操作 masked_fill_ 可省去每次前向的 Memcpy kernel。所有脚本在 NVIDIA A100-SXM4-80GB 上运行。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到或超过 vLLM 手写实现的速度。该后端通过 torch.fx 做静态图分析并借助 ast 在运行时重写算子、融合为 vLLM 优化内核,模型作者只需加 --model-impl transformers 一个参数即可用上极速 vLLM 推理。
推荐理由:原文给出了让 transformers 模型免改代码即可达到 vLLM 原生推理速度的机制与实测对比,读者可据此判断自建部署的迁移成本。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,支持从模型页一键跳转至 SageMaker Studio,模型预加载、环境已配置。
微软在 Build 2026 上发布 Foundry Managed Compute 与 Hugging Face 模型集合,把 Hugging Face 生态的开源权重模型纳入 Foundry Model Catalog,每周刷新,可一键部署到托管 GPU 平台。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、一批新 VLA(GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1)以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:原文给出世界模型策略、奖励模型 API 与六套仿真基准的完整清单,读者可据此判断机器人学习闭环的现状与可用入口。
Hugging Face 与 SkyPilot 联合发布集成,用户可用一个 hf:// URL 将 Hugging Face Bucket 或模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes 和本地集群上运行。
推荐理由:原文给出 hf:// 挂载方式与免费出网机制,读者可据此判断跨云训练工作流的存储成本变化。
Hugging Face 发布 PRX 系列第四篇,披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式语料。训练文本编码器换为 Qwen3-VL 并改为实时计算 latent,仅带来约 3–4% 吞吐损失;图像统一以 JPEG quality 92 编码。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 仓库类型,并默认只加载受信任发布者的 kernel,其他来源需通过 trust_remote_code 显式开启。同时加入基于 Sigstore cosign 的代码签名,并新增对 Torch Stable ABI 与 Apache TVM FFI 的支持。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、总参数 119B、激活 6B 的形式化验证模型,miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34%。
推荐理由:官方给出多基准成绩、训练流程和每解题成本,读者可对照其开源权重与免费 API 判断形式化验证的实用门槛。
Hugging Face 与 Cerebras 联合演示了一条实时语音到语音流水线,采用开源可替换的级联架构。语音识别用 Nvidia 的 Parakeet,语言模型用 Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,文本转语音用 Alibaba 的 Qwen3TTS。
推荐理由:Hugging Face 与 Cerebras 联合演示开源语音到语音流水线,读者可了解各层组件如何组合与何处替换。
Hugging Face 发布开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark)。
Dharmam AI 解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,指出专业化是有限资源下的必然结果。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:TabFM 把零样本思路带到表格分类与回归,读者可据此了解免训练预测在企业数据场景的落地方式。
Every Eval Ever(EEE)与 Hugging Face Community Evals 实现互通,评测结果可以跨平台发布并互相解读。EEE 的标准化 JSON 记录可与 Community Evals 的 YAML 结果对接,提交后分数会显示在模型页和基准榜单上,并带有指向完整 EEE 记录的来源徽章。
Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。
推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言的语音生成。
推荐理由:原文给出了架构、延迟与定价,读者可据此判断它在企业语音工作流中的位置。
Mistral 发布 Voxtral Transcribe 2,包含面向批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转写模型。
推荐理由:Mistral 一次放出批处理与实时两款语音转写模型,并给出延迟、错误率与单价对比,可据此判断实时语音应用的落地成本。
Mistral 发布 Mistral 3 系列,包含 3B、8B、14B 三个 Ministral 3 密集模型,以及总参数 675B、激活 41B 的稀疏 MoE 模型 Mistral Large 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性放出从 3B 到 675B 的全系开源模型,读者可据此判断小模型与 MoE 大模型的分工。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出 SWE-Bench Verified 46.8% 的横向对比与单卡本地部署门槛,便于判断开源编码智能体的可用边界。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本表现、多模态理解,上下文窗口扩展至 128k tokens,推理速度 150 tokens 每秒,以 Apache 2.0 许可证开源。
推荐理由:Mistral Small 3.1 以 128k 上下文和 Apache 2.0 开源发布,读者可据此判断小模型在端侧多模态任务上的可用边界。