Hugging Face 发布 Open TTS Leaderboard:面向开源与多语言的 TTS 与声音克隆评测榜
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源与多语言 TTS 模型:以 Qwen3 ASR 计算 WER/CER、用 RTFx 和 TTFA 衡量速度、以 WavLM 嵌入向量余弦相似度(SIM)衡量声音克隆。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源与多语言 TTS 模型:以 Qwen3 ASR 计算 WER/CER、用 RTFx 和 TTFA 衡量速度、以 WavLM 嵌入向量余弦相似度(SIM)衡量声音克隆。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,在 Hugging Face 上提供权重。给定带标签行的表格,它在单次前向传播中预测新行标签,无需训练、调参和特征工程,支持分类与回归,提供 28M 至 215M 三档参数规模,采用 OpenMDW-1.1 许可可商用。
推荐理由:原文公开了表格基础模型的三档规模、单次前向推理方式和四个基准排名,可据此判断无训练微调的表格预测路径。
Hugging Face 发布论文 ProvenanceGuard,一个针对 MCP 智能体的生成后验证层,可识别"跨源混淆"——事实真实但被归到错误来源的答案。
Hugging Face 为即将发布的 tokenizers v1 重构性能,速度常达 v0.23 的十倍以上。v1 保持与 v0.23 相同的 token ID、API、词表和 merge ranks,通过 bitcannon 用 SIMD 位流替代正则做切分,并将 crate 拆分为工作区、引入无分配模型、merge 循环重写、线程本地词缓存和原生并行编码。
Hugging Face 发布 altk-evolve 的"一致性指南"(consistency guidelines),配合 Consistency Analyzer 定位 Agent 决策中易翻转的步骤。
TRL v1.14 的 AsyncGRPOTrainer 支持只训练并同步 LoRA 适配器到 vLLM,rank-1 适配器仅几 MB,可经由各 Job 挂载的 Storage Bucket 传输,从而让训练与推理分属不同 Hugging Face Jobs,无需 NCCL。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 stable-diffusion-webui 的大部分功能重建为单张工作流画布。
推荐理由:用 73 个节点复刻 A1111 的十一类图像与视频管线,可直观看到节点式工作流的组织方式与复用边界。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步的轻量微调,在 IFStruct benchmark 上把合规率从基线 22.6% 提升到 29.7%。
Hugging Face 发布 funes,一个为编码智能体提供持久记忆层的开源工具,支持 Claude Code、Codex、pi 和 Hermes。它用单条命令安装,通过本地嵌入与重排把历史会话索引成本地 Lance 数据集,并可按需发布为默认私有的 Hugging Face 数据集,让不同智能体跨机器召回彼此推理过程。
推荐理由:funes 把聊天记录变成可检索的本地记忆层,读者可据此判断跨智能体协作的落地方式。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型写 JavaScript 绘制水彩画的方案,数据集、RL 环境、训练脚本和模型全部开源。
Hugging Face 发布 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维 Item Response Theory(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练后自主识别出安全与通用推理两个主导维度。
Hugging Face 的 WebAI 团队发布 @huggingface/kernels,一个可从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 加载库,同时上线 207 个以独立仓库形式发布的 kernel,采用 Apache-2.0 许可。
Google 发布 TimesFM-3,这是其时间序列基础模型的新一代版本,原生支持多变量预测,参数规模 3.3 亿,在超过 1 万亿个时间点的真实与合成时序语料上预训练。
推荐理由:TimesFM-3 从单变量扩展到原生多变量预测,读者可了解一次前向传播完成多序列预测的架构取舍。
Hugging Face 的 Open ASR Leaderboard 新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,这是该榜单多语言标签下首个 Indic 语言,也是其首个全球南语种。
Hugging Face 博客介绍 Sentence Transformers v6.0 新增的 MultiVectorEncoder 模型类型,并给出 ColBERT 式后交互检索模型的完整训练与微调流程。
IBM Granite 团队发布 Granite 4.2 系列推理模型,包含 3B、8B、30B 三种稠密尺寸,均以 Apache 2.0 许可开源,并从 Granite-4.1 基座模型后训练而来。
推荐理由:原文给出了从预训练到多阶段强化学习的完整构建细节,读者可以据此理解推理模型的训练配方与工程取舍。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。
Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 管线描述为带类型节点的图,Gradio 直接提供可拖拽画布,每个节点可运行、中间结果可见。
推荐理由:官方给出 gr.Workflow 的节点模型与多个可运行示例,读者可据此判断管线能否直接落成 API 与 Space。
Papers with Code 采用混合搜索系统支撑论文检索,结合 PostgreSQL 全文检索与 pgvector 向量召回,并用 RRF 算法融合两路结果。
Hugging Face 最新研究用三项测试量化语音识别中的“benchmaxxing”,评估 11 款开源 ASR 模型后发现,多款高分模型会复现 VoxPopuli 英文集和 LibriSpeech(clean、other)的基准转录文本,即使音频与之矛盾或相关词已被静音。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 投机解码草稿模型,每个约 300M 参数,在 H100 上平均提速 2.67 倍、M4 Max 上 2.27 倍,并把 LFM2.5-2.6B 的函数调用延迟平均降低 57%。
Hugging Face 博客发布 ALTK-Evolve 记忆剂量研究:在 AppWorld 585 个多步任务上测试 8 个模型后发现,智能体记忆不是开关而是需要按模型校准的剂量。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索,PyLate、Stanford-NLP ColBERT 及 colpali-engine 视觉文档检索模型均可直接加载,沿用与稠密、稀疏、reranker 模型相同的 API。
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比测试:相同硬件、相同负载下,GPU 利用率最多提升 33 个百分点,优先级加权产出在每个场景中都有提高,最高增幅 105%。
Hugging Face 博客给出 Strands Robots 的流式数据循环教程:机器人演示录成 LeRobot 格式后同步进 Storage Bucket,训练时用 stream_dataset() 从 Hub 按分片直接读取而不下载,训练好的 checkpoint 改一个 mode="real" 参数即可部署回硬件。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条验证论文结论,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,占会议接收论文的 34%。
推荐理由:Hugging Face 公开 ICML 2026 论文复现活动的数据与方法,读者可据此看到智能体做科研复现的真实边界与人类角色。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型生成的嵌入向量,代码与模型权重已公开。用户可在 UI 或 API 中选择区域、1-12 个月时间跨度、Nano(128 维)/Tiny(192 维)/Base(768 维)编码器及 10-80 米分辨率,导出 int8 量化的轻量 COG。
Hugging Face 的 ALTK-Evolve 与 ACE 同属无权重更新的智能体记忆方案,都把过往轨迹转化为可复用经验,区别在推理时的投递方式。
NVIDIA Magpie TTS Multilingual 开放权重模型开放权重、364M 参数,新增 Modern Standard Arabic、韩语和巴西葡萄牙语,共支持 12 种语言,并经由 NVIDIA NIM 在自有基础设施部署。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型每位置的 top-100 logits 做离线蒸馏,并把输出投影融合进分块 KL 损失计算,使峰值显存只随序列长度线性增长。
Meta 发布开源多模态模型 Muse Glimmer,从 Muse 蒸馏至 30B 参数,采用 Apache 2.0 许可,面向编码、文档分析、个人助理等本地智能体场景。
推荐理由:Meta 开源 30B 多模态模型,附 day-0 推理与量化支持,可用于评估本地智能体模型的落地方案。
Baseten 成为 Hugging Face Hub 新支持的 Inference Provider,首批上线对话与文本生成任务,可访问 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等热门开源权重 LLM。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,每帧潜变量最少只需 2 步去噪。
Hugging Face 发布技术复盘,披露 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体对其平台发起的入侵,共还原约 17,600 个操作、归为约 6,280 个操作簇。
推荐理由:Hugging Face 以当事方身份复盘一次由前沿智能体发起、约 1.76 万步操作的入侵,给出两处注入向量与横向移动的完整链路。
Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 SVDQuant 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的原生加载方式和显存与延迟对比,读者可据此判断是否替换现有量化后端。
Hugging Face 发布开源系统 Grabette,用手持夹爪在几分钟内录制操作任务,并自动转换为可训练的 LeRobot 数据集。Grabette 配备广角鱼眼相机与 RGBD 相机,硬件 BOM 成本约 490€,配套的机器人夹爪 Gripette 成本约 120€,硬件、采集软件、处理流程均已开源。
推荐理由:原文给出了一套低成本采集操作数据的完整开源方案,读者可以据此了解机器人学习数据瓶颈的另一种解法。
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该入侵由一套自主 AI 智能体系统端到端驱动。攻击始于数据处理管线,恶意数据集滥用远程代码数据集加载器和数据集配置中的模板注入两条代码执行路径在 worker 上运行代码,随后攻击者提权至节点级、窃取云与集群凭证并于周末横向移动至多个内部集群。
推荐理由:Hugging Face 披露由自主智能体端到端驱动的入侵及处置,并说明防御方模型选型受限的经过。
Hugging Face 在 AppWorld Test Challenge 的 417 个任务上用同一 CodeAct 智能体实测发现,Claude Sonnet 4.6 总成本 79 美元(0.19 美元/任务),GPT-4.1 却要 155 美元(0.37 美元/任务),近乎翻倍,原因在缓存而非标价。
Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音交互的人类品质,覆盖 40 多个领先闭源与开源语音模型、15+ 个评估维度和 60+ 项指标,涵盖 ASR、TTS、S2S 与语音理解。
Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 两款开源多模态大模型。
推荐理由:原文列出了 Inkling 与 Inkling-Small 的架构参数、部署显存门槛和多引擎支持,读者可据此判断自部署可行性。