AI 语音公司 ElevenLabs 估值翻倍至 220 亿美元
AI 语音初创公司 ElevenLabs 宣布允许员工按 220 亿美元估值出售部分已归属股权,较 2 月融资时的 110 亿美元估值翻倍。本轮 3 亿美元 tender offer 由 Wellington 和 T. Rowe Price 联合领投,是该公司第二次为员工安排二级交易,上一次是 2025 年 9 月按 66 亿美元估值进行的 1 亿美元要约。
AI 语音初创公司 ElevenLabs 宣布允许员工按 220 亿美元估值出售部分已归属股权,较 2 月融资时的 110 亿美元估值翻倍。本轮 3 亿美元 tender offer 由 Wellington 和 T. Rowe Price 联合领投,是该公司第二次为员工安排二级交易,上一次是 2025 年 9 月按 66 亿美元估值进行的 1 亿美元要约。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源与多语言 TTS 模型:以 Qwen3 ASR 计算 WER/CER、用 RTFx 和 TTFA 衡量速度、以 WavLM 嵌入向量余弦相似度(SIM)衡量声音克隆。
AWS 发布 vLLM-Omni v1.5 DLC,可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流在一条持久连接上输入文本、回流 24 kHz PCM 音频块,并用 Gradio 应用演示。
Amazon SageMaker JumpStart 现已支持部署 Qwen3-TTS-12Hz-1.7B-Base,可在全托管实时推理端点上用几秒参考音频完成声音克隆,输出 24 kHz 音频,无需重训练模型。
Meta 在 Connect 2026 上把个人智能体 Muse 作为硬件加智能体战略的核心,发布相关智能体功能与新眼镜,仅预告而未发布新前沿模型。Muse 现已支持语音与实时视频,可后台持续处理任务,并将在所有 Meta 眼镜上以唤醒词激活;每台 Muse 拥有独立邮箱地址,Mac 版 Muse 支持计算机使用。
Simon Willison 用 GPT-6 Astra 开发了一个 Gemini 3.8 TTS Playground,可组合单人旁白或多说话人对话、预览音频并查看请求响应细节,设置可保存为可分享的 URL。
Ringg 借助 GPT-5.6 让 AI 智能体处理最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页等多语言场景。相比 GPT-4.1,其成本降低 90%。
OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上有提升,同时支持自定义音色和电话语音(telephony)接入。
推荐理由:OpenAI 把全双工语音对话开放到 API,开发者可据此评估实时语音应用的改造路径。
Hugging Face 的 Open ASR Leaderboard 新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,这是该榜单多语言标签下首个 Indic 语言,也是其首个全球南语种。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,并在 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 开放公开预览。
推荐理由:原文给出两个 API 的延迟与 WER 数字,读者可据此比较它相对上一代 Chirp 3 在实时语音场景的可用性。
Hugging Face 最新研究用三项测试量化语音识别中的“benchmaxxing”,评估 11 款开源 ASR 模型后发现,多款高分模型会复现 VoxPopuli 英文集和 LibriSpeech(clean、other)的基准转录文本,即使音频与之矛盾或相关词已被静音。
Google Research 发布 AMIE (Video),在 Gemini 与 Project Astra 之上实现同步临床视频问诊,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。
推荐理由:AMIE (Video) 用三智能体异步架构支撑实时视频问诊,并在 300 场随机 OSCE 研究中与初级保健医生对比,适合了解医疗多模态智能体的设计与评测方式。
NVIDIA Magpie TTS Multilingual 开放权重模型开放权重、364M 参数,新增 Modern Standard Arabic、韩语和巴西葡萄牙语,共支持 12 种语言,并经由 NVIDIA NIM 在自有基础设施部署。
Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线,覆盖音乐性、歌词、人声和创作控制四方面。官方称其旋律结构更复杂自然,歌词质量与提示词遵循度提升,人声更具情感与发音准确度,同时可更简便地控制输出时长与节奏。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声和控制项上的具体变化,可用于对比上一代音乐生成能力。
Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音交互的人类品质,覆盖 40 多个领先闭源与开源语音模型、15+ 个评估维度和 60+ 项指标,涵盖 ASR、TTS、S2S 与语音理解。
Hugging Face 与 Cerebras 联合演示了一条实时语音到语音流水线,采用开源可替换的级联架构。语音识别用 Nvidia 的 Parakeet,语言模型用 Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,文本转语音用 Alibaba 的 Qwen3TTS。
推荐理由:Hugging Face 与 Cerebras 联合演示开源语音到语音流水线,读者可了解各层组件如何组合与何处替换。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款可自动识别 70 多种语言并做近实时语音到语音翻译的音频模型,能保留说话人的语调、节奏和音高,并持续生成语音、始终比说话人慢几秒。
推荐理由:官方给出 70+ 语言、流式连续翻译与多渠道开放的细节,读者可据此判断实时语音翻译的可用边界。
Google DeepMind 推出 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 排行榜上取得 1,211 Elo 成绩。
推荐理由:Gemini 3.1 Flash TTS 给出了 Elo 成绩、音频标签控制和多语言覆盖,可据此判断语音生成的可控性变化。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言的语音生成。
推荐理由:原文给出了架构、延迟与定价,读者可据此判断它在企业语音工作流中的位置。
Mistral 发布 Voxtral Transcribe 2,包含面向批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转写模型。
推荐理由:Mistral 一次放出批处理与实时两款语音转写模型,并给出延迟、错误率与单价对比,可据此判断实时语音应用的落地成本。
Mistral 为 Le Chat 推出多项新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的 Voice 模式、由推理模型 Magistral 支持的 Think 模式、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一口气给 Le Chat 补上研究、语音、推理与图像编辑,读者可据此判断其产品线扩张方向。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转录或 40 分钟理解,并具备音频问答、摘要、多语言识别与语音触发函数调用能力,其语言模型骨干继承自 Mistral Small 3.1。
推荐理由:Mistral 开源语音理解模型,给出两款尺寸、32k 上下文与转录基准对比,可据此判断开源语音方案的落地成本。