OpenAI 在 API 中上线 GPT-Live-1 语音模型
OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上有提升,同时支持自定义音色和电话语音(telephony)接入。
推荐理由:OpenAI 把全双工语音对话开放到 API,开发者可据此评估实时语音应用的改造路径。
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上有提升,同时支持自定义音色和电话语音(telephony)接入。
推荐理由:OpenAI 把全双工语音对话开放到 API,开发者可据此评估实时语音应用的改造路径。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,并在 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 开放公开预览。
推荐理由:原文给出两个 API 的延迟与 WER 数字,读者可据此比较它相对上一代 Chirp 3 在实时语音场景的可用性。
Google Research 发布 AMIE (Video),在 Gemini 与 Project Astra 之上实现同步临床视频问诊,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。
推荐理由:AMIE (Video) 用三智能体异步架构支撑实时视频问诊,并在 300 场随机 OSCE 研究中与初级保健医生对比,适合了解医疗多模态智能体的设计与评测方式。
Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线,覆盖音乐性、歌词、人声和创作控制四方面。官方称其旋律结构更复杂自然,歌词质量与提示词遵循度提升,人声更具情感与发音准确度,同时可更简便地控制输出时长与节奏。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声和控制项上的具体变化,可用于对比上一代音乐生成能力。
Hugging Face 与 Cerebras 联合演示了一条实时语音到语音流水线,采用开源可替换的级联架构。语音识别用 Nvidia 的 Parakeet,语言模型用 Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,文本转语音用 Alibaba 的 Qwen3TTS。
推荐理由:Hugging Face 与 Cerebras 联合演示开源语音到语音流水线,读者可了解各层组件如何组合与何处替换。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款可自动识别 70 多种语言并做近实时语音到语音翻译的音频模型,能保留说话人的语调、节奏和音高,并持续生成语音、始终比说话人慢几秒。
推荐理由:官方给出 70+ 语言、流式连续翻译与多渠道开放的细节,读者可据此判断实时语音翻译的可用边界。
Google DeepMind 推出 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 排行榜上取得 1,211 Elo 成绩。
推荐理由:Gemini 3.1 Flash TTS 给出了 Elo 成绩、音频标签控制和多语言覆盖,可据此判断语音生成的可控性变化。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言的语音生成。
推荐理由:原文给出了架构、延迟与定价,读者可据此判断它在企业语音工作流中的位置。
Mistral 发布 Voxtral Transcribe 2,包含面向批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转写模型。
推荐理由:Mistral 一次放出批处理与实时两款语音转写模型,并给出延迟、错误率与单价对比,可据此判断实时语音应用的落地成本。
Mistral 为 Le Chat 推出多项新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的 Voice 模式、由推理模型 Magistral 支持的 Think 模式、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一口气给 Le Chat 补上研究、语音、推理与图像编辑,读者可据此判断其产品线扩张方向。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转录或 40 分钟理解,并具备音频问答、摘要、多语言识别与语音触发函数调用能力,其语言模型骨干继承自 Mistral Small 3.1。
推荐理由:Mistral 开源语音理解模型,给出两款尺寸、32k 上下文与转录基准对比,可据此判断开源语音方案的落地成本。