Google DeepMind 发布 Gemini Omni 系列,首个模型 Gemini Omni Flash 上线
Google DeepMind 推出 Gemini Omni 系列,首个模型 Gemini Omni Flash 可组合图像、音频、视频和文本输入,生成并对话式编辑高质量视频。
推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。
Google DeepMind 推出 Gemini Omni 系列,首个模型 Gemini Omni Flash 可组合图像、音频、视频和文本输入,生成并对话式编辑高质量视频。
推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。
Google DeepMind 推出 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 排行榜上取得 1,211 Elo 成绩。
推荐理由:Gemini 3.1 Flash TTS 给出了 Elo 成绩、音频标签控制和多语言覆盖,可据此判断语音生成的可控性变化。
Google DeepMind 推出 Gemini Robotics-ER 1.6,定位为机器人的高层推理模型,强化空间推理与多视角理解,可通过 Gemini API 和 Google AI Studio 供开发者使用。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言的语音生成。
推荐理由:原文给出了架构、延迟与定价,读者可据此判断它在企业语音工作流中的位置。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,以 Apache 2.0 许可开放权重,并集成进 Mistral Vibe 与免费 API。
Mistral 发布 Voxtral Transcribe 2,包含面向批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转写模型。
推荐理由:Mistral 一次放出批处理与实时两款语音转写模型,并给出延迟、错误率与单价对比,可据此判断实时语音应用的落地成本。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率。该模型支持 markdown 输出并可用 HTML 标签还原表格结构,定价为每 1000 页 2 美元,Batch API 折扣下降至每 1000 页 1 美元,模型 API 名为 mistral-ocr-2512。
推荐理由:原文给出 OCR 3 相对上一代的提升幅度和按页计价,读者可据此估算文档处理流水线的成本变化。
Mistral AI 发布 Devstral 2 编码模型家族,包括 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出了 Devstral 2 的 SWE-bench Verified 成绩、参数规模与定价,可据此判断开源编码模型的性价比位置。
Mistral 发布 Mistral 3 系列,包含 3B、8B、14B 三个 Ministral 3 密集模型,以及总参数 675B、激活 41B 的稀疏 MoE 模型 Mistral Large 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性放出从 3B 到 675B 的全系开源模型,读者可据此判断小模型与 MoE 大模型的分工。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转录或 40 分钟理解,并具备音频问答、摘要、多语言识别与语音触发函数调用能力,其语言模型骨干继承自 Mistral Small 3.1。
推荐理由:Mistral 开源语音理解模型,给出两款尺寸、32k 上下文与转录基准对比,可据此判断开源语音方案的落地成本。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级开源版 Devstral Small 1.1。
推荐理由:Devstral 新版本给出了 SWE-Bench Verified 分数、开源许可与 API 定价,读者可据此比较开源代码智能体的性能与成本。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和更强的企业版 Magistral Medium。
推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开 AIME2024 成绩和训练细节,便于比较其与现有推理模型的定位。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出 SWE-Bench Verified 46.8% 的横向对比与单卡本地部署门槛,便于判断开源编码智能体的可用边界。
Mistral AI 发布 Mistral Medium 3,官方称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格低至每 M token 输入 $0.4、输出 $2。
推荐理由:官方给出 Mistral Medium 3 在成本、部署门槛与专业任务上的定位,可与 Claude、Llama 4、DeepSeek v3 对比。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本表现、多模态理解,上下文窗口扩展至 128k tokens,推理速度 150 tokens 每秒,以 Apache 2.0 许可证开源。
推荐理由:Mistral Small 3.1 以 128k 上下文和 Apache 2.0 开源发布,读者可据此判断小模型在端侧多模态任务上的可用边界。