跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 21–40 条 · 共 50 条
7月30日周四
  1. Google DeepMind60

    Google DeepMind 在 Flow Music 上线音乐生成模型 Lyria 3.5

    Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线,覆盖音乐性、歌词、人声和创作控制四方面。官方称其旋律结构更复杂自然,歌词质量与提示词遵循度提升,人声更具情感与发音准确度,同时可更简便地控制输出时长与节奏。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声和控制项上的具体变化,可用于对比上一代音乐生成能力。

7月28日周二
  1. Google DeepMind77

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,首次实现对人形机器人从脚到指尖的全身控制。

    推荐理由:官方给出了全身控制、22 自由度手部操作与多机器人协作的能力边界,并说明首个具身推理模型已开放入口。

7月21日周二
7月17日周五
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用 CodeMender 的方式取得与更大模型相当的表现。

    推荐理由:官方给出了新模型在真实代码库漏洞挖掘上的基准与落地案例,可据此判断轻量安全模型的能力边界。

7月15日周三
7月8日周三
  1. Mistral AI71

    Mistral 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布 Robostral Navigate,这是其首个面向具身导航的 8B 模型,仅凭单张 RGB 图像和自然语言指令即可让机器人自主导航,无需 LiDAR 或深度传感器。

    推荐理由:原文给出单 RGB 相机实现具身导航的基准数据和训练方法,读者可了解紧凑模型如何完成复杂导航任务。

7月2日周四
7月1日周三
6月30日周二
  1. Google Research69

    Google Research 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:TabFM 把零样本思路带到表格分类与回归,读者可据此了解免训练预测在企业数据场景的落地方式。

6月25日周四
6月23日周二
  1. Mistral AI65

    Mistral 发布 OCR 4,新增文本框选与区块分类

    Mistral 发布文档解析模型 OCR 4,在提取文本之外新增边界框、区块分类和内联置信度评分,支持 170 种语言并可单容器自托管部署。官方称独立标注者在 600+ 份、12+ 种语言的文档对比中平均 72% 情况下更偏好 OCR 4,该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07。

    推荐理由:Mistral OCR 4 在文本框选、区块分类和自托管上的变化,让文档解析可直接进入 RAG 与智能体管线。

6月11日周四
  1. Google DeepMind74

    Google DeepMind 发布 DiffusionGemma:文本生成最高提速 4 倍

    Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。

    推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。

6月9日周二
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款可自动识别 70 多种语言并做近实时语音到语音翻译的音频模型,能保留说话人的语调、节奏和音高,并持续生成语音、始终比说话人慢几秒。

    推荐理由:官方给出 70+ 语言、流式连续翻译与多渠道开放的细节,读者可据此判断实时语音翻译的可用边界。

  2. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的无编码器多模态模型,视觉与音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型的表现,同时总内存占用不到其一半,并首次在中等规模 Gemma 中支持原生音频输入。

    推荐理由:原文给出无编码器架构的视觉与音频直连设计和 16GB 显存本地运行门槛,可据此判断端侧多模态智能体的落地条件。

5月22日周五
  1. Mistral AI78

    Mistral 发布 Mistral Medium 3.5,并在 Vibe 与 Le Chat 上线云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是一个 128B 密集架构模型,在 SWE-Bench Verified 上得分 77.6%,以修改版 MIT 许可证开放权重,API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。

    推荐理由:Mistral Medium 3.5 以 128B 密集架构开源并成为 Vibe 与 Le Chat 默认模型,读者可据此判断云端异步编码智能体的可用性。

5月18日周一
5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。

    推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。

4月16日周四
3月24日周二
  1. Mistral AI71

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言的语音生成。

    推荐理由:原文给出了架构、延迟与定价,读者可据此判断它在企业语音工作流中的位置。

3月17日周二
  1. Mistral AI74

    Mistral 发布 Mistral Small 4 开源模型,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。

    推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。