新模型来了,优势依旧:DharmaOCR 在巴西葡萄牙语上仍胜过 Mistral OCR4 与 Unlimited-OCR
DharmaOCR 在葡萄牙语专用基准上得分 0.925,超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型经葡萄牙语语料监督微调后,再用 DPO 提升推理稳定性、降低退化率。作者认为,把全部参数集中到单一语言领域,是其相对多语言模型的结构性优势。
DharmaOCR 在葡萄牙语专用基准上得分 0.925,超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型经葡萄牙语语料监督微调后,再用 DPO 提升推理稳定性、降低退化率。作者认为,把全部参数集中到单一语言领域,是其相对多语言模型的结构性优势。
Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 两款开源多模态大模型。
推荐理由:原文列出了 Inkling 与 Inkling-Small 的架构参数、部署显存门槛和多引擎支持,读者可据此判断自部署可行性。
Mistral AI 发布 Robostral Navigate,这是其首个面向具身导航的 8B 模型,仅凭单张 RGB 图像和自然语言指令即可让机器人自主导航,无需 LiDAR 或深度传感器。
推荐理由:原文给出单 RGB 相机实现具身导航的基准数据和训练方法,读者可了解紧凑模型如何完成复杂导航任务。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可、总参数 119B、激活 6B 的形式化验证模型,miniF2F 达到 100%,PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34%。
推荐理由:官方给出多基准成绩、训练流程和每解题成本,读者可对照其开源权重与免费 API 判断形式化验证的实用门槛。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:同属 Nano Banana 家族的三档模型首次给出速度、成本与质量的分工定位,可作为选型参照。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:TabFM 把零样本思路带到表格分类与回归,读者可据此了解免训练预测在企业数据场景的落地方式。
Mistral 发布文档解析模型 OCR 4,在提取文本之外新增边界框、区块分类和内联置信度评分,支持 170 种语言并可单容器自托管部署。官方称独立标注者在 600+ 份、12+ 种语言的文档对比中平均 72% 情况下更偏好 OCR 4,该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07。
推荐理由:Mistral OCR 4 在文本框选、区块分类和自托管上的变化,让文档解析可直接进入 RAG 与智能体管线。
Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。
推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款可自动识别 70 多种语言并做近实时语音到语音翻译的音频模型,能保留说话人的语调、节奏和音高,并持续生成语音、始终比说话人慢几秒。
推荐理由:官方给出 70+ 语言、流式连续翻译与多渠道开放的细节,读者可据此判断实时语音翻译的可用边界。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的无编码器多模态模型,视觉与音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型的表现,同时总内存占用不到其一半,并首次在中等规模 Gemma 中支持原生音频输入。
推荐理由:原文给出无编码器架构的视觉与音频直连设计和 16GB 显存本地运行门槛,可据此判断端侧多模态智能体的落地条件。
Mistral 已收购 Emmi AI,并将其工作纳入自身,专注为航空航天、汽车、半导体和能源等行业构建基础 Physics AI。双方此前发布的成果包括 AB-UPT——可在单张 GPU 上处理 900 万表面单元与 1.4 亿体积单元的原始几何、无需重新划分网格,以及首个端到端深度学习代理模型 NeuralDEM。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 密集架构模型,在 SWE-Bench Verified 上得分 77.6%,以修改版 MIT 许可证开放权重,API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。
推荐理由:Mistral Medium 3.5 以 128B 密集架构开源并成为 Vibe 与 Le Chat 默认模型,读者可据此判断云端异步编码智能体的可用性。
Google DeepMind 推出 Gemini Omni 系列,首个模型 Gemini Omni Flash 可组合图像、音频、视频和文本输入,生成并对话式编辑高质量视频。
推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。
Google DeepMind 推出 Gemini 3.1 Flash TTS 文本转语音模型,在 Artificial Analysis TTS 排行榜上取得 1,211 Elo 成绩。
推荐理由:Gemini 3.1 Flash TTS 给出了 Elo 成绩、音频标签控制和多语言覆盖,可据此判断语音生成的可控性变化。
Google DeepMind 推出 Gemini Robotics-ER 1.6,定位为机器人的高层推理模型,强化空间推理与多视角理解,可通过 Gemini API 和 Google AI Studio 供开发者使用。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言的语音生成。
推荐理由:原文给出了架构、延迟与定价,读者可据此判断它在企业语音工作流中的位置。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,以 Apache 2.0 许可开放权重,并集成进 Mistral Vibe 与免费 API。
Mistral 发布 Voxtral Transcribe 2,包含面向批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转写模型。
推荐理由:Mistral 一次放出批处理与实时两款语音转写模型,并给出延迟、错误率与单价对比,可据此判断实时语音应用的落地成本。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率。该模型支持 markdown 输出并可用 HTML 标签还原表格结构,定价为每 1000 页 2 美元,Batch API 折扣下降至每 1000 页 1 美元,模型 API 名为 mistral-ocr-2512。
推荐理由:原文给出 OCR 3 相对上一代的提升幅度和按页计价,读者可据此估算文档处理流水线的成本变化。
Mistral AI 发布 Devstral 2 编码模型家族,包括 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出了 Devstral 2 的 SWE-bench Verified 成绩、参数规模与定价,可据此判断开源编码模型的性价比位置。
Mistral 发布 Mistral 3 系列,包含 3B、8B、14B 三个 Ministral 3 密集模型,以及总参数 675B、激活 41B 的稀疏 MoE 模型 Mistral Large 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性放出从 3B 到 675B 的全系开源模型,读者可据此判断小模型与 MoE 大模型的分工。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转录或 40 分钟理解,并具备音频问答、摘要、多语言识别与语音触发函数调用能力,其语言模型骨干继承自 Mistral Small 3.1。
推荐理由:Mistral 开源语音理解模型,给出两款尺寸、32k 上下文与转录基准对比,可据此判断开源语音方案的落地成本。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级开源版 Devstral Small 1.1。
推荐理由:Devstral 新版本给出了 SWE-Bench Verified 分数、开源许可与 API 定价,读者可据此比较开源代码智能体的性能与成本。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和更强的企业版 Magistral Medium。
推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开 AIME2024 成绩和训练细节,便于比较其与现有推理模型的定位。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出 SWE-Bench Verified 46.8% 的横向对比与单卡本地部署门槛,便于判断开源编码智能体的可用边界。
Mistral AI 发布 Mistral Medium 3,官方称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格低至每 M token 输入 $0.4、输出 $2。
推荐理由:官方给出 Mistral Medium 3 在成本、部署门槛与专业任务上的定位,可与 Claude、Llama 4、DeepSeek v3 对比。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本表现、多模态理解,上下文窗口扩展至 128k tokens,推理速度 150 tokens 每秒,以 Apache 2.0 许可证开源。
推荐理由:Mistral Small 3.1 以 128k 上下文和 Apache 2.0 开源发布,读者可据此判断小模型在端侧多模态任务上的可用边界。