Every Eval Ever 结果接入 Hugging Face 模型页
Every Eval Ever(EEE)与 Hugging Face Community Evals 实现互通,评测结果可以跨平台发布并互相解读。EEE 的标准化 JSON 记录可与 Community Evals 的 YAML 结果对接,提交后分数会显示在模型页和基准榜单上,并带有指向完整 EEE 记录的来源徽章。
Every Eval Ever(EEE)与 Hugging Face Community Evals 实现互通,评测结果可以跨平台发布并互相解读。EEE 的标准化 JSON 记录可与 Community Evals 的 YAML 结果对接,提交后分数会显示在模型页和基准榜单上,并带有指向完整 EEE 记录的来源徽章。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,同时保证对专有数据和 IP 的控制。
推荐理由:Mistral 一次性公布工业工程 AI 栈、统一智能体 Vibe 与自建 10 MW 推理数据中心,可据此观察其企业级全栈布局。
Mistral AI 发布公开预览版 Search Toolkit,这是一个用于构建 AI 应用生产级检索管线的可组合框架,开源且支持云端、本地和边缘部署,将摄取、检索与评测统一到共享接口下。
Mistral 已收购 Emmi AI,并将其工作纳入自身,专注为航空航天、汽车、半导体和能源等行业构建基础 Physics AI。双方此前发布的成果包括 AB-UPT——可在单张 GPU 上处理 900 万表面单元与 1.4 亿体积单元的原始几何、无需重新划分网格,以及首个端到端深度学习代理模型 NeuralDEM。
Mistral AI 宣布已就收购 Physics AI 公司 Emmi AI 达成最终协议,以强化其面向工业企业的 AI 转型能力。Emmi AI 成立于奥地利,专注 Physics AI 并开发大型工程模型,可实现实时仿真、替代多日计算并构建数字孪生;其 30 多名研究人员与工程师将在 5 月加入 Mistral 的 Science 与 Applied AI 团队。
推荐理由:Mistral 收购 Physics AI 公司 Emmi,说明其正把物理建模能力与工程工具接入纳入工业 AI 路线。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 密集架构模型,在 SWE-Bench Verified 上得分 77.6%,以修改版 MIT 许可证开放权重,API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。
推荐理由:Mistral Medium 3.5 以 128B 密集架构开源并成为 Vibe 与 Le Chat 默认模型,读者可据此判断云端异步编码智能体的可用性。
Google DeepMind 发布 Gemini for Science,在 Google Labs 上线三个实验性原型:基于 Co-Scientist 的 Hypothesis Generation。
Google Research 称其开源工具与开放数据集已支持全球逾 25 万名研究人员和开发者。其基因组学工具 DeepVariant、DeepConsensus、DeepPolisher 助力社区处理了 250 万人的外显子组与全基因组,医学基础模型 MedGemma 下载量超 480 万次。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态、在状态迭代上直接加入随机性、重塑梯度三招,让基于世界模型的长时程规划更稳健。GRASP 把轨迹提升到虚拟状态,使优化可跨时间并行,同时避免经由高维视觉模型的脆弱状态输入梯度。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 合作完成。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,并与 NVIDIA 共同开发前沿开源模型,将 Mistral AI 的模型架构与全栈平台同 NVIDIA 的算力、模型开发工具及合成数据生成管线结合。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,以 Apache 2.0 许可开放权重,并集成进 Mistral Vibe 与免费 API。
Mistral 基于其开源编码助手 Vibe 构建了一个自主智能体,能读取 Rails 源码文件、生成或改进 RSpec 测试并在 CI/CD 流水线中无需人工干预地运行,多个实例可并行处理不同文件。通过引入 AGENTS.md 和分类 SKILLS 文件,其质量分数从 0.68 提升至 0.74。
Mistral 发布 Voxtral Transcribe 2,包含面向批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转写模型。
推荐理由:Mistral 一次放出批处理与实时两款语音转写模型,并给出延迟、错误率与单价对比,可据此判断实时语音应用的落地成本。
Mistral AI 发文复盘其在 vLLM 中排查一处内存泄漏的过程:在生产级流量下,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory,且只在 Prefill/Decode 分离部署、Mistral Medium 3.1 与图编译启用时复现。
Mistral AI 发布 Devstral 2 编码模型家族,包括 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出了 Devstral 2 的 SWE-bench Verified 成绩、参数规模与定价,可据此判断开源编码模型的性价比位置。
Mistral 发布 Mistral 3 系列,包含 3B、8B、14B 三个 Ministral 3 密集模型,以及总参数 675B、激活 41B 的稀疏 MoE 模型 Mistral Large 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性放出从 3B 到 675B 的全系开源模型,读者可据此判断小模型与 MoE 大模型的分工。
Mistral AI 宣布与 SAP 建立多年合作,将模型集成进 SAP 的 AI Foundation,共同为德国和欧洲打造完全主权的 AI 技术栈,并联合开发面向复杂行业与政府机构的行业解决方案。Mistral AI 同时携手 Helsing 加速面向真实场景防御与安全应用的视觉-语言-动作模型研发。为推进在德布局,Mistral AI 正大幅扩充本地团队,并将在未来数月内开设德国办公室。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转录或 40 分钟理解,并具备音频问答、摘要、多语言识别与语音触发函数调用能力,其语言模型骨干继承自 Mistral Small 3.1。
推荐理由:Mistral 开源语音理解模型,给出两款尺寸、32k 上下文与转录基准对比,可据此判断开源语音方案的落地成本。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级开源版 Devstral Small 1.1。
推荐理由:Devstral 新版本给出了 SWE-Bench Verified 分数、开源许可与 API 定价,读者可据此比较开源代码智能体的性能与成本。
Mistral AI 推出 AI for Citizens 协作计划,帮助各国政府和公共机构自主掌握 AI 战略,覆盖法国、卢森堡、新加坡、荷兰、英国、瑞士等。该计划提供开源模型、自托管与本地 AI 数据中心部署选项、数据主权保障及定制化研发,以避免对少数闭源厂商的"一刀切"依赖。
Mistral AI 发布 Mistral Compute,向客户提供私有、一体的 AI 基础设施栈,涵盖 GPU、编排、API、产品与服务,形态从裸金属服务器到全托管 PaaS。
推荐理由:Mistral 把自建训练平台对外开放为私有 AI 基础设施,读者可据此了解欧洲主权算力的落地形态。
Mistral AI 发布首个推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和更强的企业版 Magistral Medium。
推荐理由:Mistral 首个推理模型同时给出开源权重与企业版,并公开 AIME2024 成绩和训练细节,便于比较其与现有推理模型的定位。
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方给出 SWE-Bench Verified 46.8% 的横向对比与单卡本地部署门槛,便于判断开源编码智能体的可用边界。