Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 母公司 Alphabet 发布新模型 Gemini 4 Argon,可处理编码、研究和写作等任务,并针对防御性网络安全工作专门训练,公司称其能自主发现、验证并修补关键软件漏洞。
Google 母公司 Alphabet 发布新模型 Gemini 4 Argon,可处理编码、研究和写作等任务,并针对防御性网络安全工作专门训练,公司称其能自主发现、验证并修补关键软件漏洞。
Microsoft Research 发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与科研人员的交互式 harness 两部分组成。
推荐理由:微软研究院公开了面向生物学的多模态世界模型 Quine 及其与 Broad Institute 合作的湿实验验证结果。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供给开发者,新增场景延长、首尾帧插值、360p 快速草稿和 4K 放大等能力。
推荐理由:原文列出场景延长、首尾帧插值和 4K 放大等具体能力与价格入口,可据此判断生成视频工作流的变化。
Google DeepMind 发布手语转文本模型 SL2T,以超过 10 万小时、50 多种手语的数据训练,实现手语到文本的机器翻译。该模型首先在 Pixel 11 的 Gboard 与 Live Transcribe 中上线,支持美国手语(ASL)转英文,可用来搜索、写消息或向 Gemini 提问,更多设备和语言将后续支持。
推荐理由:官方披露 SL2T 的训练规模、手语到文本的翻译路径与隐私处理方式,可了解手语 AI 首次落地消费产品的工程取舍。
Meta 发布开源多模态模型 Muse Glimmer,从 Muse 蒸馏至 30B 参数,采用 Apache 2.0 许可,面向编码、文档分析、个人助理等本地智能体场景。
推荐理由:Meta 开源 30B 多模态模型,附 day-0 推理与量化支持,可用于评估本地智能体模型的落地方案。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可发布,可在单张 16GB NVIDIA GPU 上运行。该模型把内容审核转化为策略自适应问答任务,推理时直接接受自然语言策略,无需重新训练即可统一文本与图像安全评估,官方称其在文本安全和多模态审核基准上匹配或超过至多 7 倍规模的开放护栏模型,并给出可阈值化的连续安全评分。
推荐理由:3B 分类器以推理时自然语言策略替代固定危害分类,读者可据此判断轻量护栏模型的部署方式变化。
Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,作为高层大脑负责对话、理解物理世界并规划多步任务,再交由底层 VLA 模型执行动作。
推荐理由:官方给出进度分类、时刻定位与多机协作的量化结果,可对照上一代了解具身推理的实际提升幅度。
Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,首次实现对人形机器人从脚到指尖的全身控制。
推荐理由:官方给出了全身控制、22 自由度手部操作与多机器人协作的能力边界,并说明首个具身推理模型已开放入口。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,可将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,每帧潜变量最少只需 2 步去噪。
DharmaOCR 在葡萄牙语专用基准上得分 0.925,超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型经葡萄牙语语料监督微调后,再用 DPO 提升推理稳定性、降低退化率。作者认为,把全部参数集中到单一语言领域,是其相对多语言模型的结构性优势。
Thinking Machines 在 Hugging Face 发布 Inkling 及 Inkling-Small 两款开源多模态大模型。
推荐理由:原文列出了 Inkling 与 Inkling-Small 的架构参数、部署显存门槛和多引擎支持,读者可据此判断自部署可行性。
Mistral AI 发布 Robostral Navigate,这是其首个面向具身导航的 8B 模型,仅凭单张 RGB 图像和自然语言指令即可让机器人自主导航,无需 LiDAR 或深度传感器。
推荐理由:原文给出单 RGB 相机实现具身导航的基准数据和训练方法,读者可了解紧凑模型如何完成复杂导航任务。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:同属 Nano Banana 家族的三档模型首次给出速度、成本与质量的分工定位,可作为选型参照。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的无编码器多模态模型,视觉与音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型的表现,同时总内存占用不到其一半,并首次在中等规模 Gemma 中支持原生音频输入。
推荐理由:原文给出无编码器架构的视觉与音频直连设计和 16GB 显存本地运行门槛,可据此判断端侧多模态智能体的落地条件。
Google DeepMind 推出 Gemini Omni 系列,首个模型 Gemini Omni Flash 可组合图像、音频、视频和文本输入,生成并对话式编辑高质量视频。
推荐理由:Gemini Omni Flash 把视频生成与对话式编辑合并到同一模型,读者可据此判断多模态创作入口的变化。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。
推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。
Google DeepMind 推出 Gemini Robotics-ER 1.6,定位为机器人的高层推理模型,强化空间推理与多视角理解,可通过 Gemini API 和 Google AI Studio 供开发者使用。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言的语音生成。
推荐理由:原文给出了架构、延迟与定价,读者可据此判断它在企业语音工作流中的位置。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。
推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。
Mistral AI 发布 Mistral OCR 3,在表单、扫描文档、复杂表格和手写内容上相对 Mistral OCR 2 取得 74% 的整体胜率。该模型支持 markdown 输出并可用 HTML 标签还原表格结构,定价为每 1000 页 2 美元,Batch API 折扣下降至每 1000 页 1 美元,模型 API 名为 mistral-ocr-2512。
推荐理由:原文给出 OCR 3 相对上一代的提升幅度和按页计价,读者可据此估算文档处理流水线的成本变化。
Mistral 发布 Mistral 3 系列,包含 3B、8B、14B 三个 Ministral 3 密集模型,以及总参数 675B、激活 41B 的稀疏 MoE 模型 Mistral Large 3,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 一次性放出从 3B 到 675B 的全系开源模型,读者可据此判断小模型与 MoE 大模型的分工。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转录或 40 分钟理解,并具备音频问答、摘要、多语言识别与语音触发函数调用能力,其语言模型骨干继承自 Mistral Small 3.1。
推荐理由:Mistral 开源语音理解模型,给出两款尺寸、32k 上下文与转录基准对比,可据此判断开源语音方案的落地成本。
Mistral AI 发布 Mistral Medium 3,官方称其在多项基准上达到 Claude Sonnet 3.7 的 90% 或以上,价格低至每 M token 输入 $0.4、输出 $2。
推荐理由:官方给出 Mistral Medium 3 在成本、部署门槛与专业任务上的定位,可与 Claude、Llama 4、DeepSeek v3 对比。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本表现、多模态理解,上下文窗口扩展至 128k tokens,推理速度 150 tokens 每秒,以 Apache 2.0 许可证开源。
推荐理由:Mistral Small 3.1 以 128k 上下文和 Apache 2.0 开源发布,读者可据此判断小模型在端侧多模态任务上的可用边界。