Google 发布 Gemini 4 Argon,缩小与 OpenAI、Anthropic 的差距但未明显领先
Google 发布新一代前沿模型 Gemini 4 Argon,在部分关键基准上超过 OpenAI 和 Anthropic 的竞品,但并未取得明显领先。
Google 发布新一代前沿模型 Gemini 4 Argon,在部分关键基准上超过 OpenAI 和 Anthropic 的竞品,但并未取得明显领先。
Anthropic 公布评测结果,称智谱开源权重模型 GLM-5.3 在漏洞利用开发上接近其 Claude Mythos Preview。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源与多语言 TTS 模型:以 Qwen3 ASR 计算 WER/CER、用 RTFx 和 TTFA 衡量速度、以 WavLM 嵌入向量余弦相似度(SIM)衡量声音克隆。
AINews 汇总 9/24-9/25 动态,Claude Opus 5.5 本周发布后反响积极,以 88.4% 领跑 SimpleBench,并被指在生成讲解视频上表现突出。
推荐理由:汇总一周内多个模型与工具的动态,便于快速了解前沿模型在基准、成本和视频生成上的位置。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回答是否有帮助且安全。该基准覆盖多种现实心理健康对话场景,衡量模型回复的助益性与安全性。
Hugging Face 发布 altk-evolve 的"一致性指南"(consistency guidelines),配合 Consistency Analyzer 定位 Agent 决策中易翻转的步骤。
Hugging Face 发布 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维 Item Response Theory(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练后自主识别出安全与通用推理两个主导维度。
Hugging Face 的 Open ASR Leaderboard 新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,这是该榜单多语言标签下首个 Indic 语言,也是其首个全球南语种。
Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在加密环境中,使模型无法提前接触测试题目。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。
推荐理由:DeepMind 与新加坡 AI 安全研究所等机构用加密隔离环境对 Gemini Flash Lite 做双盲评测,读者可了解基准污染之外的技术性解决路径。
Hugging Face 最新研究用三项测试量化语音识别中的“benchmaxxing”,评估 11 款开源 ASR 模型后发现,多款高分模型会复现 VoxPopuli 英文集和 LibriSpeech(clean、other)的基准转录文本,即使音频与之矛盾或相关词已被静音。
Hugging Face 博客发布 ALTK-Evolve 记忆剂量研究:在 AppWorld 585 个多步任务上测试 8 个模型后发现,智能体记忆不是开关而是需要按模型校准的剂量。
Import AI 469 期介绍了新基准 DiG-bench,用 70 款规则隐藏的游戏测试 AI 自主探索与发现能力,目前仅 Opus 5 和 Fable 5 在 Tier 7 取得 0.2 分,远低于人类的 100%。
Google Research 提出 knowledge profiling 行为框架,用编码、召回、识别三项指标诊断 LLM 的事实性瓶颈,并发布含 2,150 条 Wikipedia 事实的 WikiProfile 基准。
Hugging Face 的 ALTK-Evolve 与 ACE 同属无权重更新的智能体记忆方案,都把过往轨迹转化为可复用经验,区别在推理时的投递方式。
Epoch 与 METR 发布 MirrorCode 基准,让 AI 仅凭 CLI 访问重实现软件程序,25 个目标程序中 17 个有满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成 METR 和 Epoch 估计人类需 2-17 周的任务。
推荐理由:MirrorCode 用 25 个真实程序衡量 AI 自主重实现能力,Opus 4.7 花 14 小时完成人类需数周的任务。
DharmaOCR 在葡萄牙语专用基准上得分 0.925,超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型经葡萄牙语语料监督微调后,再用 DPO 提升推理稳定性、降低退化率。作者认为,把全部参数集中到单一语言领域,是其相对多语言模型的结构性优势。
Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音交互的人类品质,覆盖 40 多个领先闭源与开源语音模型、15+ 个评估维度和 60+ 项指标,涵盖 ASR、TTS、S2S 与语音理解。
Fable 在 KernelBench-Mega 上写出被认为首个真正的 megakernel,用 CUDA 在 RTX PRO 6000 Blackwell 上相对优化 PyTorch 基线取得 18.71X 加速,超过 Claude Opus 4.8 的 14.4X、GLM-5.2 的 11.14X 和 GPT 5.5 的 4.34X。
Hugging Face 发布开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark)。
Every Eval Ever(EEE)与 Hugging Face Community Evals 实现互通,评测结果可以跨平台发布并互相解读。EEE 的标准化 JSON 记录可与 Community Evals 的 YAML 结果对接,提交后分数会显示在模型页和基准榜单上,并带有指向完整 EEE 记录的来源徽章。
Google Research 在 COLM 2026 论文《Thinking to Recall》中提出,让 LLM 生成推理轨迹能解锁原本无法触及的参数化事实,且这一效应在简单单跳问题上同样成立。研究用 Gemini-2.5 Flash/Pro 和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上对比推理开关,识别出计算缓冲与事实启动两种机制。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,称"对齐尚未走上正轨",计划两三年内扩至 40-80 名全职员工,初期募资 $100–150M。
Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度 80%,三天前升至接近 100%。
推荐理由:读者可以看到 WeatherNext 在真实飓风预报中同时预测路径与强度的表现,以及 NHC 年度验证报告的对比结论。
Google 在 Google Labs 上线研究实验 Vantage,用生成式 AI 构建多轮对话模拟环境,评估高中与大学生面向未来的技能,现以英文开放注册。该系统由 Executive LLM 动态引导对话,AI Evaluator 依据评估量表与人工专家打分,并与纽约大学合作对 188 名 18-25 岁美国测试者开展验证。
Google Research 推出 ConvApparel,一个覆盖服饰购物场景的 4000 余段、近 15000 轮人机多轮对话数据集,用于量化 LLM 用户模拟器与真实用户的真实感差距。
Google Research 提出一套框架,用心理学问卷改写成情境判断测试(SJT),在真实用户-助手场景中评估 LLM 行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见分布。
Google Research 用模拟器研究 AI 评测中「标注多少条目(N)」与「每条目标注多少人(K)」的权衡,发现常见的每条目 1、3、5 名标注者往往不够,反映人类观点细微差异常需每条目 10 名以上标注者。若只关心多数投票,增加条目更有效;若想捕捉观点分布,则必须增加标注者;在约 1000 条总标注的适度预算下,按指标选对比例即可获得高可复现结果。该模拟器已在 GitHub 开源。
Google 与 Cornell University 合作在 PNAS 发表研究,用 67 道高温超导领域专家题测试 6 款 LLM,由国际专家小组按 6 项指标盲评打分。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral 提出用 LLM as a Judge 结合 RAG Triad 框架评估 RAG 系统,通过 Context Relevance、Groundedness、Answer Relevance 三项指标分别检查检索文档与查询的匹配度、回答是否基于检索上下文以及是否回应原始问题。