跳到正文

#评测/基准

今日 1 条
今天10月1日周四
9月30日周三
9月29日周二
  1. Latent Space77

    AINews:Opus 5.5 擅长做讲解视频

    AINews 汇总 9/24-9/25 动态,Claude Opus 5.5 本周发布后反响积极,以 88.4% 领跑 SimpleBench,并被指在生成讲解视频上表现突出。

    推荐理由:汇总一周内多个模型与工具的动态,便于快速了解前沿模型在基准、成本和视频生成上的位置。

9月23日周三
9月16日周三
9月2日周三
8月28日周五
8月27日周四
  1. Google DeepMind62

    Google DeepMind 联合新加坡 AI Safety Institute 试点全球首个双盲 AI 评测

    Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在加密环境中,使模型无法提前接触测试题目。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。

    推荐理由:DeepMind 与新加坡 AI 安全研究所等机构用加密隔离环境对 Gemini Flash Lite 做双盲评测,读者可了解基准污染之外的技术性解决路径。

8月21日周五
8月19日周三
8月17日周一
8月12日周三
8月11日周二
7月27日周一
  1. Import AI77

    Epoch 与 METR 发布 MirrorCode 基准:AI 可完成数周规模的编程任务

    Epoch 与 METR 发布 MirrorCode 基准,让 AI 仅凭 CLI 访问重实现软件程序,25 个目标程序中 17 个有满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成 METR 和 Epoch 估计人类需 2-17 周的任务。

    推荐理由:MirrorCode 用 25 个真实程序衡量 AI 自主重实现能力,Opus 4.7 花 14 小时完成人类需数周的任务。

7月16日周四
  1. Hugging Face Blog31

    新模型来了,优势依旧:DharmaOCR 在巴西葡萄牙语上仍胜过 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在葡萄牙语专用基准上得分 0.925,超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型经葡萄牙语语料监督微调后,再用 DPO 提升推理稳定性、降低退化率。作者认为,把全部参数集中到单一语言领域,是其相对多语言模型的结构性优势。

7月15日周三
7月6日周一
7月1日周三
6月30日周二
6月25日周四
  1. Google Research41

    Google Research 研究:推理如何解锁 LLM 的参数化知识回忆

    Google Research 在 COLM 2026 论文《Thinking to Recall》中提出,让 LLM 生成推理轨迹能解锁原本无法触及的参数化事实,且这一效应在简单单跳问题上同样成立。研究用 Gemini-2.5 Flash/Pro 和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上对比推理开关,识别出计算缓冲与事实启动两种机制。

6月15日周一
5月16日周六
  1. Google DeepMind63

    WeatherNext 如何帮助美国国家飓风中心提前预测飓风 Melissa 登陆牙买加

    Google DeepMind 的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度 80%,三天前升至接近 100%。

    推荐理由:读者可以看到 WeatherNext 在真实飓风预报中同时预测路径与强度的表现,以及 NHC 年度验证报告的对比结论。

4月14日周二
4月9日周四
4月3日周五
4月1日周三
  1. Google Research28

    Google Research 研究:AI 基准测试需要多少标注者才够?

    Google Research 用模拟器研究 AI 评测中「标注多少条目(N)」与「每条目标注多少人(K)」的权衡,发现常见的每条目 1、3、5 名标注者往往不够,反映人类观点细微差异常需每条目 10 名以上标注者。若只关心多数投票,增加条目更有效;若想捕捉观点分布,则必须增加标注者;在约 1000 条总标注的适度预算下,按指标选对比例即可获得高可复现结果。该模拟器已在 GitHub 开源。

3月17日周二
5月28日周三
4月9日周三