跳到正文

#Agent

今日 3 条
今天10月1日周四
9月29日周二
  1. OpenAI News68

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、电脑操作和专业工作,接近 Astra 的智能水平。其标准 API 输入和输出 token 价格为 Astra 的五分之一。

    推荐理由:官方公布 GPT-6.1 Sol 的定位与定价,读者可据此判断它在编码和电脑操作上的价格取舍。

  2. Latent Space77

    AINews:Opus 5.5 擅长做讲解视频

    AINews 汇总 9/24-9/25 动态,Claude Opus 5.5 本周发布后反响积极,以 88.4% 领跑 SimpleBench,并被指在生成讲解视频上表现突出。

    推荐理由:汇总一周内多个模型与工具的动态,便于快速了解前沿模型在基准、成本和视频生成上的位置。

  3. AWS Machine Learning Blog60

    AWS 上线 Claude Sonnet 5.5

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、多数任务单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作,如告警首响应、智能体常驻监控、SQL 生成、UI/UX 测试和 IDE 内快速编码。

    推荐理由:官方给出 Sonnet 5.5 的定位、适用任务和与 Opus 5.5 的分工,可据此判断该把哪些工作交给它。

9月23日周三
  1. Latent Space84

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna 并双双降价 40-50%

    Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首个模型,官方称多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:同日两家发布新模型并同步降价,材料给出第三方评测与按任务成本拆解,可对照能力与价格的实际取捨。

9月22日周二
  1. Latent Space82

    小米发布 MiMo-V2.6-Pro 与 Flash:新的开放权重模型,训练成本约 300 万美元

    小米发布 MiMo-V2.6 系列,包含原生全模态的 MiMo-V2.6-Pro(1.02T 总参数、42B 激活)和 MiMo-V2.6-Flash,并推出输出速度最高快 20 倍的 UltraSpeed 版本。

    推荐理由:小米 MiMo-V2.6-Pro 以约 300 万美元训练成本登顶开放权重模型,其 RL 环境与训练配方同步开源值得关注。

9月19日周六
9月16日周三
9月9日周三
9月3日周四
8月27日周四
8月14日周五
8月10日周一
7月30日周四
7月28日周二
  1. Google DeepMind77

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,首次实现对人形机器人从脚到指尖的全身控制。

    推荐理由:官方给出了全身控制、22 自由度手部操作与多机器人协作的能力边界,并说明首个具身推理模型已开放入口。

7月21日周二
7月17日周五
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用 CodeMender 的方式取得与更大模型相当的表现。

    推荐理由:官方给出了新模型在真实代码库漏洞挖掘上的基准与落地案例,可据此判断轻量安全模型的能力边界。

6月23日周二
  1. Mistral AI65

    Mistral 发布 OCR 4,新增文本框选与区块分类

    Mistral 发布文档解析模型 OCR 4,在提取文本之外新增边界框、区块分类和内联置信度评分,支持 170 种语言并可单容器自托管部署。官方称独立标注者在 600+ 份、12+ 种语言的文档对比中平均 72% 情况下更偏好 OCR 4,该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07。

    推荐理由:Mistral OCR 4 在文本框选、区块分类和自托管上的变化,让文档解析可直接进入 RAG 与智能体管线。

6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的无编码器多模态模型,视觉与音频输入直接进入 LLM 主干。该模型在标准基准上接近 26B MoE 模型的表现,同时总内存占用不到其一半,并首次在中等规模 Gemma 中支持原生音频输入。

    推荐理由:原文给出无编码器架构的视觉与音频直连设计和 16GB 显存本地运行门槛,可据此判断端侧多模态智能体的落地条件。

5月22日周五
  1. Mistral AI78

    Mistral 发布 Mistral Medium 3.5,并在 Vibe 与 Le Chat 上线云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是一个 128B 密集架构模型,在 SWE-Bench Verified 上得分 77.6%,以修改版 MIT 许可证开放权重,API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。

    推荐理由:Mistral Medium 3.5 以 128B 密集架构开源并成为 Vibe 与 Le Chat 默认模型,读者可据此判断云端异步编码智能体的可用性。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。

    推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。

3月17日周二
  1. Mistral AI74

    Mistral 发布 Mistral Small 4 开源模型,统一推理、多模态与编码能力

    Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一个主要版本,也是首个把 Magistral 推理、Pixtral 多模态与 Devstral 编码智能体能力统一到单一模型的 Mistral 模型,采用 Apache 2.0 许可。

    推荐理由:Mistral 首次把推理、多模态与编码智能体能力合并进一个开源模型,并给出可调推理强度与延迟数据。

12月9日周二
  1. Mistral AI71

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布 Devstral 2 编码模型家族,包括 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

    推荐理由:官方给出了 Devstral 2 的 SWE-bench Verified 成绩、参数规模与定价,可据此判断开源编码模型的性价比位置。

7月11日周五
5月21日周三