跳到正文

#编码

今日 3 条
今天10月1日周四
9月30日周三
  1. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,定位为 GPT-6 Sol 的升级版,面向智能体编码、computer use 与专业工作负载提供更强推理能力。

    推荐理由:材料给出 GPT-6.1 Sol 在 Bedrock 上线后的能力定位与成本对比,读者可据此判断强推理模型的落点。

9月29日周二
  1. OpenAI News68

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、电脑操作和专业工作,接近 Astra 的智能水平。其标准 API 输入和输出 token 价格为 Astra 的五分之一。

    推荐理由:官方公布 GPT-6.1 Sol 的定位与定价,读者可据此判断它在编码和电脑操作上的价格取舍。

  2. AWS Machine Learning Blog60

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置提供,并支持 Responses、Chat Completions 和 Converse API。

    推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度成本权衡,可供工程选型参考。

  3. AWS Machine Learning Blog60

    AWS 上线 Claude Sonnet 5.5

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、多数任务单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作,如告警首响应、智能体常驻监控、SQL 生成、UI/UX 测试和 IDE 内快速编码。

    推荐理由:官方给出 Sonnet 5.5 的定位、适用任务和与 Opus 5.5 的分工,可据此判断该把哪些工作交给它。

9月28日周一
9月27日周日
9月26日周六
9月25日周五
9月23日周三
  1. Latent Space84

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 Luna 并双双降价 40-50%

    Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首个模型,官方称多数任务达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:同日两家发布新模型并同步降价,材料给出第三方评测与按任务成本拆解,可对照能力与价格的实际取捨。

9月21日周一
  1. Simon Willison41

    工程师爆料:整支团队从 L1 到 L7 都在用 Claude Code 写规格、代码和 PR,没人读任何东西

    一名新入职大公司的工程师称,团队里的规格、代码、测试、PRD、工单及其处理、报告等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话。没人喜欢这种状态,管理层多次表示推送代码不是瓶颈,员工每天工作 12 到 13 个小时只是为了按回车。

9月12日周六
9月11日周五
9月9日周三
  1. Mistral AI52

    Mistral 如何用 AI 智能体把 4 万行 Fortran 77 迁移到 C++

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 水库模拟器迁移到 C++,该代码库没有测试套件,也没有集中文档。做法是先搭数值一致性校验框架,用自研 parser 生成调用树并让上百个智能体借助 Mistral OCR 归档散落文档,再以 coder、tester、reviewer 加人工检查点的结构化工作流逐模块迁移。

9月8日周二
9月5日周六
9月4日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot app 入门:如何同时运行多个 AI 智能体

    GitHub Copilot app 支持同时运行多个 AI 智能体会话,每个会话运行在独立的 Git worktree 上、彼此互不干扰,并各自保留上下文,可随时切换而无需重新解释任务。会话视图中每张卡片显示任务标题和智能体完成进度,用户可在同一项目上并行推进多项任务,把时间花在审查和决策上。官方建议先从两个小任务同时开始试用。

9月3日周四
8月14日周五
7月29日周三
7月27日周一
  1. Import AI77

    Epoch 与 METR 发布 MirrorCode 基准:AI 可完成数周规模的编程任务

    Epoch 与 METR 发布 MirrorCode 基准,让 AI 仅凭 CLI 访问重实现软件程序,25 个目标程序中 17 个有满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成 METR 和 Epoch 估计人类需 2-17 周的任务。

    推荐理由:MirrorCode 用 25 个真实程序衡量 AI 自主重实现能力,Opus 4.7 花 14 小时完成人类需数周的任务。

7月17日周五
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用 CodeMender 的方式取得与更大模型相当的表现。

    推荐理由:官方给出了新模型在真实代码库漏洞挖掘上的基准与落地案例,可据此判断轻量安全模型的能力边界。

7月6日周一
7月1日周三
6月15日周一
5月28日周四
5月22日周五
  1. Mistral AI78

    Mistral 发布 Mistral Medium 3.5,并在 Vibe 与 Le Chat 上线云端远程智能体

    Mistral 发布 Mistral Medium 3.5,这是一个 128B 密集架构模型,在 SWE-Bench Verified 上得分 77.6%,以修改版 MIT 许可证开放权重,API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。

    推荐理由:Mistral Medium 3.5 以 128B 密集架构开源并成为 Vibe 与 Le Chat 默认模型,读者可据此判断云端异步编码智能体的可用性。

5月16日周六
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,今日起在 Gemini app、Google Search AI Mode、Google Antigravity、Gemini API、AI Studio、Android Studio 及 Gemini Enterprise 上线。

    推荐理由:官方披露 3.5 Flash 在 Terminal-Bench 2.1 等基准上的成绩与 4 倍输出速度,可据此判断其性价比定位。

5月6日周三
5月4日周一
3月17日周二
3月11日周三
12月9日周二
  1. Mistral AI71

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布 Devstral 2 编码模型家族,包括 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

    推荐理由:官方给出了 Devstral 2 的 SWE-bench Verified 成绩、参数规模与定价,可据此判断开源编码模型的性价比位置。

9月1日周一