跳到正文
10月1日 · 周四

最新精选

9月30日周三
  1. Google DeepMind65

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质与结构加水印

    Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,在生物代码中嵌入不可感知的签名,使其不只在数字模型上、也能在合成出的实体蛋白质上被验证,同时保留其生物功能。

    推荐理由:Google DeepMind 把水印技术从图像扩展到蛋白质与 3D 结构,读者可看到生物安全筛查的一层新验证思路。

  2. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,定位为 GPT-6 Sol 的升级版,面向智能体编码、computer use 与专业工作负载提供更强推理能力。

    推荐理由:材料给出 GPT-6.1 Sol 在 Bedrock 上线后的能力定位与成本对比,读者可据此判断强推理模型的落点。

9月29日周二
  1. Latent Space88

    OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol、Ultrafast 与 Decisions API

    OpenAI 在 DevDay 2026 上发布 Dots 常驻智能体、GPT-6.1 Sol、Ultrafast 加速模式与 Decisions API,并推出 ChatGPT Spaces、Marketplace 及 Sign in with ChatGPT 等平台更新。

    推荐理由:汇总 OpenAI DevDay 2026 多项发布与独立评测数据,便于对比定价、能力与平台策略变化。

9月10日周四
  1. OpenAI News65

    OpenAI 推出 Agents API

    OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于编排、长时间运行的会话和工具调用,让开发者构建并上线云端智能体。

    推荐理由:原文给出了 Agents API 的托管定位与 Codex harness 支撑,读者可据此判断云端智能体的构建方式。

  2. OpenAI News63

    OpenAI 在 API 中上线 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上有提升,同时支持自定义音色和电话语音(telephony)接入。

    推荐理由:OpenAI 把全双工语音对话开放到 API,开发者可据此评估实时语音应用的改造路径。

9月8日周二
  1. OpenAI News62

    OpenAI 推出 ChatGPT Images 2.5

    OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精细的图像,更贴近用户原本的构想。

9月5日周六
  1. GitHub Blog · AI & ML69

    GitHub Copilot 推出 Project HydraFusion 多模型编排研究预览

    GitHub Copilot 在 CLI 中通过 /experimental 开放 Project HydraFusion 研究预览,用户在 /model 中选择后由运行时编排多模型完成任务。

    推荐理由:GitHub Copilot 官方给出多模型编排研究预览的三种执行模式与三个基准的成本质量数据,可据此判断路由策略的取舍。

9月3日周四
9月2日周三
  1. Google DeepMind71

    Google DeepMind 为 Gemini 推出智能体视频理解功能

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。

    推荐理由:官方给出视频分析在 token、成本与准确率上的量化变化,并说明可用入口和启用方式,便于开发者评估是否迁移现有视频处理流程。

8月25日周二
  1. Hugging Face Blog72

    Hugging Face 在 Gradio 中推出 gr.Workflow,把管线变成可拖拽界面与 API

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 管线描述为带类型节点的图,Gradio 直接提供可拖拽画布,每个节点可运行、中间结果可见。

    推荐理由:官方给出 gr.Workflow 的节点模型与多个可运行示例,读者可据此判断管线能否直接落成 API 与 Space。

8月4日周二
  1. Microsoft Research70

    微软研究院开源 Orchard:面向可扩展智能体的开放框架

    微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是可在软件工程、网页导航和智能助手等任务间复用的 Orchard Env 环境服务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。

    推荐理由:微软研究院开源 Orchard 环境服务与三套训练配方,读者可了解小参数模型在真实 harness 内训练后能达到的智能体水平。

7月23日周四
  1. Hugging Face Blog66

    Diffusers 原生支持 Nunchaku 4-bit 扩散推理

    Hugging Face 在 Diffusers 中引入 Nunchaku Lite,可直接用 from_pretrained() 加载 Nunchaku 风格的 SVDQuant 量化检查点,无需自定义 pipeline 或本地 CUDA 编译。

    推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的原生加载方式和显存与延迟对比,读者可据此判断是否替换现有量化后端。

7月21日周二
  1. Hugging Face Blog61

    Hugging Face 发布 Grabette:录制机器人操作数据的开源系统

    Hugging Face 发布开源系统 Grabette,用手持夹爪在几分钟内录制操作任务,并自动转换为可训练的 LeRobot 数据集。Grabette 配备广角鱼眼相机与 RGBD 相机,硬件 BOM 成本约 490€,配套的机器人夹爪 Gripette 成本约 120€,硬件、采集软件、处理流程均已开源。

    推荐理由:原文给出了一套低成本采集操作数据的完整开源方案,读者可以据此了解机器人学习数据瓶颈的另一种解法。

7月8日周三
  1. Hugging Face Blog62

    vLLM 的 transformers 建模后端实现原生速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到或超过 vLLM 手写实现的速度。该后端通过 torch.fx 做静态图分析并借助 ast 在运行时重写算子、融合为 vLLM 优化内核,模型作者只需加 --model-impl transformers 一个参数即可用上极速 vLLM 推理。

    推荐理由:原文给出了让 transformers 模型免改代码即可达到 vLLM 原生推理速度的机制与实测对比,读者可据此判断自建部署的迁移成本。

7月7日周二
  1. Hugging Face Blog76

    LeRobot v0.6.0 发布:世界模型策略、奖励模型 API 与六套仿真基准

    Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、一批新 VLA(GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1)以及统一奖励模型 API(Robometer、TOPReward)。

    推荐理由:原文给出世界模型策略、奖励模型 API 与六套仿真基准的完整清单,读者可据此判断机器人学习闭环的现状与可用入口。

  2. Hugging Face Blog61

    Hugging Face 与 SkyPilot 联合推出零出网存储集成

    Hugging Face 与 SkyPilot 联合发布集成,用户可用一个 hf:// URL 将 Hugging Face Bucket 或模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes 和本地集群上运行。

    推荐理由:原文给出 hf:// 挂载方式与免费出网机制,读者可据此判断跨云训练工作流的存储成本变化。

6月25日周四
  1. Google DeepMind77

    Google DeepMind 在 Gemini 3.5 Flash 中内置 computer use 能力

    Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型提供。

    推荐理由:Gemini 3.5 Flash 把 computer use 从独立模型并入主 Flash 模型,读者可据此了解智能体跨平台操作的能力与安全设计。

6月24日周三
  1. Mistral AI63

    Mistral AI 为 Connectors 增加管理员权限、密钥作用域与调试功能

    Mistral AI 宣布 Connectors 多项新能力:管理员可按 workspace 或组织设置连接器访问、逐工具开关,带连接器作用域的 API key 和服务账号防止自动化任务冒用身份,多账号连接器支持一个连接器绑定多个账号,Connectors Debugger 处于公开预览,可对 MCP 连接做 11 步根因分析。

    推荐理由:从权限管理、密钥作用域到连接调试,这组功能给出了企业级智能体接入外部数据的治理路径。

5月28日周四