跳到正文

#部署/工程

今日 2 条
8月10日周一
8月6日周四
8月4日周二
  1. Microsoft Research70

    微软研究院开源 Orchard:面向可扩展智能体的开放框架

    微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是可在软件工程、网页导航和智能助手等任务间复用的 Orchard Env 环境服务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。

    推荐理由:微软研究院开源 Orchard 环境服务与三套训练配方,读者可了解小参数模型在真实 harness 内训练后能达到的智能体水平。

7月30日周四
  1. Hugging Face Blog19

    GPU 管理:为什么闲置 GPU 正在成为新的停飞客机

    继模型质量之后,GPU 利用率正成为企业 AI 的下一个真实约束:GPU 成本按日历小时计(融资、折旧、电力、制冷),产出却只按计算小时计,而需求并非全天候。到 2026 年,连 Anthropic 都同时在 Amazon、Google、Microsoft 和 AMD 四家平台上做多吉瓦级承诺,Meta 也签下类似规模的多吉瓦协议,算力获取仍是活生生的战略约束。

7月29日周三
7月27日周一
7月23日周四
7月21日周二
7月16日周四
7月13日周一
7月10日周五
7月9日周四
  1. Mistral AI40

    Mistral Studio 为 Prompts 和 Skills 提供版本化管理系统

    Mistral Studio 现已为 Prompts 和 Skills 提供统一记录系统,让每个资产可版本化、有明确归属并可追溯。该功能支持不可变版本、版本回滚、分类标签和审计日志,任何 AI 构建者都能直接编辑测试,生产发布仍走企业已有的 CI/CD 流程。Skills 可通过 MCP 服务器直接调用,数据全程保留在企业边界内。

7月8日周三
  1. Hugging Face Blog62

    vLLM 的 transformers 建模后端实现原生速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端现在在许多 LLM 架构上达到或超过 vLLM 手写实现的速度。该后端通过 torch.fx 做静态图分析并借助 ast 在运行时重写算子、融合为 vLLM 优化内核,模型作者只需加 --model-impl transformers 一个参数即可用上极速 vLLM 推理。

    推荐理由:原文给出了让 transformers 模型免改代码即可达到 vLLM 原生推理速度的机制与实测对比,读者可据此判断自建部署的迁移成本。

  2. Google Research31

    Google Research 在 10 座美国城市实验用 Google Maps 改道缓解拥堵

    Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,在 10 座美国城市开展为期六个月的实验。不足 2% 的行程收到改道建议,目标路段行驶速度中位数提升约 2%,油耗中位数下降 0.5% 至 1.0%,每座城市每年可减少数千吨 CO2e 排放。

7月7日周二
  1. Hugging Face Blog61

    Hugging Face 与 SkyPilot 联合推出零出网存储集成

    Hugging Face 与 SkyPilot 联合发布集成,用户可用一个 hf:// URL 将 Hugging Face Bucket 或模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes 和本地集群上运行。

    推荐理由:原文给出 hf:// 挂载方式与免费出网机制,读者可据此判断跨云训练工作流的存储成本变化。

7月6日周一
7月1日周三
  1. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 联合演示了一条实时语音到语音流水线,采用开源可替换的级联架构。语音识别用 Nvidia 的 Parakeet,语言模型用 Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,文本转语音用 Alibaba 的 Qwen3TTS。

    推荐理由:Hugging Face 与 Cerebras 联合演示开源语音到语音流水线,读者可了解各层组件如何组合与何处替换。

6月25日周四
  1. Google Research34

    Google 用线性弹性缓存优化云成本,Spanner 实测 TCO 降约 5%

    Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存占用降 15.5%、缓存未命中仅增 5.5%、总拥有成本降约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时回退到 LRU 策略,无需按峰值需求预分配内存。论文已在 CIDR 发表。

6月24日周三
  1. Mistral AI63

    Mistral AI 为 Connectors 增加管理员权限、密钥作用域与调试功能

    Mistral AI 宣布 Connectors 多项新能力:管理员可按 workspace 或组织设置连接器访问、逐工具开关,带连接器作用域的 API key 和服务账号防止自动化任务冒用身份,多账号连接器支持一个连接器绑定多个账号,Connectors Debugger 处于公开预览,可对 MCP 连接做 11 步根因分析。

    推荐理由:从权限管理、密钥作用域到连接调试,这组功能给出了企业级智能体接入外部数据的治理路径。

6月23日周二
  1. Mistral AI65

    Mistral 发布 OCR 4,新增文本框选与区块分类

    Mistral 发布文档解析模型 OCR 4,在提取文本之外新增边界框、区块分类和内联置信度评分,支持 170 种语言并可单容器自托管部署。官方称独立标注者在 600+ 份、12+ 种语言的文档对比中平均 72% 情况下更偏好 OCR 4,该模型在 OlmOCRBench 得 85.20、OmniDocBench 得 93.07。

    推荐理由:Mistral OCR 4 在文本框选、区块分类和自托管上的变化,让文档解析可直接进入 RAG 与智能体管线。

6月16日周二
  1. Google DeepMind48

    Google DeepMind 发布 AI Control Roadmap,为内部 AI 智能体构建纵深防御

    Google DeepMind 推出 AI Control Roadmap,用纵深防御思路保障内部部署的 AI 智能体安全,即便模型对齐不完美也能提供保障。该框架将不可信智能体视为"内部威胁",借鉴 MITRE ATT&CK 拆解攻击手法,并用可信 AI 监督工作智能体的推理与行动。团队已分析 100 万个编码智能体任务,并为 Gemini Spark 智能体搭建实时监控,防范数据误删等问题。

6月13日周六
  1. Google Research39

    用退役手机搭建低碳计算平台:加州大学圣地亚哥分校与 Google 打造 2000 台 Pixel 手机集群

    加州大学圣地亚哥分校在 Google 支持下,将退役智能手机的主板拆出组成集群,部署一个由 2000 台 Pixel 手机搭建的数据中心,为数百名研究者与学生提供低成本、低碳的云计算。研究显示 25-50 台手机约等于一台现代服务器,20 台手机的小型集群已能支撑 75 人以上课程的评分负载,且延迟低于 AWS 默认后端。该系统预计 2026 年秋季全面上线。

6月11日周四
  1. Google DeepMind74

    Google DeepMind 发布 DiffusionGemma:文本生成最高提速 4 倍

    Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。

    推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。

6月4日周四
5月29日周五
5月28日周四
  1. Mistral AI67

    Mistral 发布工业工程 AI 栈与统一智能体 Vibe,并将在法国建 10 MW 数据中心

    Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,同时保证对专有数据和 IP 的控制。

    推荐理由:Mistral 一次性公布工业工程 AI 栈、统一智能体 Vibe 与自建 10 MW 推理数据中心,可据此观察其企业级全栈布局。

5月27日周三
  1. Mistral AI65

    Mistral 推出面向工程加速的物理 AI 能力

    Mistral 宣布将 Emmi AI 团队并入公司,推出物理 AI 能力,用数据驱动模型从几何与边界条件直接预测物理场,单次前向推理在单 GPU 上以秒级完成,而不是传统 CFD/FEM 的数小时到数周。

    推荐理由:Mistral 把物理仿真做成企业平台的一层能力,并给出合作伙伴与适用行业,可用于判断工业 AI 落地路径。

5月22日周五
5月17日周日
4月27日周一
  1. Mistral AI71

    Mistral AI 发布 Workflows 公开预览版

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,用于把 AI 流程从概念验证推进到生产,ASML、ABANCA、CMA-CGM、France Travail 等组织已用它自动化关键流程。

    推荐理由:原文给出 Workflows 的持久化执行、可观测与人审暂停机制及已落地客户,便于判断企业级 AI 编排如何从 PoC 走向生产。

4月22日周三
4月13日周一
3月31日周二
3月18日周三
  1. Mistral AI66

    Mistral AI 发布 Forge,让企业用私有知识训练前沿模型

    Mistral AI 发布 Forge,一套让企业基于专有知识训练前沿级 AI 模型的系统。Forge 覆盖预训练、后训练和强化学习等模型生命周期阶段,支持 dense 与 MoE 架构及多模态输入,并可由 Mistral Vibe 等智能体用自然语言完成微调和调参。

    推荐理由:原文给出企业用私有数据训练前沿模型的分阶段方案与多个行业落地场景,可据此判断企业自建模型的能力边界。

3月11日周三
1月28日周三
  1. Mistral AI61

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新版本支持自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新,已在 Le Chat Pro 和 Team 套餐上线,超出额度可按 API 价格按量付费或自带 API key。

    推荐理由:原文列出了子智能体、斜杠命令技能与计费方式的变化,读者可据此判断终端编码智能体的可用范围。

1月22日周四