Hugging Face 提出一致性指南:让 Agent 重复跑同一任务不再翻车
Hugging Face 发布 altk-evolve 的"一致性指南"(consistency guidelines),配合 Consistency Analyzer 定位 Agent 决策中易翻转的步骤。
Hugging Face 发布 altk-evolve 的"一致性指南"(consistency guidelines),配合 Consistency Analyzer 定位 Agent 决策中易翻转的步骤。
Fyxer 基于 OpenAI 模型构建 AI 行政助理,结合微调、记忆能力与真实用户反馈,帮助用户整理收件箱并按每位用户的语言风格起草邮件。
Perplexity 用 GPT-6 Astra 撰写沟通内容、修改软件并监控生产系统,对模型的检查频率远低于早期模型。
Cognition 借助 GPT‑6 Astra 提升 Devin 测试软件并验证其可用的能力,目标是让工程师减少代码审查、交付更多。
OpenAI 把内部 Python 库 Habitat 演进为支撑 10 亿 ChatGPT 用户、每秒 2200 万请求的全球分布式存储平台。
César de la Fuente 的实验室正用 Codex 和 ChatGPT 在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户可用自然语言连接公司数据、挖掘洞察并构建交互式仪表盘。该功能面向所有用户开放,让数据分析和可视化不再依赖专业工具或技能。
OpenAI 发布 ChatGPT for Financial Services,内置金融数据并整合 GPT-6 Astra,用于研究、建模和生成面向客户的材料。原文仅给出这一句产品说明,未披露定价、上线时间或具体数据来源。
OpenAI 与美国总务管理局(GSA)合作,向符合条件的联邦、州、地方及部落政府提供 $0 许可费和 50% 的使用费折扣,并扩大网络安全防护支持。
TRL v1.14 的 AsyncGRPOTrainer 支持只训练并同步 LoRA 适配器到 vLLM,rank-1 适配器仅几 MB,可经由各 Job 挂载的 Storage Bucket 传输,从而让训练与推理分属不同 Hugging Face Jobs,无需 NCCL。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 把 AUTOMATIC1111 stable-diffusion-webui 的大部分功能重建为单张工作流画布。
推荐理由:用 73 个节点复刻 A1111 的十一类图像与视频管线,可直观看到节点式工作流的组织方式与复用边界。
OpenAI 发布 Agents API,这是一个由 Codex harness 驱动的托管服务,用于编排、长时间运行的会话和工具调用,让开发者构建并上线云端智能体。
推荐理由:原文给出了 Agents API 的托管定位与 Codex harness 支撑,读者可据此判断云端智能体的构建方式。
OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上有提升,同时支持自定义音色和电话语音(telephony)接入。
推荐理由:OpenAI 把全双工语音对话开放到 API,开发者可据此评估实时语音应用的改造路径。
Paul Christiano 加入 OpenAI Foundation 董事会,同时进入其安全与安全委员会。他此前在 AI 对齐、安全与标准方面拥有相关经验。
OpenAI 的 Chris Lehane 认为,AI 能力越强,就越需要更充分的安全证据、共享标准和持久的政策行动。他指出当前政策窗口仍然敞开,各方应抓住时机推动落地。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 水库模拟器迁移到 C++,该代码库没有测试套件,也没有集中文档。做法是先搭数值一致性校验框架,用自研 parser 生成调用树并让上百个智能体借助 Mistral OCR 归档散落文档,再以 coder、tester、reviewer 加人工检查点的结构化工作流逐模块迁移。
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备更强的推理能力、计算机操作能力,以及更强的写作与设计判断力。
推荐理由:OpenAI 官方发布面向企业场景的新一代模型,读者可据此了解其在推理与计算机操作上的定位。
一位 MIT 研究员用 GPT-5.6 Sol 配合 Codex 自主运行量子计算实验,完成结果分析与量子比特校准。
OpenAI 探讨更强大、更可负担的 AI 如何拓展个人与企业能完成的工作范围,并让增长更经济。文章聚焦能力提升与成本下降对工作产出的双重影响,未披露具体模型、参数或价格信息。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。
推荐理由:Mistral 以 30 亿欧元 D 轮融资明确把开源权重与主权 AI 绑定为商业路线,读者可据此观察欧洲 AI 的资本与定位取向。
OpenAI 发布 ChatGPT Images 2.5,可将想法、草图与参考照片转化为更个性化、更精细的图像,更贴近用户原本的构想。
OpenAI 扩大对新闻业的支持,面向学生、教育工作者、记者和新闻机构提供工具、培训与合作伙伴关系,覆盖从课堂到新闻编辑室的多个环节。
OpenAI 分享了一份 AI 生成的 Navier–Stokes 千禧年大奖难题解答,包含一份书面说明和一份 Lean 形式化证明。该问题属于千禧年大奖难题之一。
OpenAI 开放 500 万美元资助计划申请,支持针对生成式 AI 如何影响青少年发展、心理健康与安全的独立研究。该计划面向独立研究者征集项目。
1Password 的工程师使用 Codex 快速构建新功能和内部工具,在维持严格安全策略的同时达到可投产状态,工程效率提升 21%。
OpenAI、AIRPPU 与 WAN-IFRA 联合启动一项 AI 项目,帮助乌克兰新闻机构提升创新能力、韧性建设与独立新闻水平。
GitHub Copilot 在 CLI 中通过 /experimental 开放 Project HydraFusion 研究预览,用户在 /model 中选择后由运行时编排多模型完成任务。
推荐理由:GitHub Copilot 官方给出多模型编排研究预览的三种执行模式与三个基准的成本质量数据,可据此判断路由策略的取舍。
GitHub Copilot app 支持同时运行多个 AI 智能体会话,每个会话运行在独立的 Git worktree 上、彼此互不干扰,并各自保留上下文,可随时切换而无需重新解释任务。会话视图中每张卡片显示任务标题和智能体完成进度,用户可在同一项目上并行推进多项任务,把时间花在审查和决策上。官方建议先从两个小任务同时开始试用。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步的轻量微调,在 IFStruct benchmark 上把合规率从基线 22.6% 提升到 29.7%。
Hugging Face 发布 funes,一个为编码智能体提供持久记忆层的开源工具,支持 Claude Code、Codex、pi 和 Hermes。它用单条命令安装,通过本地嵌入与重排把历史会话索引成本地 Lance 数据集,并可按需发布为默认私有的 Hugging Face 数据集,让不同智能体跨机器召回彼此推理过程。
推荐理由:funes 把聊天记录变成可检索的本地记忆层,读者可据此判断跨智能体协作的落地方式。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型写 JavaScript 绘制水彩画的方案,数据集、RL 环境、训练脚本和模型全部开源。
Google DeepMind 推出 Fairwind Program 有限访问计划,向 Google Cloud 客户、政府机构和网络安全伙伴开放其最先进的网络防御能力。
推荐理由:官方披露 Fairwind 计划的能力组合与准入范围,读者可据此判断前沿网络防御能力的开放节奏。
Google DeepMind 发布 Gemini 3.8 系列,包含通用模型 Gemini 3.8 Flash 和网络安全模型 Gemini 3.8 Flash Cyber,二者共用同一底层智能。
推荐理由:官方给出了两款 Gemini 3.8 Flash 的评测成绩与定价,可对照 3.7 Flash 判断智能体编码与网络安全任务上的取舍。
Hugging Face 发布 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维 Item Response Theory(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练后自主识别出安全与通用推理两个主导维度。
Google Research 发布 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化并定位全球甲烷点源,在专家标注羽流上召回率达 84%,信噪比优于现有匹配滤波方法。
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,视频分析 token 消耗最多降低 88%、成本最多降低 66%、准确率最多提升 7%。
推荐理由:官方给出视频分析在 token、成本与准确率上的量化变化,并说明可用入口和启用方式,便于开发者评估是否迁移现有视频处理流程。
Hugging Face 的 WebAI 团队发布 @huggingface/kernels,一个可从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 加载库,同时上线 207 个以独立仓库形式发布的 kernel,采用 Apache-2.0 许可。
Google 发布 TimesFM-3,这是其时间序列基础模型的新一代版本,原生支持多变量预测,参数规模 3.3 亿,在超过 1 万亿个时间点的真实与合成时序语料上预训练。
推荐理由:TimesFM-3 从单变量扩展到原生多变量预测,读者可了解一次前向传播完成多序列预测的架构取舍。
Hugging Face 的 Open ASR Leaderboard 新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,这是该榜单多语言标签下首个 Indic 语言,也是其首个全球南语种。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供给开发者,新增场景延长、首尾帧插值、360p 快速草稿和 4K 放大等能力。
推荐理由:原文列出场景延长、首尾帧插值和 4K 放大等具体能力与价格入口,可据此判断生成视频工作流的变化。