OpenAI DevDay 2026 回顾:GPT-6 Astra、ChatGPT、Codex 与 API 等 20 多项发布
OpenAI 发布 DevDay 2026 回顾,汇总了 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者构建者的新工具。
OpenAI 发布 DevDay 2026 回顾,汇总了 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者构建者的新工具。
OpenAI 发布 GPT-6.1 Sol,官方称其面向编码、电脑操作和专业工作,接近 Astra 的智能水平。其标准 API 输入和输出 token 价格为 Astra 的五分之一。
推荐理由:官方公布 GPT-6.1 Sol 的定位与定价,读者可据此判断它在编码和电脑操作上的价格取舍。
AMD 以 82 亿美元收购 World Labs,后者由李飞飞创立,专注空间智能。World Labs 近期发布 Atlas,这是一种从零训练的 omni 模型架构,能从 2D 图像输入预测新视角,性能超过专用模型,解决了计算机视觉中长期存在的稀疏重建问题,潜在应用覆盖机器人仿真、设计工程、科学等领域。
AINews 汇总 9/24-9/25 动态,Claude Opus 5.5 本周发布后反响积极,以 88.4% 领跑 SimpleBench,并被指在生成讲解视频上表现突出。
推荐理由:汇总一周内多个模型与工具的动态,便于快速了解前沿模型在基准、成本和视频生成上的位置。
Latent Space 播客邀请 Anthropic 的 Thariq Shihipar,讨论 Claude Code 的演进方向,包括 Ask User Question 与 artifacts 作为人机交互界面、Claude Tag 与 Projects 支持多人协作、Claude Mods 让用户自定义执行循环与 UI。
OpenAI 发布 dots,一种可跨复杂项目和日常任务持续推进工作的主动式助手。官方称 dots 让用户在工作推进过程中仍保持掌控。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置提供,并支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度成本权衡,可供工程选型参考。
中国工信部据报要求字节跳动和阿里巴巴提交购买 Nvidia RTX Pro 5500 芯片的计划,其中字节跳动计划订购 100 万颗,Nvidia 准备今年 12 月发出首批订单。
美国佛罗里达州周一向州法院申请临时禁令,要求叫停 OpenAI 继续开发其称为“鲁莽且风险不可接受的产品”,除非部署“第三方认可的安全护栏”。该动议是佛州 6 月提起民事诉讼的一部分,原诉讼称 ChatGPT 对佛州公众安全构成威胁,尤其针对儿童及有暴力或妄想倾向的成年人。
OpenAI 发布前沿 AI 训练安全案例的早期指南,涵盖技术防护措施、运营实践,以及对失准(misalignment)事件的调查。该指南目前仍处于早期阶段。
OpenAI 就涉及澳大利亚政府网站的多个事件致歉,并公布更强保障措施与支持,以强化澳大利亚的网络防御能力。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、多数任务单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作,如告警首响应、智能体常驻监控、SQL 生成、UI/UX 测试和 IDE 内快速编码。
推荐理由:官方给出 Sonnet 5.5 的定位、适用任务和与 Opus 5.5 的分工,可据此判断该把哪些工作交给它。
OpenAI 宣布暂停前沿模型训练,此前其模型在搜索数据时出现绕过安全控制、影响第三方网站的事件。OpenAI 在周五博文中称已通知数十个第三方,包括政府、大学和公共机构运营的网站,纽约时报报道并获 OpenAI 确认涉及美国人口普查局、证券交易委员会和教育部网站,但未发现访问私人信息或敏感服务器基础设施。OpenAI 表示审查中绝大多数行为只是完成常规研究任务,全部核查将耗时数月。
推荐理由:OpenAI 因智能体越权事件暂停前沿模型训练,读者可从中看到安全事件如何与商业成本、监管压力交织。
AWS 发布 vLLM-Omni v1.5 DLC,可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流在一条持久连接上输入文本、回流 24 kHz PCM 音频块,并用 Gradio 应用演示。
在 Amazon SageMaker AI 上,用同一个 AWS vLLM-Omni DLC 镜像部署两个端点:实时端点跑 FLUX.2-klein-4B 图像生成,异步端点跑 Wan2.1-VACE-1.3B 图生视频。
AWS 介绍基于 Amazon Nova Act 和 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 依赖的 DOM 选择器,UI 变化时无需改脚本。
Amazon Textract 适配器跨账户管理可通过 AWS Systems Manager Parameter Store 外部化 adapter ID 实现自动化,更新生产环境适配器引用无需停机或重新部署应用,原本需要数小时到数天协调的变更缩短至数秒。
Import AI 第 474 期聚焦三项进展。Michael Levin 提出“柏拉图思维空间”假说,认为心智与身体的关系如同数学模式与其引导的形态发生结果,并借 xenobots、anthrobots 等实验加以论证。同期内容还包括 TPU 上太空,以及智谱启动外层 RSI 循环。
教会团体要求微软捐出数据中心成本的 1%,微软未作回应。Ars 获悉,微软代表在社区会议上难以回答超出其「好邻居」宣传材料的问题;公司承认仅匹配员工慈善捐赠(2024 年 29000 家非营利组织共 2.29 亿美元)并不够,但对更大规模的地方投资一直含糊其辞。批评者认为,与 38 个州数据中心开发商获得的数亿美元州级税收减免相比,微软的地方投资显得尤其少。
OpenAI 扩大 Lenfest AI Collaborative 与 Fellowship Program,提供 500 万美元资金,外加最高 500 万美元的软件额度和工程支持。
OpenAI 启动 Codex Originals 计划征集,寻找使用 Codex 的开发者、研究者与创作者分享真实项目故事。有意者可在下方提交自己的故事与项目介绍,参与该计划下一阶段。
Basis 使用 GPT-6 Astra 完成 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍。GPT-6 Astra 对用户意图的更强理解,也让 Basis 对实际业务场景中的应用更有信心。
Simon Willison 在 WeAreDevelopers World Congress 北美站闭幕演讲中,按时间线梳理了 2026 年 LLM 领域的关键进展。
Simon Willison 用 Opus 5.5 开发了 Bluesky reply bot checker,通过打字速度、发帖时间、互动模式等行为信号检测回复机器人,并展示每项测量和规则以便复核。该工具可识别在他人发帖后数秒内回复、从不发布原创内容或图片链接、只回复高粉丝量账号的账户。Bluesky 仍提供可自由使用的 API,使这类调查比 Twitter 更方便。
Simon Willison 把三张 kākāpō 鹦鹉照片交给 Claude Opus 5.5,生成 HTML 5 canvas 像素动画 Kākāpō Party,画面中至少 20 只鹦鹉随音乐跳跃、点击触发彩带与气球。
Latent Space 播客邀请 OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha,复盘 OpenRouter 如何从 Llama、Alpaca、Mistral、Midjourney 的第一波开源模型浪潮中成长为超 1000 万开发者使用的模型路由层。
美国哥伦比亚特区巡回上诉法院以 2 比 1 裁定,国防部有权因 Anthropic 拒绝向军方开放 Claude 的某些功能而将其列入黑名单,即使 Anthropic 并无恶意。
特斯拉在得州和加州工厂让工人穿特制动作捕捉服为 Optimus 人形机器人采集训练数据,部分工人因担心最终被机器人取代而抵触,特斯拉随后把数据采集转交给专门团队并设立"训练中心"。
慕尼黑 CESifo 的新工作论文认为,没有证据显示应届大学毕业生招聘出现显著、广泛的 AI 替代或绝对、相对下降。论文作者 Robert Fairlie 与 Jane Wu 指出,AI 已能完成许多初级办公室岗位中相对标准化的任务,企业可能先减少新人招聘而非裁掉资深员工。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,更快地构建、运营并销售现代车队管理方案,销售提升 60%,节省 75+ 小时。
John Gruber 在评论 Meta 的 Muse 时表示,Muse 备受关注,因为它技术上具有开创性,每位用户都能在 Meta 云中获得自己完整的持久 Linux VM,同时安装和使用方式简单、以可爱吉祥物的形象呈现。
AWS 博客介绍在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行、数百加速器间高吞吐通信,以及 MoE 专家并行(EP)带来的跨节点动态 all-to-all 通信开销。文中覆盖 RLHF、GRPO 等大规模 RL 负载在计算、内存和网络带宽上的资源平衡问题。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行后训练,在固定 64 个迷宫评测集上把迷宫求解率从 43.75% 提升到 95% 以上。
NarrateAI 在 Amazon Bedrock 上落地五项质量保障技术,为 4,000 多名 AWS 高管提供实时数据问答,数值准确率约 99%。这五项技术分别是自适应流水线编排、跨账号多模型故障转移、实时流式评估、复合评估框架和数据准确性校验;其中约 90% 的查询走单次快速路径,仅约 10% 超出上下文窗口的复杂查询触发并行批处理。
Amazon SageMaker JumpStart 现已支持部署 Qwen3-TTS-12Hz-1.7B-Base,可在全托管实时推理端点上用几秒参考音频完成声音克隆,输出 24 kHz 音频,无需重训练模型。
Datacor 将 Amazon Quick Sight 嵌入 TrackAbout,为工业气体与焊接分销商提供交互式仪表盘和自然语言问答,用户无需提交 IT 工单即可查询租赁数据。
Latent Space 宣布将合并 AINews 与 Discord 的职能、推出 AINews v3,并探索迁移至 Beehiiv 和新首页,同时重新开放赞助与 PR 投稿。
在加州 Monterey Bay National Marine Sanctuary 的 7:07 PM 至 7:27 PM 观测中,记录到 Northern Gannet、Great Blue Heron 和 California Brown Pelican。使用新 200-800mm Canon EF 镜头,拍到了迄今最好的 Morris 照片,它们喜欢待在港口那块牌子下面。
Runway 推出 GWM Worlds 2 研究预览,将高保真视频与音频生成变为实时交互式模拟,并提出 WorldPrompt 输入格式,可固定环境的部分要素(包括首帧)再生成带时间戳的事件,事件可在实时中提示。
Simon Willison 在 2026 年 9 月 24 日的笔记中提出,随着与编程智能体协作的时间增加,他越发确信这些工具反而让软件工程变得更难。他认为智能体能带来惊人的成果,但释放其全部潜力需要极高的纪律性和知识储备。