Condé Nast 如何用 Amazon Bedrock 构建多模态视频检索
Condé Nast 与 AWS 生成式 AI 创新中心基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与字幕信号,将单次内容检索耗时从 250 分钟降到 2 分钟以内。
Condé Nast 与 AWS 生成式 AI 创新中心基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,采用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与字幕信号,将单次内容检索耗时从 250 分钟降到 2 分钟以内。
Restate 完成由 Singular 领投、Redpoint Ventures 和 Capital One Ventures 参投的 2000 万美元 A 轮融资。
Destro 结束隐身并以 800 万美元种子轮融资亮相,它不做机器人本体,而是构建 AI 智能层,让机器人也能指挥人类工人在物流场景中协同作业。该方案基于开源权重视觉-语言-动作模型的 Vision 操作系统,由 Mothership 系统统一调度人、货架与卡车,已在 Yusen Logistics 试点,正扩展至 26 台机器人并启动新试点。
Latent Space 播客邀请 OpenAI Computer Use 产品与工程负责人 Ari Weinstein 和 API 团队产品负责人 Nikunj Handa,复盘 DevDay 发布的 Dots、GPT-6.1 Sol、Agents API 与 Decisions API。
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文件并返回带引用的答案。
AWS 官方博客演示如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例自带的 NVIDIA L4 上运行开源音乐生成模型 ACE-Step,20 秒 48kHz 立体声渲染约 9 秒。
推荐理由:文章给出三智能体共享 GPU 实例视频/音频流水线的完整代码与踩坑点,可迁移到其他长时任务编排。
CoreWeave 宣布 NVIDIA Vera Rubin NVL72 系统在 CoreWeave Cloud 上线,并搭配 Spectrum-X 102.4T 以太网,Cognition 成为首个在生产环境运行该平台、支撑 Devin 的客户。
DeepSeek 与华为合作为昇腾芯片构建编程工具,并全部开源,Huawei 表示对此工作给予完全支持。核心是北京大学研究者最初开发的编程语言 TileLang,DeepSeek 已使用约一年,认为它比 CUDA 的编程模型更简单,它也是 DeepSeek 面向 AGI 工作的主要工具。
Amazon Bedrock 在印度区域上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过 geographic cross-Region inference 让推理请求仅在 ap-south-1 与 ap-south-2 之间路由,实现数据留在印度境内。
Amazon Bedrock 现支持在首尔区域使用 Claude Opus 5 和 Claude Sonnet 5、在新加坡区域使用 Claude Sonnet 5,通过 bedrock-runtime 端点实现区域内推理,请求与数据全程不离开所调用区域。
AWS 展示了一套合同智能平台架构:AI 智能体从合同 PDF 中提取八个关键字段并给出置信度,由较轻量的 Claude Haiku 智能体独立复核,签名识别分歧时交由 Amazon Textract 用计算机视觉确定。核验结果写入 Amazon Aurora PostgreSQL,用户可通过嵌入仪表板和自然语言对话查询合同组合级聚合数据与单份合同细节,典型条件下单份合同处理只需数秒。
OpenAI 在 DevDay 2026 主题演讲中发布 Dots 个人智能体、GPT-6.1 Sol 模型、Ultrafast 高速推理以及新的 Agents API。
推荐理由:作者以在场者身份记录 DevDay 全程发布,读者可据此一次性掌握 OpenAI 在智能体、模型与开发者平台上的产品版图。
HPE 指出,当 AI 工作负载变得稳定且关键,按 token 消费的模式会让支出难以预测,企业需在自有算力与按量购买之间划出各自的成本交叉点。Deloitte 2026 企业 AI 状况报告显示,2025 年员工 AI 使用率上升 5%,至少 40% AI 项目进入生产的公司比例预计半年内翻倍。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,支持 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置提供,并支持 Responses、Chat Completions 和 Converse API。
推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度成本权衡,可供工程选型参考。
AWS 发布 vLLM-Omni v1.5 DLC,可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流在一条持久连接上输入文本、回流 24 kHz PCM 音频块,并用 Gradio 应用演示。
在 Amazon SageMaker AI 上,用同一个 AWS vLLM-Omni DLC 镜像部署两个端点:实时端点跑 FLUX.2-klein-4B 图像生成,异步端点跑 Wan2.1-VACE-1.3B 图生视频。
AWS 介绍基于 Amazon Nova Act 和 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代 Selenium、Playwright 依赖的 DOM 选择器,UI 变化时无需改脚本。
Amazon Textract 适配器跨账户管理可通过 AWS Systems Manager Parameter Store 外部化 adapter ID 实现自动化,更新生产环境适配器引用无需停机或重新部署应用,原本需要数小时到数天协调的变更缩短至数秒。
教会团体要求微软捐出数据中心成本的 1%,微软未作回应。Ars 获悉,微软代表在社区会议上难以回答超出其「好邻居」宣传材料的问题;公司承认仅匹配员工慈善捐赠(2024 年 29000 家非营利组织共 2.29 亿美元)并不够,但对更大规模的地方投资一直含糊其辞。批评者认为,与 38 个州数据中心开发商获得的数亿美元州级税收减免相比,微软的地方投资显得尤其少。
AWS 博客介绍在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行、数百加速器间高吞吐通信,以及 MoE 专家并行(EP)带来的跨节点动态 all-to-all 通信开销。文中覆盖 RLHF、GRPO 等大规模 RL 负载在计算、内存和网络带宽上的资源平衡问题。
NarrateAI 在 Amazon Bedrock 上落地五项质量保障技术,为 4,000 多名 AWS 高管提供实时数据问答,数值准确率约 99%。这五项技术分别是自适应流水线编排、跨账号多模型故障转移、实时流式评估、复合评估框架和数据准确性校验;其中约 90% 的查询走单次快速路径,仅约 10% 超出上下文窗口的复杂查询触发并行批处理。
Amazon SageMaker JumpStart 现已支持部署 Qwen3-TTS-12Hz-1.7B-Base,可在全托管实时推理端点上用几秒参考音频完成声音克隆,输出 24 kHz 音频,无需重训练模型。
Airbnb 正在扩大工程团队对 GPT-6 Astra 及 OpenAI 前沿模型的接入,用于排查 bug、设计系统和加快交付。该举措旨在让更多工程团队借助这些模型提升开发效率。
John Platt 在 Latent Space 播客介绍了 Google 的 Empirical Research Assistance(ERA):它用 Gemini 维护一张实验 notebook 树,并用类似蒙特卡洛树搜索的 UCB 规则挑选 notebook 进行变异,把可写成打分函数的科学问题自动化求解。
TypeSafe AI 发布 Jev,这是其称为 System One 模型的新类别,仍接受文本输入,但输出的是对应分类、是/否问题和评分的浮点数字及置信度,输入定价 $0.042/百万 token,输出免费。
Cloudflare 在历经两年预览后,正式 GA Python Workers,Python 成为 Cloudflare Developer Platform 上一等且完整支持的语言。
InstructGPT 论文作者之一、TypeSafe AI CEO Diogo Almeida 在播客中介绍新模型 Jev,定位为机器原生、面向代码消费的 System One 大模型,按每美元智能而非聊天体验优化,用于编程中不追求确定性而强调可靠性。
NVIDIA 在开罗举办埃及 AI 生态活动,其 Deep Learning Institute 在埃及的学员规模一年内增长超十倍。埃及已有超 85,000 名开发者接受 NVIDIA 培训,尼日利亚成为该机构全球第二大市场;Cassava 与 Vodafone 埃及宣布共建 AI 工厂,通过 GPU-as-a-service 提供本地托管 AI 基础设施。
NVIDIA 提出把 AI 安全当作工程问题来对待:Agent 栈从模型、harness 到运行时环境每一层都需有可执行的边界、明确责任人和验证证据。其开源的 NVIDIA OpenShell 提供策略在 Agent 触及范围之外强制生效的安全运行时,并支持沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。
NVIDIA 在纽约气候周期间介绍了 5 家用 AI 加速清洁能源落地的公司。ThinkLabs AI 用 NVIDIA CUDA 平台构建数字孪生与智能体,帮助南加州爱迪生将电网并网申请评估时间从 30-45 天缩短到 2 分钟;Redwood Materials 用 100% 回收的电动车电池为 AI 工厂提供离网供电,系统基于 NVIDIA Blackwell 平台运行。
Hugging Face 为即将发布的 tokenizers v1 重构性能,速度常达 v0.23 的十倍以上。v1 保持与 v0.23 相同的 token ID、API、词表和 merge ranks,通过 bitcannon 用 SIMD 位流替代正则做切分,并将 crate 拆分为工作区、引入无分配模型、merge 循环重写、线程本地词缓存和原生并行编码。
Steve Yegge 关停了 Gas Town,并承认每月花费数千美元订阅编码智能体,却只做出这一个项目。Databricks 向约 3500 名工程师铺开 GPT-6 Astra,表示其在复杂长周期任务上"明确"优于 Opus 5 / Sol 5.6,但整体编码支出增加约 60%。OpenAI 发布模型失准事件追踪与披露框架,并附上过去六个月的六份案例报告。
NVIDIA 在 MLPerf Inference v6.1 首次提交 Vera Rubin NVL72 预览成绩,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高为 2.5 倍。
推荐理由:NVIDIA 官方首次公布 Vera Rubin NVL72 的 MLPerf 推理成绩,并给出跨机架扩展与软件迭代的量化对比,可供判断推理经济学走向。
Emerald AI、Google 和 NVIDIA 宣布成立 AI 能源管理联盟(AEMA),推动数据中心根据电网状况动态调节用电。该联盟采取技术中立、基于性能的方式,聚焦响应速度、持续时间和紧急状态下的行为等可衡量指标,并要求在设施接入前明确穿越、限电与应急响应义务。
TypeSafe 发布名为 Jev 的决策模型,官方称其专为分类、路由与打分等决策任务优化,采用 RLCD 训练,比小型前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,用一年英国逐小时污染模拟数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 单节点八卡上仅用两天完成训练并一次成功。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,涵盖功率优化软件 DSX MaxLPS、电网响应组件 DSX Flex、开源管理软件 DSX OS、仿真工具 DSX Sim 和参考设计。
OpenAI 把内部 Python 库 Habitat 演进为支撑 10 亿 ChatGPT 用户、每秒 2200 万请求的全球分布式存储平台。
TRL v1.14 的 AsyncGRPOTrainer 支持只训练并同步 LoRA 适配器到 vLLM,rank-1 适配器仅几 MB,可经由各 Job 挂载的 Storage Bucket 传输,从而让训练与推理分属不同 Hugging Face Jobs,无需 NCCL。