AMD 以 8.2 亿美元收购 World Labs,加码对抗 Nvidia
AMD 与 World Labs 宣布,AMD 将在年底前收购这家世界模型公司,交易金额 8.2 亿美元,尚待监管批准。World Labs 由计算机视觉学者李飞飞于 2024 年与 Justin Johnson、Christoph Lassner、Ben Mildenhall 共同创立,最初融资 2.3 亿美元,其中部分来自 AMD。
AMD 与 World Labs 宣布,AMD 将在年底前收购这家世界模型公司,交易金额 8.2 亿美元,尚待监管批准。World Labs 由计算机视觉学者李飞飞于 2024 年与 Justin Johnson、Christoph Lassner、Ben Mildenhall 共同创立,最初融资 2.3 亿美元,其中部分来自 AMD。
AWS 官方博客演示如何在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线:作曲智能体用 Claude Sonnet 4.6 生成音乐简报并在实例自带的 NVIDIA L4 上运行开源音乐生成模型 ACE-Step,20 秒 48kHz 立体声渲染约 9 秒。
推荐理由:文章给出三智能体共享 GPU 实例视频/音频流水线的完整代码与踩坑点,可迁移到其他长时任务编排。
DeepSeek 与华为合作为昇腾芯片构建编程工具,并全部开源,Huawei 表示对此工作给予完全支持。核心是北京大学研究者最初开发的编程语言 TileLang,DeepSeek 已使用约一年,认为它比 CUDA 的编程模型更简单,它也是 DeepSeek 面向 AGI 工作的主要工具。
Anthropic 公布评测结果,称智谱开源权重模型 GLM-5.3 在漏洞利用开发上接近其 Claude Mythos Preview。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源与多语言 TTS 模型:以 Qwen3 ASR 计算 WER/CER、用 RTFx 和 TTFA 衡量速度、以 WavLM 嵌入向量余弦相似度(SIM)衡量声音克隆。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,在 Hugging Face 上提供权重。给定带标签行的表格,它在单次前向传播中预测新行标签,无需训练、调参和特征工程,支持分类与回归,提供 28M 至 215M 三档参数规模,采用 OpenMDW-1.1 许可可商用。
推荐理由:原文公开了表格基础模型的三档规模、单次前向推理方式和四个基准排名,可据此判断无训练微调的表格预测路径。
AMD 以 82 亿美元收购 World Labs,后者由李飞飞创立,专注空间智能。World Labs 近期发布 Atlas,这是一种从零训练的 omni 模型架构,能从 2D 图像输入预测新视角,性能超过专用模型,解决了计算机视觉中长期存在的稀疏重建问题,潜在应用覆盖机器人仿真、设计工程、科学等领域。
AWS 发布 vLLM-Omni v1.5 DLC,可在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流在一条持久连接上输入文本、回流 24 kHz PCM 音频块,并用 Gradio 应用演示。
在 Amazon SageMaker AI 上,用同一个 AWS vLLM-Omni DLC 镜像部署两个端点:实时端点跑 FLUX.2-klein-4B 图像生成,异步端点跑 Wan2.1-VACE-1.3B 图生视频。
AWS 博客介绍在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行、数百加速器间高吞吐通信,以及 MoE 专家并行(EP)带来的跨节点动态 all-to-all 通信开销。文中覆盖 RLHF、GRPO 等大规模 RL 负载在计算、内存和网络带宽上的资源平衡问题。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行后训练,在固定 64 个迷宫评测集上把迷宫求解率从 43.75% 提升到 95% 以上。
Amazon SageMaker JumpStart 现已支持部署 Qwen3-TTS-12Hz-1.7B-Base,可在全托管实时推理端点上用几秒参考音频完成声音克隆,输出 24 kHz 音频,无需重训练模型。
Latent Space 宣布将合并 AINews 与 Discord 的职能、推出 AINews v3,并探索迁移至 Beehiiv 和新首页,同时重新开放赞助与 PR 投稿。
Datasette 1.0a41 发布,Alec Garcia 为该版本加入了 OpenTelemetry 支持。此版本还将 Datasette 的所有模态对话框重构为单个 Web Component,并已编写文档供其他插件使用。
AI 让思考变得廉价但实验本身并未加速,生物科技行业由此分化出两种路径:Foundries 用下一代测序、高通量显微和物理自动化把实验数据生成速度提升一个数量级,Navigators 则把模型嵌入公司日常流程以加快决策。Navigators 虽不显眼却适用于所有公司,早期的 Endura Therapeutics 已用几小时搭建内部仪表盘,使实验分析从一周缩短到一小时。
Meta 在 Connect 2026 上把个人智能体 Muse 作为硬件加智能体战略的核心,发布相关智能体功能与新眼镜,仅预告而未发布新前沿模型。Muse 现已支持语音与实时视频,可后台持续处理任务,并将在所有 Meta 眼镜上以唤醒词激活;每台 Muse 拥有独立邮箱地址,Mac 版 Muse 支持计算机使用。
小米发布 MiMo-V2.6 系列,包含原生全模态的 MiMo-V2.6-Pro(1.02T 总参数、42B 激活)和 MiMo-V2.6-Flash,并推出输出速度最高快 20 倍的 UltraSpeed 版本。
推荐理由:小米 MiMo-V2.6-Pro 以约 300 万美元训练成本登顶开放权重模型,其 RL 环境与训练配方同步开源值得关注。
TypeSafe 发布名为 Jev 的决策模型,官方称其专为分类、路由与打分等决策任务优化,采用 RLCD 训练,比小型前沿 LLM 快 100 倍以上、便宜 200 倍以上,输出 token 不计费。
曼彻斯特大学团队基于 NVIDIA Earth-2 的生成式模型 Earth-2 CorrDiff,用一年英国逐小时污染模拟数据训练出覆盖全英、分辨率 2-3 平方公里的空气污染模型,在 Isambard-AI 单节点八卡上仅用两天完成训练并一次成功。
TRL v1.14 的 AsyncGRPOTrainer 支持只训练并同步 LoRA 适配器到 vLLM,rank-1 适配器仅几 MB,可经由各 Job 挂载的 Storage Bucket 传输,从而让训练与推理分属不同 Hugging Face Jobs,无需 NCCL。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。
推荐理由:Mistral 以 30 亿欧元 D 轮融资明确把开源权重与主权 AI 绑定为商业路线,读者可据此观察欧洲 AI 的资本与定位取向。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步的轻量微调,在 IFStruct benchmark 上把合规率从基线 22.6% 提升到 29.7%。
Hugging Face 发布 funes,一个为编码智能体提供持久记忆层的开源工具,支持 Claude Code、Codex、pi 和 Hermes。它用单条命令安装,通过本地嵌入与重排把历史会话索引成本地 Lance 数据集,并可按需发布为默认私有的 Hugging Face 数据集,让不同智能体跨机器召回彼此推理过程。
推荐理由:funes 把聊天记录变成可检索的本地记忆层,读者可据此判断跨智能体协作的落地方式。
Hugging Face 的 WebAI 团队发布 @huggingface/kernels,一个可从 Hugging Face Hub 加载并运行优化 WebGPU kernel 的 JavaScript 加载库,同时上线 207 个以独立仓库形式发布的 kernel,采用 Apache-2.0 许可。
Google 发布 TimesFM-3,这是其时间序列基础模型的新一代版本,原生支持多变量预测,参数规模 3.3 亿,在超过 1 万亿个时间点的真实与合成时序语料上预训练。
推荐理由:TimesFM-3 从单变量扩展到原生多变量预测,读者可了解一次前向传播完成多序列预测的架构取舍。
Hugging Face 博客介绍 Sentence Transformers v6.0 新增的 MultiVectorEncoder 模型类型,并给出 ColBERT 式后交互检索模型的完整训练与微调流程。
IBM Granite 团队发布 Granite 4.2 系列推理模型,包含 3B、8B、30B 三种稠密尺寸,均以 Apache 2.0 许可开源,并从 Granite-4.1 基座模型后训练而来。
推荐理由:原文给出了从预训练到多阶段强化学习的完整构建细节,读者可以据此理解推理模型的训练配方与工程取舍。
Papers with Code 采用混合搜索系统支撑论文检索,结合 PostgreSQL 全文检索与 pgvector 向量召回,并用 RRF 算法融合两路结果。
Hugging Face 最新研究用三项测试量化语音识别中的“benchmaxxing”,评估 11 款开源 ASR 模型后发现,多款高分模型会复现 VoxPopuli 英文集和 LibriSpeech(clean、other)的基准转录文本,即使音频与之矛盾或相关词已被静音。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索,PyLate、Stanford-NLP ColBERT 及 colpali-engine 视觉文档检索模型均可直接加载,沿用与稠密、稀疏、reranker 模型相同的 API。
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比测试:相同硬件、相同负载下,GPU 利用率最多提升 33 个百分点,优先级加权产出在每个场景中都有提高,最高增幅 105%。
Hugging Face 发布 2026 年 1 至 8 月的开源模型观察报告,模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万。
Hugging Face 博客给出 Strands Robots 的流式数据循环教程:机器人演示录成 LeRobot 格式后同步进 Storage Bucket,训练时用 stream_dataset() 从 Hub 按分片直接读取而不下载,训练好的 checkpoint 改一个 mode="real" 参数即可部署回硬件。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条验证论文结论,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,占会议接收论文的 34%。
推荐理由:Hugging Face 公开 ICML 2026 论文复现活动的数据与方法,读者可据此看到智能体做科研复现的真实边界与人类角色。
Mistral 宣布三项推进主权 AI 的动作:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲还是美国运行;Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把推理区域选择、SLA 保障与第三方开源模型接入放进同一平台,可看作欧洲主权 AI 基础设施的具体落地路径。
NVIDIA Magpie TTS Multilingual 开放权重模型开放权重、364M 参数,新增 Modern Standard Arabic、韩语和巴西葡萄牙语,共支持 12 种语言,并经由 NVIDIA NIM 在自有基础设施部署。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型每位置的 top-100 logits 做离线蒸馏,并把输出投影融合进分块 KL 损失计算,使峰值显存只随序列长度线性增长。
Meta 发布开源多模态模型 Muse Glimmer,从 Muse 蒸馏至 30B 参数,采用 Apache 2.0 许可,面向编码、文档分析、个人助理等本地智能体场景。
推荐理由:Meta 开源 30B 多模态模型,附 day-0 推理与量化支持,可用于评估本地智能体模型的落地方案。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到 SOTA,平均可多提供一天预报时效,三天预报精度相当于此前模型的两天水平。
推荐理由:官方给出气旋路径与强度预测多出一天预警时间的评估结果,并同时开源模型与权重,可据此判断气象预报模型的可用边界。
Baseten 成为 Hugging Face Hub 新支持的 Inference Provider,首批上线对话与文本生成任务,可访问 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等热门开源权重 LLM。