Cerebras CEO Andrew Feldman 将在 TechCrunch Disrupt 2026 探讨 AI 能否持续扩展
Cerebras Systems CEO 兼联合创始人 Andrew Feldman 将在 TechCrunch Disrupt 2026 的 Disrupt Stage 发表“Can AI Keep Scaling?
Cerebras Systems CEO 兼联合创始人 Andrew Feldman 将在 TechCrunch Disrupt 2026 的 Disrupt Stage 发表“Can AI Keep Scaling?
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,在生物代码中嵌入不可感知的签名,使其不只在数字模型上、也能在合成出的实体蛋白质上被验证,同时保留其生物功能。
推荐理由:Google DeepMind 把水印技术从图像扩展到蛋白质与 3D 结构,读者可看到生物安全筛查的一层新验证思路。
OpenAI 表示已阻断一起试图提取其受保护模型推理的协同蒸馏行动,并正在加强对对抗性蒸馏的防御。原文未给出更多细节。
亚马逊 AWS 发布 Amazon Quick 提示词工程基础指南(Part 1),给出跨组件通用的提示词设计原则与可复用框架。文章涵盖清晰具体、业务上下文和示例教学等核心原则,以及用于复杂请求的 CRISPE 框架,Part 2 将讲解 Research、Flows、Sight、Chat Agents 和 Action Integrations 的组件专属技巧。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,在 Hugging Face 上提供权重。给定带标签行的表格,它在单次前向传播中预测新行标签,无需训练、调参和特征工程,支持分类与回归,提供 28M 至 215M 三档参数规模,采用 OpenMDW-1.1 许可可商用。
推荐理由:原文公开了表格基础模型的三档规模、单次前向推理方式和四个基准排名,可据此判断无训练微调的表格预测路径。
Microsoft Research 发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与科研人员的交互式 harness 两部分组成。
推荐理由:微软研究院公开了面向生物学的多模态世界模型 Quine 及其与 Broad Institute 合作的湿实验验证结果。
HPE 指出,当 AI 工作负载变得稳定且关键,按 token 消费的模式会让支出难以预测,企业需在自有算力与按量购买之间划出各自的成本交叉点。Deloitte 2026 企业 AI 状况报告显示,2025 年员工 AI 使用率上升 5%,至少 40% AI 项目进入生产的公司比例预计半年内翻倍。
Amazon Textract 适配器跨账户管理可通过 AWS Systems Manager Parameter Store 外部化 adapter ID 实现自动化,更新生产环境适配器引用无需停机或重新部署应用,原本需要数小时到数天协调的变更缩短至数秒。
Basis 使用 GPT-6 Astra 完成 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍。GPT-6 Astra 对用户意图的更强理解,也让 Basis 对实际业务场景中的应用更有信心。
特斯拉在得州和加州工厂让工人穿特制动作捕捉服为 Optimus 人形机器人采集训练数据,部分工人因担心最终被机器人取代而抵触,特斯拉随后把数据采集转交给专门团队并设立"训练中心"。
AWS 博客介绍在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行、数百加速器间高吞吐通信,以及 MoE 专家并行(EP)带来的跨节点动态 all-to-all 通信开销。文中覆盖 RLHF、GRPO 等大规模 RL 负载在计算、内存和网络带宽上的资源平衡问题。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行后训练,在固定 64 个迷宫评测集上把迷宫求解率从 43.75% 提升到 95% 以上。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 认为生物安全正演变为 AI 军备竞赛,防御方目前处于下风,主张更激进地推进前沿模型能力。
John Platt 在 Latent Space 播客介绍了 Google 的 Empirical Research Assistance(ERA):它用 Gemini 维护一张实验 notebook 树,并用类似蒙特卡洛树搜索的 UCB 规则挑选 notebook 进行变异,把可写成打分函数的科学问题自动化求解。
Parallel 的智能体借助 GPT-6 Astra 完成劳动力市场数据的检索与综合,相比此前模型将时间和成本各降低一半。
小米发布 MiMo-V2.6 系列,包含原生全模态的 MiMo-V2.6-Pro(1.02T 总参数、42B 激活)和 MiMo-V2.6-Flash,并推出输出速度最高快 20 倍的 UltraSpeed 版本。
推荐理由:小米 MiMo-V2.6-Pro 以约 300 万美元训练成本登顶开放权重模型,其 RL 环境与训练配方同步开源值得关注。
NVIDIA 在开罗举办埃及 AI 生态活动,其 Deep Learning Institute 在埃及的学员规模一年内增长超十倍。埃及已有超 85,000 名开发者接受 NVIDIA 培训,尼日利亚成为该机构全球第二大市场;Cassava 与 Vodafone 埃及宣布共建 AI 工厂,通过 GPU-as-a-service 提供本地托管 AI 基础设施。
Steve Yegge 关停了 Gas Town,并承认每月花费数千美元订阅编码智能体,却只做出这一个项目。Databricks 向约 3500 名工程师铺开 GPT-6 Astra,表示其在复杂长周期任务上"明确"优于 Opus 5 / Sol 5.6,但整体编码支出增加约 60%。OpenAI 发布模型失准事件追踪与披露框架,并附上过去六个月的六份案例报告。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,让员工愿意主动分享。
Salesforce 在 Dreamforce 上发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 在后训练阶段基于近三十年企业 CRM 部署的专有合成数据集构建,采用监督微调与 NVIDIA NeMo RL、NeMo Gym、NeMo AutoModel 的强化学习。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,涵盖功率优化软件 DSX MaxLPS、电网响应组件 DSX Flex、开源管理软件 DSX OS、仿真工具 DSX Sim 和参考设计。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户可用自然语言连接公司数据、挖掘洞察并构建交互式仪表盘。该功能面向所有用户开放,让数据分析和可视化不再依赖专业工具或技能。
TRL v1.14 的 AsyncGRPOTrainer 支持只训练并同步 LoRA 适配器到 vLLM,rank-1 适配器仅几 MB,可经由各 Job 挂载的 Storage Bucket 传输,从而让训练与推理分属不同 Hugging Face Jobs,无需 NCCL。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步的轻量微调,在 IFStruct benchmark 上把合规率从基线 22.6% 提升到 29.7%。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型写 JavaScript 绘制水彩画的方案,数据集、RL 环境、训练脚本和模型全部开源。
Hugging Face 发布 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维 Item Response Theory(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练后自主识别出安全与通用推理两个主导维度。
Google 发布 TimesFM-3,这是其时间序列基础模型的新一代版本,原生支持多变量预测,参数规模 3.3 亿,在超过 1 万亿个时间点的真实与合成时序语料上预训练。
推荐理由:TimesFM-3 从单变量扩展到原生多变量预测,读者可了解一次前向传播完成多序列预测的架构取舍。
Hugging Face 的 Open ASR Leaderboard 新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,这是该榜单多语言标签下首个 Indic 语言,也是其首个全球南语种。
Google 发布 GlucoFM,一个采用双流设计的自监督基础模型,将较慢的血糖基线趋势与短期波动分离,并保留时间与缺失信息,用潜在预测目标学习日常血糖上下文与时间演化。
Hugging Face 博客介绍 Sentence Transformers v6.0 新增的 MultiVectorEncoder 模型类型,并给出 ColBERT 式后交互检索模型的完整训练与微调流程。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。
METR 研究发现 AI 对科研的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度大幅加快,数学只有小幅加速(部分领域 arXiv 投稿不到 12 个月翻倍),而 AI 研究本身的算法进展尚无显著加速。
Google Research 发布 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。
Google Research 提出 ME-POIs 框架,将匿名化移动性模式(到达时间、停留时长、周边活动)与文本嵌入结合,生成同时编码地点身份与动态功能的向量表示。
Import AI 469 期介绍了新基准 DiG-bench,用 70 款规则隐藏的游戏测试 AI 自主探索与发现能力,目前仅 Opus 5 和 Fable 5 在 Tier 7 取得 0.2 分,远低于人类的 100%。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型生成的嵌入向量,代码与模型权重已公开。用户可在 UI 或 API 中选择区域、1-12 个月时间跨度、Nano(128 维)/Tiny(192 维)/Base(768 维)编码器及 10-80 米分辨率,导出 int8 量化的轻量 COG。
Google Research 提出 knowledge profiling 行为框架,用编码、召回、识别三项指标诊断 LLM 的事实性瓶颈,并发布含 2,150 条 Wikipedia 事实的 WikiProfile 基准。
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种解读任务的统一 VLM,结合生成与结构化预测,并用强化学习(DAPO)在多任务设定下奖励临床正确性。
Hugging Face 的 ALTK-Evolve 与 ACE 同属无权重更新的智能体记忆方案,都把过往轨迹转化为可复用经验,区别在推理时的投递方式。