微软研究院利用机器学习预测电网空间天气风险
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,在生物代码中嵌入不可感知的签名,使其不只在数字模型上、也能在合成出的实体蛋白质上被验证,同时保留其生物功能。
推荐理由:Google DeepMind 把水印技术从图像扩展到蛋白质与 3D 结构,读者可看到生物安全筛查的一层新验证思路。
OpenAI 表示已阻断一起试图提取其受保护模型推理的协同蒸馏行动,并正在加强对对抗性蒸馏的防御。原文未给出更多细节。
亚马逊 AWS 发布 Amazon Quick 提示词工程基础指南(Part 1),给出跨组件通用的提示词设计原则与可复用框架。文章涵盖清晰具体、业务上下文和示例教学等核心原则,以及用于复杂请求的 CRISPE 框架,Part 2 将讲解 Research、Flows、Sight、Chat Agents 和 Action Integrations 的组件专属技巧。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型系列,在 Hugging Face 上提供权重。给定带标签行的表格,它在单次前向传播中预测新行标签,无需训练、调参和特征工程,支持分类与回归,提供 28M 至 215M 三档参数规模,采用 OpenMDW-1.1 许可可商用。
推荐理由:原文公开了表格基础模型的三档规模、单次前向推理方式和四个基准排名,可据此判断无训练微调的表格预测路径。
Microsoft Research 发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与科研人员的交互式 harness 两部分组成。
推荐理由:微软研究院公开了面向生物学的多模态世界模型 Quine 及其与 Broad Institute 合作的湿实验验证结果。
Amazon Textract 适配器跨账户管理可通过 AWS Systems Manager Parameter Store 外部化 adapter ID 实现自动化,更新生产环境适配器引用无需停机或重新部署应用,原本需要数小时到数天协调的变更缩短至数秒。
Basis 使用 GPT-6 Astra 完成 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍。GPT-6 Astra 对用户意图的更强理解,也让 Basis 对实际业务场景中的应用更有信心。
AWS 博客介绍在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行、数百加速器间高吞吐通信,以及 MoE 专家并行(EP)带来的跨节点动态 all-to-all 通信开销。文中覆盖 RLHF、GRPO 等大规模 RL 负载在计算、内存和网络带宽上的资源平衡问题。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行后训练,在固定 64 个迷宫评测集上把迷宫求解率从 43.75% 提升到 95% 以上。
Parallel 的智能体借助 GPT-6 Astra 完成劳动力市场数据的检索与综合,相比此前模型将时间和成本各降低一半。
NVIDIA 在开罗举办埃及 AI 生态活动,其 Deep Learning Institute 在埃及的学员规模一年内增长超十倍。埃及已有超 85,000 名开发者接受 NVIDIA 培训,尼日利亚成为该机构全球第二大市场;Cassava 与 Vodafone 埃及宣布共建 AI 工厂,通过 GPU-as-a-service 提供本地托管 AI 基础设施。
Hex 的数据智能体借助 GPT-6 Astra,把分析答案转化为可交互的可视化报告,让员工愿意主动分享。
Salesforce 在 Dreamforce 上发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 在后训练阶段基于近三十年企业 CRM 部署的专有合成数据集构建,采用监督微调与 NVIDIA NeMo RL、NeMo Gym、NeMo AutoModel 的强化学习。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,涵盖功率优化软件 DSX MaxLPS、电网响应组件 DSX Flex、开源管理软件 DSX OS、仿真工具 DSX Sim 和参考设计。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户可用自然语言连接公司数据、挖掘洞察并构建交互式仪表盘。该功能面向所有用户开放,让数据分析和可视化不再依赖专业工具或技能。
TRL v1.14 的 AsyncGRPOTrainer 支持只训练并同步 LoRA 适配器到 vLLM,rank-1 适配器仅几 MB,可经由各 Job 挂载的 Storage Bucket 传输,从而让训练与推理分属不同 Hugging Face Jobs,无需 NCCL。
一份公开教程用 TRL 的 GRPO 对 LFM2.5-350M 做约 500 样本、100 步的轻量微调,在 IFStruct benchmark 上把合规率从基线 22.6% 提升到 29.7%。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型写 JavaScript 绘制水彩画的方案,数据集、RL 环境、训练脚本和模型全部开源。
Hugging Face 发布 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维 Item Response Theory(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练后自主识别出安全与通用推理两个主导维度。
Google 发布 TimesFM-3,这是其时间序列基础模型的新一代版本,原生支持多变量预测,参数规模 3.3 亿,在超过 1 万亿个时间点的真实与合成时序语料上预训练。
推荐理由:TimesFM-3 从单变量扩展到原生多变量预测,读者可了解一次前向传播完成多序列预测的架构取舍。
Hugging Face 的 Open ASR Leaderboard 新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,这是该榜单多语言标签下首个 Indic 语言,也是其首个全球南语种。
Google 发布 GlucoFM,一个采用双流设计的自监督基础模型,将较慢的血糖基线趋势与短期波动分离,并保留时间与缺失信息,用潜在预测目标学习日常血糖上下文与时间演化。
Hugging Face 博客介绍 Sentence Transformers v6.0 新增的 MultiVectorEncoder 模型类型,并给出 ColBERT 式后交互检索模型的完整训练与微调流程。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。
Google Research 发布 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。
Google Research 提出 ME-POIs 框架,将匿名化移动性模式(到达时间、停留时长、周边活动)与文本嵌入结合,生成同时编码地点身份与动态功能的向量表示。
Hugging Face 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型生成的嵌入向量,代码与模型权重已公开。用户可在 UI 或 API 中选择区域、1-12 个月时间跨度、Nano(128 维)/Tiny(192 维)/Base(768 维)编码器及 10-80 米分辨率,导出 int8 量化的轻量 COG。
Google Research 提出 knowledge profiling 行为框架,用编码、召回、识别三项指标诊断 LLM 的事实性瓶颈,并发布含 2,150 条 Wikipedia 事实的 WikiProfile 基准。
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种解读任务的统一 VLM,结合生成与结构化预测,并用强化学习(DAPO)在多任务设定下奖励临床正确性。
Hugging Face 的 ALTK-Evolve 与 ACE 同属无权重更新的智能体记忆方案,都把过往轨迹转化为可复用经验,区别在推理时的投递方式。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型每位置的 top-100 logits 做离线蒸馏,并把输出投影融合进分块 KL 损失计算,使峰值显存只随序列长度线性增长。
Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到 SOTA,平均可多提供一天预报时效,三天预报精度相当于此前模型的两天水平。
推荐理由:官方给出气旋路径与强度预测多出一天预警时间的评估结果,并同时开源模型与权重,可据此判断气象预报模型的可用边界。
微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是可在软件工程、网页导航和智能助手等任务间复用的 Orchard Env 环境服务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。
推荐理由:微软研究院开源 Orchard 环境服务与三套训练配方,读者可了解小参数模型在真实 harness 内训练后能达到的智能体水平。
继模型质量之后,GPU 利用率正成为企业 AI 的下一个真实约束:GPU 成本按日历小时计(融资、折旧、电力、制冷),产出却只按计算小时计,而需求并非全天候。到 2026 年,连 Anthropic 都同时在 Amazon、Google、Microsoft 和 AMD 四家平台上做多吉瓦级承诺,Meta 也签下类似规模的多吉瓦协议,算力获取仍是活生生的战略约束。
Google 在 DOE Genesis Mission Summit 2026 上宣布,为支持 Genesis Mission 投入 4000 万美元的 AI tokens 和云额度。
Hugging Face 发布开源系统 Grabette,用手持夹爪在几分钟内录制操作任务,并自动转换为可训练的 LeRobot 数据集。Grabette 配备广角鱼眼相机与 RGBD 相机,硬件 BOM 成本约 490€,配套的机器人夹爪 Gripette 成本约 120€,硬件、采集软件、处理流程均已开源。
推荐理由:原文给出了一套低成本采集操作数据的完整开源方案,读者可以据此了解机器人学习数据瓶颈的另一种解法。
DharmaOCR 在葡萄牙语专用基准上得分 0.925,超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。该模型经葡萄牙语语料监督微调后,再用 DPO 提升推理稳定性、降低退化率。作者认为,把全部参数集中到单一语言领域,是其相对多语言模型的结构性优势。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力从何而来:神经网络训练中的正则化会让学到的得分函数变得平滑,即"得分平滑",使去噪过程在训练数据点之间产生插值,从而生成新样本。
UC Berkeley 的 Aditya G. Parameswaran 等提出近零推理成本下的三大数据系统挑战:为智能体服务的数据系统、由智能体运行的数据系统、以及由智能体合成的数据系统。GPT-4 级能力从 2023 年初约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,推理价格年降幅在 9x 到 900x 之间,中位数约 50x。