微软研究院利用机器学习预测电网空间天气风险
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
Hugging Face 发布 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维 Item Response Theory(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练后自主识别出安全与通用推理两个主导维度。
Hugging Face 的 Open ASR Leaderboard 新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,这是该榜单多语言标签下首个 Indic 语言,也是其首个全球南语种。
Google 发布 GlucoFM,一个采用双流设计的自监督基础模型,将较慢的血糖基线趋势与短期波动分离,并保留时间与缺失信息,用潜在预测目标学习日常血糖上下文与时间演化。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。
Google Research 发布 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。
Google Research 提出 ME-POIs 框架,将匿名化移动性模式(到达时间、停留时长、周边活动)与文本嵌入结合,生成同时编码地点身份与动态功能的向量表示。
Import AI 469 期介绍了新基准 DiG-bench,用 70 款规则隐藏的游戏测试 AI 自主探索与发现能力,目前仅 Opus 5 和 Fable 5 在 Tier 7 取得 0.2 分,远低于人类的 100%。
Google Research 提出 knowledge profiling 行为框架,用编码、召回、识别三项指标诊断 LLM 的事实性瓶颈,并发布含 2,150 条 Wikipedia 事实的 WikiProfile 基准。
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种解读任务的统一 VLM,结合生成与结构化预测,并用强化学习(DAPO)在多任务设定下奖励临床正确性。
Hugging Face 的 ALTK-Evolve 与 ACE 同属无权重更新的智能体记忆方案,都把过往轨迹转化为可复用经验,区别在推理时的投递方式。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型每位置的 top-100 logits 做离线蒸馏,并把输出投影融合进分块 KL 损失计算,使峰值显存只随序列长度线性增长。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力从何而来:神经网络训练中的正则化会让学到的得分函数变得平滑,即"得分平滑",使去噪过程在训练数据点之间产生插值,从而生成新样本。
Google Research 在 COLM 2026 论文《Thinking to Recall》中提出,让 LLM 生成推理轨迹能解锁原本无法触及的参数化事实,且这一效应在简单单跳问题上同样成立。研究用 Gemini-2.5 Flash/Pro 和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上对比推理开关,识别出计算缓冲与事实启动两种机制。
Google Research 发布矢量化数据集,把此前 Farmscapes 2020 中像素化的英国树篱、石墙和树丛转成可直接用于土地规划与碳核算的矢量清单。
Google Research 公布多项皮肤科 AI 研究,其中发表于 JAMA Dermatology 的大规模调查显示,2,345 名参与者借助 AI 工具猜测皮肤状况名称的准确率从对照组的 8% 提升至 23%,"Wizard of Oz"组为 36%。
加州大学圣地亚哥分校在 Google 支持下,将退役智能手机的主板拆出组成集群,部署一个由 2000 台 Pixel 手机搭建的数据中心,为数百名研究者与学生提供低成本、低碳的云计算。研究显示 25-50 台手机约等于一台现代服务器,20 台手机的小型集群已能支撑 75 人以上课程的评分负载,且延迟低于 AWS 默认后端。该系统预计 2026 年秋季全面上线。
Google DeepMind 的 Co-Scientist 帮助斯坦福大学医学院遗传学家 Gary Peltz 筛选可老药新用治疗肝纤维化的药物。Peltz 自己挑选的两款候选药在活体人类肝细胞测试中无效,而 Co-Scientist 提出的三款候选药中有两款阻断了纤维化并促进肝细胞再生,其中癌症药物 vorinostat 阻断了 91% 可致肝疤痕的损伤反应。
Google DeepMind 发布新论文提出 Decoupled DiLoCo 分布式训练架构,将大规模训练拆分为相互解耦的计算岛屿并以异步数据流连接,从而隔离局部硬件故障。
推荐理由:原文给出跨数据中心异步训练的低带宽与容错实测数据,读者可据此判断分布式预训练的工程可行边界。
Google Research 发布推理优先框架 Simula,将合成数据生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和 dual-critic 质量检查四个可控维度从零构建数据集,无需种子数据。
Google Research 提出神经元形态生成模型 MoGen,用点云流匹配生成合成神经元形状,加入 PATHFINDER 训练管线后使小鼠轴突重建错误率降低 4.4%,主要来自合并错误的减少。在完整小鼠脑规模下,这相当于节省 157 人年的手动校对。MoGen 已开源,论文将在 ICLR 2026 展示。
Google Research 用模拟器研究 AI 评测中「标注多少条目(N)」与「每条目标注多少人(K)」的权衡,发现常见的每条目 1、3、5 名标注者往往不够,反映人类观点细微差异常需每条目 10 名以上标注者。若只关心多数投票,增加条目更有效;若想捕捉观点分布,则必须增加标注者;在约 1000 条总标注的适度预算下,按指标选对比例即可获得高可复现结果。该模拟器已在 GitHub 开源。
Google Research 发布自监督框架 S2Vec,通过 S2 Geometry 分区将建筑、道路等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量,可预测人口密度、房价、碳排放等指标。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两篇论文,评估 AI 用于乳腺癌筛查的效果。
推荐理由:两项 Nature Cancer 研究给出了 AI 参与乳腺癌筛查的检测率提升与阅片减负数据,并暴露人机仲裁的新问题。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据和模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步引入层次结构,仅需约 10 倍更少的消融即可达到 SPEX 的性能。
伯克利 AI Research 提出一种直接评估和优化成像系统信息量的框架,仅用含噪测量和噪声模型估计互信息,可预测解码器性能。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证了信息估计与下游任务表现的一致性,优化后的设计达到 SOTA 端到端方法水平,同时占用更少内存和算力、无需任务专用解码器。
Berkeley AI Research 的新论文为 word2vec 给出了定量可预测的学习理论:在合理实用条件下,其学习问题可化简为无权重最小二乘矩阵分解,梯度流动力学存在闭式解,最终学到的嵌入等价于对目标矩阵 M* 做 PCA。