微软研究院利用机器学习预测电网空间天气风险
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
Google Research 发布 Diffusion Controller 框架,把扩散模型的去噪过程重新定义为连续控制问题,主模型完全冻结,仅用轻量"转向阻尼"网络注入微调修正。该框架在 Stable Diffusion v1.4 上用 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持 PPO 策略梯度与奖励加权损失两种微调方式,可在不接触底层代码的情况下定制闭源模型。
Hugging Face 发布论文 ProvenanceGuard,一个针对 MCP 智能体的生成后验证层,可识别"跨源混淆"——事实真实但被归到错误来源的答案。
Hugging Face 发布 altk-evolve 的"一致性指南"(consistency guidelines),配合 Consistency Analyzer 定位 Agent 决策中易翻转的步骤。
Hugging Face 发布 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维 Item Response Theory(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练后自主识别出安全与通用推理两个主导维度。
Google Research 发布 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化并定位全球甲烷点源,在专家标注羽流上召回率达 84%,信噪比优于现有匹配滤波方法。
Hugging Face 的 Open ASR Leaderboard 新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,这是该榜单多语言标签下首个 Indic 语言,也是其首个全球南语种。
Google 发布 GlucoFM,一个采用双流设计的自监督基础模型,将较慢的血糖基线趋势与短期波动分离,并保留时间与缺失信息,用潜在预测目标学习日常血糖上下文与时间演化。
Google 发布研究原型 AgentHands,可将 LLM 的高层推理映射为与语音同步的 XR 手势,让智能体在真实空间中边讲解边指向物体。系统包含环境感知、手势事件库和手势嵌入推理,并已在 Android XR 上演示兰花养护、3D 打印机操作等场景。12 人用户研究显示,相比纯语音基线,空间定位效果显著提升。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。
Google Research 发布 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。
Google Research 提出 ME-POIs 框架,将匿名化移动性模式(到达时间、停留时长、周边活动)与文本嵌入结合,生成同时编码地点身份与动态功能的向量表示。
Hugging Face 最新研究用三项测试量化语音识别中的“benchmaxxing”,评估 11 款开源 ASR 模型后发现,多款高分模型会复现 VoxPopuli 英文集和 LibriSpeech(clean、other)的基准转录文本,即使音频与之矛盾或相关词已被静音。
Hugging Face 博客发布 ALTK-Evolve 记忆剂量研究:在 AppWorld 585 个多步任务上测试 8 个模型后发现,智能体记忆不是开关而是需要按模型校准的剂量。
Google 提出 PhotoScan,一个可直接从普通 2D 手机照片估算体脂率(BF%)、Android/Gynoid 脂肪比(A/G)和内脏/皮下脂肪面积比(V/S)的深度学习框架。
Google Research 提出 knowledge profiling 行为框架,用编码、召回、识别三项指标诊断 LLM 的事实性瓶颈,并发布含 2,150 条 Wikipedia 事实的 WikiProfile 基准。
Google Research 发布 AMIE (Video),在 Gemini 与 Project Astra 之上实现同步临床视频问诊,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。
推荐理由:AMIE (Video) 用三智能体异步架构支撑实时视频问诊,并在 300 场随机 OSCE 研究中与初级保健医生对比,适合了解医疗多模态智能体的设计与评测方式。
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种解读任务的统一 VLM,结合生成与结构化预测,并用强化学习(DAPO)在多任务设定下奖励临床正确性。
Hugging Face 的 ALTK-Evolve 与 ACE 同属无权重更新的智能体记忆方案,都把过往轨迹转化为可复用经验,区别在推理时的投递方式。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型每位置的 top-100 logits 做离线蒸馏,并把输出投影融合进分块 KL 损失计算,使峰值显存只随序列长度线性增长。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以此构建自主研究原型 Science One Framework,在 ADRS 基准五项系统优化任务的 75 篇论文审计中实现零幻觉引用、分数完全可复现,在 MLE-Bench 与 Parameter-Golf 上达到 SOTA,而基线系统最高有 21% 的引用为虚构。
Berkeley Sky Lab 将进化式 kernel 搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,把已有 CUDA kernel 当作知识库适配为 Apple Silicon 上的高质量 kernel。
Google Research 发布 SymptomAI 研究,让 13,917 名参与者在随机对照试验中与五个不同提问策略的 Gemini Flash 2.0 智能体进行症状访谈,并产出鉴别诊断(DDx)。
Google Research 在 Nature 发表研究,提出用强化学习框架让自主智能体从量子纠错检测事件中持续学习,实时调节数千个控制参数以对抗硬件漂移。在 Willow 超导处理器上,该 RL 控制将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%,把量子存储器的逻辑错误压至历史最低。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力从何而来:神经网络训练中的正则化会让学到的得分函数变得平滑,即"得分平滑",使去噪过程在训练数据点之间产生插值,从而生成新样本。
Google Research 提出 SensorFM,一个直接从人群规模无标注可穿戴数据中学习的大型传感器基础模型,在超过一万亿分钟多模态传感器信号上预训练,数据来自五百万名知情同意的参与者。
推荐理由:SensorFM 用一万亿分钟无标注穿戴数据预训练,读者可了解单个生理表征如何跨多类健康任务迁移。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将遇到预设拥堵路段的行程引导至耗时相近的替代路线,在 10 座美国城市开展为期六个月的实验。不足 2% 的行程收到改道建议,目标路段行驶速度中位数提升约 2%,油耗中位数下降 0.5% 至 1.0%,每座城市每年可减少数千吨 CO2e 排放。
Hugging Face 发布开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark)。
Dharmam AI 解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,指出专业化是有限资源下的必然结果。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存占用降 15.5%、缓存未命中仅增 5.5%、总拥有成本降约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时回退到 LRU 策略,无需按峰值需求预分配内存。论文已在 CIDR 发表。
Google Research 在 COLM 2026 论文《Thinking to Recall》中提出,让 LLM 生成推理轨迹能解锁原本无法触及的参数化事实,且这一效应在简单单跳问题上同样成立。研究用 Gemini-2.5 Flash/Pro 和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上对比推理开关,识别出计算缓冲与事实启动两种机制。
Google Research 发布矢量化数据集,把此前 Farmscapes 2020 中像素化的英国树篱、石墙和树丛转成可直接用于土地规划与碳核算的矢量清单。
Google Research 公布多项皮肤科 AI 研究,其中发表于 JAMA Dermatology 的大规模调查显示,2,345 名参与者借助 AI 工具猜测皮肤状况名称的准确率从对照组的 8% 提升至 23%,"Wizard of Oz"组为 36%。
加州大学圣地亚哥分校在 Google 支持下,将退役智能手机的主板拆出组成集群,部署一个由 2000 台 Pixel 手机搭建的数据中心,为数百名研究者与学生提供低成本、低碳的云计算。研究显示 25-50 台手机约等于一台现代服务器,20 台手机的小型集群已能支撑 75 人以上课程的评分负载,且延迟低于 AWS 默认后端。该系统预计 2026 年秋季全面上线。
Google 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘:通过相对距离检验判断模型分布更接近安全重训模型还是原始受损模型。该框架基于 f-divergence,支持 Chi-squared、KL 和 Hockey-stick 散度,并用核正则化高效估计高维数据差异,自动选择散度与超参数、无需样本切分。
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果:使用 Gemini Guided Learning 的学生数学成绩比对照组提升 +0.258 个标准差,约相当于常规学习 1.2 至 1.7 年的进度,若教师将 Gemini 融入约一半课程,提升可达约 1.8 至 2.5 年。
Google Research 在 Nature 发表论文,提出研究系统 PHRM,利用手机前置摄像头在面部解锁后的数秒内拍摄视频,在后台估计心率与每日静息心率。
推荐理由:Google 用手机前摄在日常解锁后被动测心率,读者可据此判断摄像头健康监测的可行性与肤色公平性进展。
Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室筛选逆转细胞衰老的基因靶点:它扫描数万篇论文并提出 20 多个新的候选遗传因子,实验室验证其中几个成功将细胞推向更年轻状态。Co-Scientist 还将原本长达六个月的筛选数据分析缩短至几天。
爱丁堡大学 Filippo Menolascina 团队用 Google Co-Scientist 研究肝病 MASH,该系统整合肝脏生物学与药理学证据、锁定候选联合疗法并解释了药物 resmetirom 为何仅对少数合格患者有效。Co-Scientist 提出 NLRP3 炎症小体是连接炎症与代谢的分子桥梁这一假设,随后经实验验证,或为靶向双重疗法铺路。
Google DeepMind 的 Co-Scientist 帮助 MIT 机械工程师 Ritu Raman 快速梳理 ALS 相关文献,将想法转化为可检验假设并按可行性排序。其最优线索指向细胞表面分子交互,促成 Raman 与波士顿儿童医院化学生物学家 Ryan Flynn 合作,结合组织模型与 RNA 图谱寻找可用于靶向 ALS 的新型 RNA 机制及潜在 RNA 药物。