微软研究院利用机器学习预测电网空间天气风险
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
微软研究院开发了一套机器学习系统,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。该系统结合太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,在 2020-2026 年评估期内检测到近 80% 的重大空间天气事件,其中 AE 预测 RMSE 为 410.2 nT,Dst 预测 RMSE 为 7.2 nT。
Google DeepMind 团队发表研究,提出给 AI 设计的蛋白质序列加上水印,通过与 ProteinMPNN 配合的 SynthIDBio 在序列中嵌入可检测信号,且不破坏蛋白质功能,用于帮助 DNA 合成方识别来自可信研究者的 AI 设计蛋白。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源与多语言 TTS 模型:以 Qwen3 ASR 计算 WER/CER、用 RTFx 和 TTFA 衡量速度、以 WavLM 嵌入向量余弦相似度(SIM)衡量声音克隆。
Google Research 发布 Diffusion Controller 框架,把扩散模型的去噪过程重新定义为连续控制问题,主模型完全冻结,仅用轻量"转向阻尼"网络注入微调修正。该框架在 Stable Diffusion v1.4 上用 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持 PPO 策略梯度与奖励加权损失两种微调方式,可在不接触底层代码的情况下定制闭源模型。
Hugging Face 发布论文 ProvenanceGuard,一个针对 MCP 智能体的生成后验证层,可识别"跨源混淆"——事实真实但被归到错误来源的答案。
Import AI 第 474 期聚焦三项进展。Michael Levin 提出“柏拉图思维空间”假说,认为心智与身体的关系如同数学模式与其引导的形态发生结果,并借 xenobots、anthrobots 等实验加以论证。同期内容还包括 TPU 上太空,以及智谱启动外层 RSI 循环。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回答是否有帮助且安全。该基准覆盖多种现实心理健康对话场景,衡量模型回复的助益性与安全性。
Import AI 第 473 期介绍了 RAND 关于美国超级智能战略的长篇报告,其核心建议是采取“行动自由”战略,通过投资 AI 安全、维持人类能动性并保留多种战略选项来应对不确定性。研究还展示了在脑组织被刻意清除的幼鼠体内培育人类脑组织的实验,以及机器诠释学相关进展。
Hugging Face 发布 altk-evolve 的"一致性指南"(consistency guidelines),配合 Consistency Analyzer 定位 Agent 决策中易翻转的步骤。
Google DeepMind 发表论文,用 100 个基于 Gemini 3.1 Pro 的自主智能体协作求解 71 道数学题,并设置公告板、私信与共享知识库三种协调方式。
Hugging Face 发布 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维 Item Response Theory(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练后自主识别出安全与通用推理两个主导维度。
Google Research 发布 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、量化并定位全球甲烷点源,在专家标注羽流上召回率达 84%,信噪比优于现有匹配滤波方法。
Hugging Face 的 Open ASR Leaderboard 新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,这是该榜单多语言标签下首个 Indic 语言,也是其首个全球南语种。
Google 发布 GlucoFM,一个采用双流设计的自监督基础模型,将较慢的血糖基线趋势与短期波动分离,并保留时间与缺失信息,用潜在预测目标学习日常血糖上下文与时间演化。
Google 发布研究原型 AgentHands,可将 LLM 的高层推理映射为与语音同步的 XR 手势,让智能体在真实空间中边讲解边指向物体。系统包含环境感知、手势事件库和手势嵌入推理,并已在 Android XR 上演示兰花养护、3D 打印机操作等场景。12 人用户研究显示,相比纯语音基线,空间定位效果显著提升。
IBM Granite 团队发布 Granite 4.2 系列推理模型,包含 3B、8B、30B 三种稠密尺寸,均以 Apache 2.0 许可开源,并从 Granite-4.1 基座模型后训练而来。
推荐理由:原文给出了从预训练到多阶段强化学习的完整构建细节,读者可以据此理解推理模型的训练配方与工程取舍。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接在原始预压缩模型上做 KL 蒸馏而非从恢复出的 checkpoint 蒸馏,结果在 9 项基准中的 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后再蒸馏原始模型的做法,读者可比较其与常规 QAT 在精度和训练稳定性上的差异。
Google Research 发布 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统。
Google Research 提出 ME-POIs 框架,将匿名化移动性模式(到达时间、停留时长、周边活动)与文本嵌入结合,生成同时编码地点身份与动态功能的向量表示。
Hugging Face 最新研究用三项测试量化语音识别中的“benchmaxxing”,评估 11 款开源 ASR 模型后发现,多款高分模型会复现 VoxPopuli 英文集和 LibriSpeech(clean、other)的基准转录文本,即使音频与之矛盾或相关词已被静音。
Hugging Face 博客发布 ALTK-Evolve 记忆剂量研究:在 AppWorld 585 个多步任务上测试 8 个模型后发现,智能体记忆不是开关而是需要按模型校准的剂量。
Import AI 469 期介绍了新基准 DiG-bench,用 70 款规则隐藏的游戏测试 AI 自主探索与发现能力,目前仅 Opus 5 和 Fable 5 在 Tier 7 取得 0.2 分,远低于人类的 100%。
Google 提出 PhotoScan,一个可直接从普通 2D 手机照片估算体脂率(BF%)、Android/Gynoid 脂肪比(A/G)和内脏/皮下脂肪面积比(V/S)的深度学习框架。
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条验证论文结论,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,占会议接收论文的 34%。
推荐理由:Hugging Face 公开 ICML 2026 论文复现活动的数据与方法,读者可据此看到智能体做科研复现的真实边界与人类角色。
Google Research 提出 knowledge profiling 行为框架,用编码、召回、识别三项指标诊断 LLM 的事实性瓶颈,并发布含 2,150 条 Wikipedia 事实的 WikiProfile 基准。
Google Research 发布 AMIE (Video),在 Gemini 与 Project Astra 之上实现同步临床视频问诊,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。
推荐理由:AMIE (Video) 用三智能体异步架构支撑实时视频问诊,并在 300 场随机 OSCE 研究中与初级保健医生对比,适合了解医疗多模态智能体的设计与评测方式。
Microsoft Research 发布研究模型 CARE-X,一个面向胸部 X 光多种解读任务的统一 VLM,结合生成与结构化预测,并用强化学习(DAPO)在多任务设定下奖励临床正确性。
Hugging Face 的 ALTK-Evolve 与 ACE 同属无权重更新的智能体记忆方案,都把过往轨迹转化为可复用经验,区别在推理时的投递方式。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型每位置的 top-100 logits 做离线蒸馏,并把输出投影融合进分块 KL 损失计算,使峰值显存只随序列长度线性增长。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以此构建自主研究原型 Science One Framework,在 ADRS 基准五项系统优化任务的 75 篇论文审计中实现零幻觉引用、分数完全可复现,在 MLE-Bench 与 Parameter-Golf 上达到 SOTA,而基线系统最高有 21% 的引用为虚构。
Berkeley Sky Lab 将进化式 kernel 搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,把已有 CUDA kernel 当作知识库适配为 Apple Silicon 上的高质量 kernel。
Epoch 与 METR 发布 MirrorCode 基准,让 AI 仅凭 CLI 访问重实现软件程序,25 个目标程序中 17 个有满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成 METR 和 Epoch 估计人类需 2-17 周的任务。
推荐理由:MirrorCode 用 25 个真实程序衡量 AI 自主重实现能力,Opus 4.7 花 14 小时完成人类需数周的任务。
Google Research 发布 SymptomAI 研究,让 13,917 名参与者在随机对照试验中与五个不同提问策略的 Gemini Flash 2.0 智能体进行症状访谈,并产出鉴别诊断(DDx)。
Google Research 在 Nature 发表研究,提出用强化学习框架让自主智能体从量子纠错检测事件中持续学习,实时调节数千个控制参数以对抗硬件漂移。在 Willow 超导处理器上,该 RL 控制将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%,把量子存储器的逻辑错误压至历史最低。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力从何而来:神经网络训练中的正则化会让学到的得分函数变得平滑,即"得分平滑",使去噪过程在训练数据点之间产生插值,从而生成新样本。
Hugging Face 发布 Real World VoiceEQ 基准,用于评估语音交互的人类品质,覆盖 40 多个领先闭源与开源语音模型、15+ 个评估维度和 60+ 项指标,涵盖 ASR、TTS、S2S 与语音理解。
Google Research 提出 SensorFM,一个直接从人群规模无标注可穿戴数据中学习的大型传感器基础模型,在超过一万亿分钟多模态传感器信号上预训练,数据来自五百万名知情同意的参与者。
推荐理由:SensorFM 用一万亿分钟无标注穿戴数据预训练,读者可了解单个生理表征如何跨多类健康任务迁移。
Hugging Face 发布开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark)。
Google Research 发布一种将多 Token 预测(MTP)改造到已冻结的 Gemini Nano v3 上的新架构,已在 Pixel 9 和 10 系列上线。
推荐理由:读者可以看到冻结主干加 MTP 头的架构取舍,以及它在 Pixel 端侧推理上的速度与内存收益。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小,在 Spanner 生产环境实测内存占用降 15.5%、缓存未命中仅增 5.5%、总拥有成本降约 5%。该方案用浅层决策树为每个页面预测 TTL,缓存写满时回退到 LRU 策略,无需按峰值需求预分配内存。论文已在 CIDR 发表。