跳到正文

#数据/训练

今日 1 条
7月7日周二
  1. Hugging Face Blog61

    Hugging Face 与 SkyPilot 联合推出零出网存储集成

    Hugging Face 与 SkyPilot 联合发布集成,用户可用一个 hf:// URL 将 Hugging Face Bucket 或模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes 和本地集群上运行。

    推荐理由:原文给出 hf:// 挂载方式与免费出网机制,读者可据此判断跨云训练工作流的存储成本变化。

7月6日周一
  1. Hugging Face Blog30

    PRX Part 4:数据策略详解

    Hugging Face 发布 PRX 系列第四篇,披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式语料。训练文本编码器换为 Qwen3-VL 并改为实时计算 latent,仅带来约 3–4% 吞吐损失;图像统一以 JPEG quality 92 编码。

7月1日周三
6月30日周二
  1. Google Research69

    Google Research 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:TabFM 把零样本思路带到表格分类与回归,读者可据此了解免训练预测在企业数据场景的落地方式。

6月25日周四
  1. Google Research41

    Google Research 研究:推理如何解锁 LLM 的参数化知识回忆

    Google Research 在 COLM 2026 论文《Thinking to Recall》中提出,让 LLM 生成推理轨迹能解锁原本无法触及的参数化事实,且这一效应在简单单跳问题上同样成立。研究用 Gemini-2.5 Flash/Pro 和 Qwen3-32B 在 SimpleQA Verified、EntityQuestions 上对比推理开关,识别出计算缓冲与事实启动两种机制。

6月17日周三
6月13日周六
  1. Google Research39

    用退役手机搭建低碳计算平台:加州大学圣地亚哥分校与 Google 打造 2000 台 Pixel 手机集群

    加州大学圣地亚哥分校在 Google 支持下,将退役智能手机的主板拆出组成集群,部署一个由 2000 台 Pixel 手机搭建的数据中心,为数百名研究者与学生提供低成本、低碳的云计算。研究显示 25-50 台手机约等于一台现代服务器,20 台手机的小型集群已能支撑 75 人以上课程的评分负载,且延迟低于 AWS 默认后端。该系统预计 2026 年秋季全面上线。

6月4日周四
5月28日周四
  1. Google Research37

    Google 推出零信任聚合的私有分析方案,结合密码学与 TEE

    Google 公布一套面向私有分析的零信任聚合新方案,用新型密码学聚合协议保护用户数据,设备只需发送单条消息、无需多轮在线交互,Google 只能得到匿名化的群体聚合结果。该方案将密码学层与 TEE 结合,在硬件保护失效时数据仍不会被还原,并借助 TEE 远程证明向参与者验证协议按公开代码正确执行。

5月27日周三
5月23日周六
  1. Mistral AI60

    Mistral 收购 Physics AI 公司 Emmi,推进工业 AI 布局

    Mistral AI 宣布已就收购 Physics AI 公司 Emmi AI 达成最终协议,以强化其面向工业企业的 AI 转型能力。Emmi AI 成立于奥地利,专注 Physics AI 并开发大型工程模型,可实现实时仿真、替代多日计算并构建数字孪生;其 30 多名研究人员与工程师将在 5 月加入 Mistral 的 Science 与 Applied AI 团队。

    推荐理由:Mistral 收购 Physics AI 公司 Emmi,说明其正把物理建模能力与工程工具接入纳入工业 AI 路线。

5月22日周五
  1. Google DeepMind28

    Google DeepMind 在亚太推出加速器计划,聚焦“AI for the Planet”应对环境风险

    Google DeepMind 在亚太地区启动首个加速器计划,聚焦“AI for the Planet”,为期三个月,面向该地区初创公司、研究团队和非营利组织,用前沿 AI 解决自然、气候、农业、能源等问题。入选机构将获得专家指导、定制支持,以及 Google AI 专家协助把前沿 AI 和科学 AI 模型整合进其项目或产品。计划以在新加坡举办的线下训练营启动,现已开放注册意向。

5月19日周二
5月16日周六
  1. Google DeepMind39

    剑桥教授用 Co-Scientist 寻找跨物种传播疾病的分子开关

    剑桥大学 Clare Bryant 教授用 Google DeepMind 的 Co-Scientist 研究流感等病原体跨物种传播引发败血症的分子机制。Co-Scientist 在未公开数据辅助下将候选靶点从蛋白质细化到具体氨基酸,团队正据此构建含氨基酸突变的细胞系验证假设。Bryant 称,原本需两到三年的精确氨基酸定位工作,若靶点正确,实验室有望在六个月内完成。

  2. Google DeepMind50

    Google Co-Scientist 助力发现抗肝纤维化老药新用途

    Google DeepMind 的 Co-Scientist 帮助斯坦福大学医学院遗传学家 Gary Peltz 筛选可老药新用治疗肝纤维化的药物。Peltz 自己挑选的两款候选药在活体人类肝细胞测试中无效,而 Co-Scientist 提出的三款候选药中有两款阻断了纤维化并促进肝细胞再生,其中癌症药物 vorinostat 阻断了 91% 可致肝疤痕的损伤反应。

5月2日周六
4月30日周四
4月22日周三
4月16日周四
  1. Google Research32

    Google Research 用 AI 合成神经元加速脑图谱重建,MoGen 在 ICLR 2026 亮相

    Google Research 提出神经元形态生成模型 MoGen,用点云流匹配生成合成神经元形状,加入 PATHFINDER 训练管线后使小鼠轴突重建错误率降低 4.4%,主要来自合并错误的减少。在完整小鼠脑规模下,这相当于节省 157 人年的手动校对。MoGen 已开源,论文将在 ICLR 2026 展示。

4月1日周三
  1. Google Research28

    Google Research 研究:AI 基准测试需要多少标注者才够?

    Google Research 用模拟器研究 AI 评测中「标注多少条目(N)」与「每条目标注多少人(K)」的权衡,发现常见的每条目 1、3、5 名标注者往往不够,反映人类观点细微差异常需每条目 10 名以上标注者。若只关心多数投票,增加条目更有效;若想捕捉观点分布,则必须增加标注者;在约 1000 条总标注的适度预算下,按指标选对比例即可获得高可复现结果。该模拟器已在 GitHub 开源。

3月25日周三
3月18日周三
  1. Mistral AI66

    Mistral AI 发布 Forge,让企业用私有知识训练前沿模型

    Mistral AI 发布 Forge,一套让企业基于专有知识训练前沿级 AI 模型的系统。Forge 覆盖预训练、后训练和强化学习等模型生命周期阶段,支持 dense 与 MoE 架构及多模态输入,并可由 Mistral Vibe 等智能体用自然语言完成微调和调参。

    推荐理由:原文给出企业用私有数据训练前沿模型的分阶段方案与多个行业落地场景,可据此判断企业自建模型的能力边界。

3月17日周二
3月13日周五
3月12日周四
1月10日周六
  1. Berkeley AI Research23

    伯克利提出信息驱动成像系统设计框架,NeurIPS 2025 论文验证四大成像领域

    伯克利 AI Research 提出一种直接评估和优化成像系统信息量的框架,仅用含噪测量和噪声模型估计互信息,可预测解码器性能。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证了信息估计与下游任务表现的一致性,优化后的设计达到 SOTA 端到端方法水平,同时占用更少内存和算力、无需任务专用解码器。

9月1日周一
8月1日周五
7月23日周三