跳到正文

#开源/仓库

今日 0 条
9月30日周三
  1. Google DeepMind65

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质与结构加水印

    Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,在生物代码中嵌入不可感知的签名,使其不只在数字模型上、也能在合成出的实体蛋白质上被验证,同时保留其生物功能。

    推荐理由:Google DeepMind 把水印技术从图像扩展到蛋白质与 3D 结构,读者可看到生物安全筛查的一层新验证思路。

9月21日周一
9月3日周四
9月2日周三
8月21日周五
8月13日周四
  1. Hugging Face Blog41

    Hugging Face 推出 OlmoEarth embeddings:从 OlmoEarth Studio 导出嵌入向量用于下游分析

    Hugging Face 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型生成的嵌入向量,代码与模型权重已公开。用户可在 UI 或 API 中选择区域、1-12 个月时间跨度、Nano(128 维)/Tiny(192 维)/Base(768 维)编码器及 10-80 米分辨率,导出 int8 量化的轻量 COG。

7月23日周四
7月7日周二
  1. Hugging Face Blog76

    LeRobot v0.6.0 发布:世界模型策略、奖励模型 API 与六套仿真基准

    Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、一批新 VLA(GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1)以及统一奖励模型 API(Robometer、TOPReward)。

    推荐理由:原文给出世界模型策略、奖励模型 API 与六套仿真基准的完整清单,读者可据此判断机器人学习闭环的现状与可用入口。

7月6日周一
  1. Hugging Face Blog30

    PRX Part 4:数据策略详解

    Hugging Face 发布 PRX 系列第四篇,披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式语料。训练文本编码器换为 Qwen3-VL 并改为实时计算 latent,仅带来约 3–4% 吞吐损失;图像统一以 JPEG quality 92 编码。

7月1日周三
6月11日周四
  1. Google DeepMind74

    Google DeepMind 发布 DiffusionGemma:文本生成最高提速 4 倍

    Google DeepMind 发布实验性开放模型 DiffusionGemma,基于 Gemma 4 与 Gemini Diffusion 研究,用文本扩散同时生成整块 token,在专用 GPU 上最高提速 4 倍,单张 NVIDIA H100 超 1000 tokens/秒、RTX 5090 超 700 tokens/秒。

    推荐理由:原文给出扩散文本生成的速度收益、硬件门槛与质量取舍,读者可据此判断它适合哪类本地推理场景。

6月4日周四
4月16日周四
  1. Google Research32

    Google Research 用 AI 合成神经元加速脑图谱重建,MoGen 在 ICLR 2026 亮相

    Google Research 提出神经元形态生成模型 MoGen,用点云流匹配生成合成神经元形状,加入 PATHFINDER 训练管线后使小鼠轴突重建错误率降低 4.4%,主要来自合并错误的减少。在完整小鼠脑规模下,这相当于节省 157 人年的手动校对。MoGen 已开源,论文将在 ICLR 2026 展示。

4月1日周三
  1. Google Research28

    Google Research 研究:AI 基准测试需要多少标注者才够?

    Google Research 用模拟器研究 AI 评测中「标注多少条目(N)」与「每条目标注多少人(K)」的权衡,发现常见的每条目 1、3、5 名标注者往往不够,反映人类观点细微差异常需每条目 10 名以上标注者。若只关心多数投票,增加条目更有效;若想捕捉观点分布,则必须增加标注者;在约 1000 条总标注的适度预算下,按指标选对比例即可获得高可复现结果。该模拟器已在 GitHub 开源。

3月13日周五