跳到正文

全部动态

今日 49 条
8月24日周一
8月22日周六
8月21日周五
8月20日周四
8月19日周三
8月18日周二
8月17日周一
8月14日周五
8月13日周四
  1. Hugging Face Blog77

    Hugging Face 用智能体复现 ICML 2026 的 2226 篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条验证论文结论,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,占会议接收论文的 34%。

    推荐理由:Hugging Face 公开 ICML 2026 论文复现活动的数据与方法,读者可据此看到智能体做科研复现的真实边界与人类角色。

  2. Hugging Face Blog41

    Hugging Face 推出 OlmoEarth embeddings:从 OlmoEarth Studio 导出嵌入向量用于下游分析

    Hugging Face 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型生成的嵌入向量,代码与模型权重已公开。用户可在 UI 或 API 中选择区域、1-12 个月时间跨度、Nano(128 维)/Tiny(192 维)/Base(768 维)编码器及 10-80 米分辨率,导出 int8 量化的轻量 COG。

8月12日周三
  1. Google DeepMind67

    Google DeepMind 发布手语转文本模型 SL2T,首发落地 Gboard 与 Live Transcribe

    Google DeepMind 发布手语转文本模型 SL2T,以超过 10 万小时、50 多种手语的数据训练,实现手语到文本的机器翻译。该模型首先在 Pixel 11 的 Gboard 与 Live Transcribe 中上线,支持美国手语(ASL)转英文,可用来搜索、写消息或向 Gemini 提问,更多设备和语言将后续支持。

    推荐理由:官方披露 SL2T 的训练规模、手语到文本的翻译路径与隐私处理方式,可了解手语 AI 首次落地消费产品的工程取舍。

  2. Google Research71

    Google 发布 AMIE (Video):实时视频问诊达到专家级表现

    Google Research 发布 AMIE (Video),在 Gemini 与 Project Astra 之上实现同步临床视频问诊,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。

    推荐理由:AMIE (Video) 用三智能体异步架构支撑实时视频问诊,并在 300 场随机 OSCE 研究中与初级保健医生对比,适合了解医疗多模态智能体的设计与评测方式。

8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与优先级服务,并新增欧洲算力联盟

    Mistral 宣布三项推进主权 AI 的动作:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲还是美国运行;Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把推理区域选择、SLA 保障与第三方开源模型接入放进同一平台,可看作欧洲主权 AI 基础设施的具体落地路径。

8月10日周一
8月6日周四
  1. Google DeepMind76

    Google DeepMind 开源 WeatherNext 气象模型,气旋预测多出一天预警时间

    Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在气旋路径、强度和风场结构预测上达到 SOTA,平均可多提供一天预报时效,三天预报精度相当于此前模型的两天水平。

    推荐理由:官方给出气旋路径与强度预测多出一天预警时间的评估结果,并同时开源模型与权重,可据此判断气象预报模型的可用边界。

8月4日周二
  1. Mistral AI62

    Mistral AI 发布 3B 开源多模态安全分类器 Shieldstral

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可发布,可在单张 16GB NVIDIA GPU 上运行。该模型把内容审核转化为策略自适应问答任务,推理时直接接受自然语言策略,无需重新训练即可统一文本与图像安全评估,官方称其在文本安全和多模态审核基准上匹配或超过至多 7 倍规模的开放护栏模型,并给出可阈值化的连续安全评分。

    推荐理由:3B 分类器以推理时自然语言策略替代固定危害分类,读者可据此判断轻量护栏模型的部署方式变化。

  2. Microsoft Research70

    微软研究院开源 Orchard:面向可扩展智能体的开放框架

    微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是可在软件工程、网页导航和智能助手等任务间复用的 Orchard Env 环境服务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练智能体。

    推荐理由:微软研究院开源 Orchard 环境服务与三套训练配方,读者可了解小参数模型在真实 harness 内训练后能达到的智能体水平。

8月3日周一
7月31日周五
7月30日周四
  1. Hugging Face Blog19

    GPU 管理:为什么闲置 GPU 正在成为新的停飞客机

    继模型质量之后,GPU 利用率正成为企业 AI 的下一个真实约束:GPU 成本按日历小时计(融资、折旧、电力、制冷),产出却只按计算小时计,而需求并非全天候。到 2026 年,连 Anthropic 都同时在 Amazon、Google、Microsoft 和 AMD 四家平台上做多吉瓦级承诺,Meta 也签下类似规模的多吉瓦协议,算力获取仍是活生生的战略约束。

  2. Google DeepMind60

    Google DeepMind 在 Flow Music 上线音乐生成模型 Lyria 3.5

    Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线,覆盖音乐性、歌词、人声和创作控制四方面。官方称其旋律结构更复杂自然,歌词质量与提示词遵循度提升,人声更具情感与发音准确度,同时可更简便地控制输出时长与节奏。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声和控制项上的具体变化,可用于对比上一代音乐生成能力。

7月29日周三
7月28日周二
  1. Google DeepMind77

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,首次实现对人形机器人从脚到指尖的全身控制。

    推荐理由:官方给出了全身控制、22 自由度手部操作与多机器人协作的能力边界,并说明首个具身推理模型已开放入口。

7月27日周一
  1. Import AI77

    Epoch 与 METR 发布 MirrorCode 基准:AI 可完成数周规模的编程任务

    Epoch 与 METR 发布 MirrorCode 基准,让 AI 仅凭 CLI 访问重实现软件程序,25 个目标程序中 17 个有满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成 METR 和 Epoch 估计人类需 2-17 周的任务。

    推荐理由:MirrorCode 用 25 个真实程序衡量 AI 自主重实现能力,Opus 4.7 花 14 小时完成人类需数周的任务。