跳到正文

#安全/对齐

今日 1 条
今天10月1日周四
9月30日周三
  1. Google DeepMind65

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质与结构加水印

    Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,在生物代码中嵌入不可感知的签名,使其不只在数字模型上、也能在合成出的实体蛋白质上被验证,同时保留其生物功能。

    推荐理由:Google DeepMind 把水印技术从图像扩展到蛋白质与 3D 结构,读者可看到生物安全筛查的一层新验证思路。

9月29日周二
9月23日周三
9月22日周二
9月21日周一
  1. NVIDIA Blog37

    AI 安全是一个工程问题:如何在 Agent 栈的每一层解决它

    NVIDIA 提出把 AI 安全当作工程问题来对待:Agent 栈从模型、harness 到运行时环境每一层都需有可执行的边界、明确责任人和验证证据。其开源的 NVIDIA OpenShell 提供策略在 Agent 触及范围之外强制生效的安全运行时,并支持沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。

9月18日周五
9月17日周四
9月10日周四
9月9日周三
9月8日周二
9月3日周四
9月2日周三
8月27日周四
  1. Google DeepMind62

    Google DeepMind 联合新加坡 AI Safety Institute 试点全球首个双盲 AI 评测

    Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测,将外部评测限制在加密环境中,使模型无法提前接触测试题目。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。

    推荐理由:DeepMind 与新加坡 AI 安全研究所等机构用加密隔离环境对 Gemini Flash Lite 做双盲评测,读者可了解基准污染之外的技术性解决路径。

8月4日周二
  1. Mistral AI62

    Mistral AI 发布 3B 开源多模态安全分类器 Shieldstral

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可发布,可在单张 16GB NVIDIA GPU 上运行。该模型把内容审核转化为策略自适应问答任务,推理时直接接受自然语言策略,无需重新训练即可统一文本与图像安全评估,官方称其在文本安全和多模态审核基准上匹配或超过至多 7 倍规模的开放护栏模型,并给出可阈值化的连续安全评分。

    推荐理由:3B 分类器以推理时自然语言策略替代固定危害分类,读者可据此判断轻量护栏模型的部署方式变化。

7月27日周一
  1. Hugging Face Blog91

    Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线

    Hugging Face 发布技术复盘,披露 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体对其平台发起的入侵,共还原约 17,600 个操作、归为约 6,280 个操作簇。

    推荐理由:Hugging Face 以当事方身份复盘一次由前沿智能体发起、约 1.76 万步操作的入侵,给出两处注入向量与横向移动的完整链路。

7月17日周五
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全模型

    Google DeepMind 推出 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用 CodeMender 的方式取得与更大模型相当的表现。

    推荐理由:官方给出了新模型在真实代码库漏洞挖掘上的基准与落地案例,可据此判断轻量安全模型的能力边界。

7月16日周四
  1. Hugging Face Blog91

    Hugging Face 披露一起由自主 AI 智能体驱动的安全入侵事件

    Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该入侵由一套自主 AI 智能体系统端到端驱动。攻击始于数据处理管线,恶意数据集滥用远程代码数据集加载器和数据集配置中的模板注入两条代码执行路径在 worker 上运行代码,随后攻击者提权至节点级、窃取云与集群凭证并于周末横向移动至多个内部集群。

    推荐理由:Hugging Face 披露由自主智能体端到端驱动的入侵及处置,并说明防御方模型选型受限的经过。

6月16日周二
  1. Google DeepMind48

    Google DeepMind 发布 AI Control Roadmap,为内部 AI 智能体构建纵深防御

    Google DeepMind 推出 AI Control Roadmap,用纵深防御思路保障内部部署的 AI 智能体安全,即便模型对齐不完美也能提供保障。该框架将不可信智能体视为"内部威胁",借鉴 MITRE ATT&CK 拆解攻击手法,并用可信 AI 监督工作智能体的推理与行动。团队已分析 100 万个编码智能体任务,并为 Gemini Spark 智能体搭建实时监控,防范数据误删等问题。

6月11日周四
  1. Google Research30

    Google 推出 Regularized f-Divergence Kernel Tests:面向机器遗忘审计的新框架

    Google 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘:通过相对距离检验判断模型分布更接近安全重训模型还是原始受损模型。该框架基于 f-divergence,支持 Chi-squared、KL 和 Hockey-stick 散度,并用核正则化高效估计高维数据差异,自动选择散度与超参数、无需样本切分。

6月10日周三
5月28日周四
  1. Google Research37

    Google 推出零信任聚合的私有分析方案,结合密码学与 TEE

    Google 公布一套面向私有分析的零信任聚合新方案,用新型密码学聚合协议保护用户数据,设备只需发送单条消息、无需多轮在线交互,Google 只能得到匿名化的群体聚合结果。该方案将密码学层与 TEE 结合,在硬件保护失效时数据仍不会被还原,并借助 TEE 远程证明向参与者验证协议按公开代码正确执行。

4月27日周一
4月3日周五
3月31日周二
3月13日周五