MIT Technology Review · AI· Arthur Holland Michel·· 5 小时前AI 评分50
我们高估了 AI 说"不"的能力
We’re putting too much faith in AI’s ability to say no
AI 导读
Anthropic 2021 年提出大语言模型应"有用、诚实、无害",如今拒绝回答已成为现代 AI 的固有特性:模型经大量有害提示训练学会拒绝,企业还用其他模型互相训练、并在模型外层加设防护。但拒绝机制本质是概率性的,既会失效——有用户试图用最先进 AI 研发生物病原体、构建自主无人机蜂群,也会被政府用来压制合法言论。
来源:MIT Technology Review · AI · technologyreview.com