跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 21 小时前AI 评分36

我们高估了 AI 说"不"的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 文章指出,AI 的拒绝机制已成为 AI 安全的核心支柱,但因其基于概率,可靠性有限,且拒绝边界由企业秘密划定。文章援引 OpenAI 前安全研究员 Steven Adler 和哈佛研究者 Ryan McBain 的说法,早期模型几乎有问必答,如今模型虽经大量拒绝训练,仍可能被绕过,部分用户已尝试用先进 AI 研发生物病原体和自主无人机蜂群。

来源:MIT Technology Review · AI · technologyreview.com