跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 21 小时前

我们高估了 AI 说"不"的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 刊文指出,AI 的拒绝机制已成为 AI 安全的承重墙,但这一机制并不可靠。Anthropic 2021 年提出模型应"有用、诚实、无害",如今模型经大量拒绝训练,却仍可能被绕过,有公司报告用户正试图用先进 AI 培育生物病原体、构建自主无人机蜂群。文章认为,拒绝的边界由 AI 公司秘密划定,政府也将介入,而拒绝能力越强,越可能被用于压制异见。

来源:MIT Technology Review · AI · technologyreview.com