跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 2 天前AI 评分38

我们是否过度相信 AI 说“不”的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的核心机制,但这一机制并不可靠。Anthropic 2021 年提出大语言模型应“有用、诚实且无害”,如今模型经大量拒绝训练与 AI 互训,仍可能被绕过,有用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。文章还警告,拒绝机制会迫使企业划定“该服从与该拒绝”的界线,而这条线也可能被政府用来压制合法言论。

来源:MIT Technology Review · AI · technologyreview.com