MIT Technology Review · AI· Arthur Holland Michel·· 21 小时前AI 评分32
我们过于相信 AI 说“不”的能力
We’re putting too much faith in AI’s ability to say no
AI 导读
MIT Technology Review 指出,AI 的拒绝机制已成为 AI 安全的核心,但这一机制并不可靠。Anthropic 2021 年提出模型应 helpful、honest、harmless,如今模型经大量拒绝训练后仍可能被绕过,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。
来源:MIT Technology Review · AI · technologyreview.com