我们过于相信 AI 说“不”的能力
MIT Technology Review 指出,AI 的拒绝机制已成为 AI 安全的核心,但这一机制并不可靠。Anthropic 2021 年提出模型应 helpful、honest、harmless,如今模型经大量拒绝训练后仍可能被绕过,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。
MIT Technology Review 指出,AI 的拒绝机制已成为 AI 安全的核心,但这一机制并不可靠。Anthropic 2021 年提出模型应 helpful、honest、harmless,如今模型经大量拒绝训练后仍可能被绕过,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。