我们过于相信 AI 说“不”的能力
MIT Technology Review 指出,AI 的拒绝机制已成为 AI 安全的核心,但这一机制并不可靠。Anthropic 2021 年提出模型应 helpful、honest、harmless,如今模型经大量拒绝训练后仍可能被绕过,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。
MIT Technology Review 指出,AI 的拒绝机制已成为 AI 安全的核心,但这一机制并不可靠。Anthropic 2021 年提出模型应 helpful、honest、harmless,如今模型经大量拒绝训练后仍可能被绕过,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。
The Verge 的 Decoder 播客中,资深 AI 记者 Hayden Field 与主持人 Nilay Patel 讨论了 Meta 的 Muse、OpenAI 的 Dots 和 xAI 的 Grok Bot 等消费级 AI 智能体。
Tony Fadell 在 MIT Future Fest 上指出,Rabbit R1、Humane Ai pin、Limitless pendant 等首波 AI 硬件失败的原因是没解决真实需求,只是"极客觉得有趣的技术"。
苹果正研发一款不保存视频的智能家居摄像头,改用 AI 将画面转成文字描述,并支持人脸识别;Google 可穿戴设备负责人 Sandeep Waraich 也提出智能眼镜摄像头可只做图像传感器、不存任何影像。
John Gruber 在评论 Meta Muse 时指出,Muse 因技术上的突破性(每位用户获得运行在 Meta 云端的完整持久 Linux VM)和易于安装使用而受到大量关注,它被包装成一个可爱的吉祥物,是首个面向消费者可用的智能体 AI 系统。但他认为消费者未必理解这意味着什么,人们没有意识到 Muse 有多强大、因而有多危险,尤其是在自己的 Mac 上运行时。
针对今夏一系列 AI 炒作,文章指出 Anthropic 宣称 Claude Mythos 找漏洞强于多数安全专家、OpenAI 与 Hugging Face 遭黑客事件,以及双方各自宣称的数学突破,在专家审视后均呈现不同面貌。数学家指责 OpenAI 的 Astra 成果并非首创,并指控其研究不端与抄袭。文章呼吁政策制定者与公众听取独立专家意见,不要被企业新闻稿和"超级智能"叙事左右。