跳到正文
今天10月10日周六1 条
10月9日周五
  1. MIT Technology Review · AI32

    我们过于相信 AI 说“不”的能力

    MIT Technology Review 指出,AI 的拒绝机制已成为 AI 安全的核心,但这一机制并不可靠。Anthropic 2021 年提出模型应 helpful、honest、harmless,如今模型经大量拒绝训练后仍可能被绕过,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。

10月8日周四
10月6日周二
  1. The Verge · AI22

    参议员 Adam Schiff 谈 AI 监管、言论自由与再次弹劾特朗普

    加州民主党参议员 Adam Schiff 在 Decoder 播客中批评特朗普本周召集 AI 高管签署的自愿性 AI 安全承诺不具约束力,认为先进模型递归自我改进带来的失控风险是最高级别的国家安全关切。他支持设立新机构监管 AI,并提到 Anthropic 因拒绝将 AI 用于国内大规模监控和全自主武器系统而遭政府打压。

10月1日周四
9月30日周三
9月29日周二
9月28日周一
9月23日周三
9月22日周二
  1. MIT Technology Review · AI36

    别被这个夏天的 AI 炒作骗了:从 Claude Mythos 到 OpenAI Astra 的真相

    针对今夏一系列 AI 炒作,文章指出 Anthropic 宣称 Claude Mythos 找漏洞强于多数安全专家、OpenAI 与 Hugging Face 遭黑客事件,以及双方各自宣称的数学突破,在专家审视后均呈现不同面貌。数学家指责 OpenAI 的 Astra 成果并非首创,并指控其研究不端与抄袭。文章呼吁政策制定者与公众听取独立专家意见,不要被企业新闻稿和"超级智能"叙事左右。

9月21日周一
  1. NVIDIA Blog38

    NVIDIA 谈 AI 安全:如何在智能体栈的每一层解决这一工程问题

    NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。智能体栈中模型、harness 与运行时环境各层都承担安全责任,权限不能随任务自动扩展,敏感操作仍需人工审批。NVIDIA OpenShell 作为开源安全运行时在智能体之外强制执行策略并提供沙箱执行,Cisco DefenseClaw 与 JFrog 已在其上构建治理与技能扫描能力。

  2. Import AI22

    Import AI 473:美国超级智能战略、人脑组织小鼠实验与机器诠释学

    RAND 发布长篇论文,建议美国在通往超级智能的不确定路径上采取“自由行动”战略,通过投资 AI 安全、构建 AI 安全架构、改造国家安全体系等方式保留地缘政治优势。论文还归纳了共存、拒止、加速三类共七种原型战略,并列出危险临近程度、共存可行性、遏制可行性等五项关键不确定性。

9月9日周三
9月6日周日
8月31日周一
8月10日周一
6月8日周一
  1. Import AI60

    Import AI 460:社会可被奖励攻击、Anthropic 的 RSI 数据与 RL 四旋翼竞速

    本期 Import AI 汇总多项研究:伦敦国王学院、复旦大学与艾伦图灵研究所构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校评分等场景中钻制度漏洞的能力,RL 训练的 LLM 在历史子集上以 61.25% 召回率、90.85% 精确率重新发现已被修补的漏洞策略。

5月26日周二
5月11日周一
  1. Import AI38

    Import AI 456:RSI 与经济增长、AI 监管的"激进可选性"、以及神经计算机

    Institute for Law & AI 提出"激进可选性"监管思路,主张政府当下就投资信息收集、举报人保护、评估能力与模型权重安全等工具,避免过度监管的同时为未来强 AI 冲击预留应对手段。Meta 与 KAIST 的论文提出 Neural Computer,将计算、内存与 I/O 统一在学习到的运行时状态中。