跳到正文
今天10月10日周六1 条
10月9日周五
  1. MIT Technology Review · AI32

    我们过于相信 AI 说“不”的能力

    MIT Technology Review 指出,AI 的拒绝机制已成为 AI 安全的核心,但这一机制并不可靠。Anthropic 2021 年提出模型应 helpful、honest、harmless,如今模型经大量拒绝训练后仍可能被绕过,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。

10月8日周四
10月7日周三
10月6日周二
10月2日周五
  1. MIT Technology Review · AI44

    别被迷惑:LLM 并不会真正推理

    前 Google DeepMind 研究员指出,LLM 的思维链仍由同一套下一 token 预测生成,并非独立推理机制。他列举三大缺陷:缺乏可检视的持久认知状态、知识与操作无法分离、思维链常是事后编造。他主张借鉴 AlphaGo 的搜索架构,为模型建立可更新的认知状态。

9月30日周三
9月28日周一
9月23日周三
6月8日周一
  1. Import AI60

    Import AI 460:社会可被奖励攻击、Anthropic 的 RSI 数据与 RL 四旋翼竞速

    本期 Import AI 汇总多项研究:伦敦国王学院、复旦大学与艾伦图灵研究所构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校评分等场景中钻制度漏洞的能力,RL 训练的 LLM 在历史子集上以 61.25% 召回率、90.85% 精确率重新发现已被修补的漏洞策略。