跳到正文
10月9日周五
  1. MIT Technology Review · AI32

    我们过于相信 AI 说“不”的能力

    MIT Technology Review 指出,AI 的拒绝机制已成为 AI 安全的核心,但这一机制并不可靠。Anthropic 2021 年提出模型应 helpful、honest、harmless,如今模型经大量拒绝训练后仍可能被绕过,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。

10月6日周二
  1. The Verge · AI22

    参议员 Adam Schiff 谈 AI 监管、言论自由与再次弹劾特朗普

    加州民主党参议员 Adam Schiff 在 Decoder 播客中批评特朗普本周召集 AI 高管签署的自愿性 AI 安全承诺不具约束力,认为先进模型递归自我改进带来的失控风险是最高级别的国家安全关切。他支持设立新机构监管 AI,并提到 Anthropic 因拒绝将 AI 用于国内大规模监控和全自主武器系统而遭政府打压。

9月30日周三
9月29日周二
9月28日周一
9月24日周四
  1. Latent Space34

    Foundries vs Navigators:AI 如何降低科学研究的成本

    Endura Therapeutics 的 Adrian Sanborn 提出,AI 对科学的影响分为两类:Foundries 用新一代测序、多重检测和物理自动化把实验数据生成速度提升一个数量级,但需要资本和多年投入;Navigators 则把 AI 嵌入公司日常流程,加速决策与实验迭代,无需专有模型或大数据集,且对每家公司都可行。

9月23日周三
9月22日周二
  1. MIT Technology Review · AI36

    别被这个夏天的 AI 炒作骗了:从 Claude Mythos 到 OpenAI Astra 的真相

    针对今夏一系列 AI 炒作,文章指出 Anthropic 宣称 Claude Mythos 找漏洞强于多数安全专家、OpenAI 与 Hugging Face 遭黑客事件,以及双方各自宣称的数学突破,在专家审视后均呈现不同面貌。数学家指责 OpenAI 的 Astra 成果并非首创,并指控其研究不端与抄袭。文章呼吁政策制定者与公众听取独立专家意见,不要被企业新闻稿和"超级智能"叙事左右。

9月21日周一
6月8日周一
  1. Import AI60

    Import AI 460:社会可被奖励攻击、Anthropic 的 RSI 数据与 RL 四旋翼竞速

    本期 Import AI 汇总多项研究:伦敦国王学院、复旦大学与艾伦图灵研究所构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校评分等场景中钻制度漏洞的能力,RL 训练的 LLM 在历史子集上以 61.25% 召回率、90.85% 精确率重新发现已被修补的漏洞策略。

6月1日周一
5月26日周二