英国 AISI 如何用 EvalEval 基础设施让评测结果可复现
英国 AI Security Institute(AISI)正使用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性。
英国 AI Security Institute(AISI)正使用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性。
MIT Technology Review 与 Times of San Diego 用 15 个月完成首张美墨边境监控塔附近死亡的综合地图与分析,梳理了 2015 年以来的案例。团队向得州 17 个县警长办公室申请记录,收到 14 个县逾 4000 页文件,并用 Anthropic 的 Claude(通过 API)提取遗骸发现地点坐标后人工核验。
一名新入职大公司的工程师称,团队所有规格、代码、测试、PRD 和工单均由 Claude Code 生成,从 L1 到 L7 的工程师都在做同一件事——和 Claude 对话。没人阅读任何产出,团队成员每天工作 12 到 13 小时只为按回车,高层却认为推送代码不是瓶颈。
Latent Space 的 AINews 汇总了 9/16-9/17 的 AI 动态:Anthropic 在 Claude Code 中推出 Projects,一次对话可派生多个云端并行会话、在线程间传递上下文并在用户离开后继续运行,本地工作流后续支持。
Latent Space 的 AINews 汇总 9 月 15 至 16 日动态,指出 Steve Yegge 已关停 Gas Town,并承认每月花费数千美元订阅编码智能体,实际只做出了 Gas Town 这一个项目。
AIUC 宣布完成 4000 万美元 A 轮融资,由 Ribbit Capital 和 First Harmonic 领投,客户包括 Cursor、Harvey、Lovable、ElevenLabs。
Good Start Labs 将《1830》铁路桌游改造成 AI 训练环境,用 30B 模型做实验:单轮问答与多轮终端智能体两种训练方式都提升了游戏内表现,但只有终端智能体方案在 Finance-Agent benchmark 上有提升。
Import AI 第 469 期介绍了 DiG-bench(Discovery in Games)基准,包含 70 款隐藏规则的游戏,用于测试 AI 通过探索自主发现环境规则的能力,目前仅公开 21 款。
Epoch 与 METR 发布 MirrorCode 基准,用于测试 AI 系统在长周期编程任务上的表现,任务要求仅凭 CLI 访问、在没有源码和网络的情况下重新实现完整程序。
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家自选议题、提前研究、接受数小时结构化训练并获 1,000 英镑奖金激励。
本期 Import AI 汇总多项研究:伦敦国王学院、复旦大学与艾伦图灵研究所构建 SocioHack 基准,含 72 个沙盒社会环境,测试 AI 在信用卡积分、学校评分等场景中钻制度漏洞的能力,RL 训练的 LLM 在历史子集上以 61.25% 召回率、90.85% 精确率重新发现已被修补的漏洞策略。
Import AI 459 聚焦三项研究:英国 AI 安全研究所的论文指出,用 AI 监督 AI 训练的自动化对齐研究并非万能方案,实施难度高于预期;另有研究提出蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价的探讨。
Import AI 第 458 期收录了一篇基于 2026 年牛津大学 HAI Lab 演讲的长文和一个设想"正向奇点"的虚构故事。演讲以 Epoch Capabilities Index(ECI,覆盖 40+ 项基准)为线索,主张 AI 的快速进步让人类面临"探索未来还是回避当下"的选择,并指出 AI 不能被视为一项普通技术。
Google 与康奈尔大学在《美国国家科学院院刊》发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家按平衡性、全面性、简洁性、证据、图像相关性和定性反馈六项指标盲评打分。