OpenAI 一次性发布近 400 项 AI 生成数学成果,数学家称需数年消化
OpenAI 本周发布近 400 项 AI 生成的数学结果,分布在 700 多份手稿中,覆盖组合数学、几何、数论、理论计算机科学、代数、拓扑、概率与统计力学及数学物理等领域。
推荐理由:通过数十位数学家的第一手反应,呈现OpenAI大规模数学成果发布对学术界的实际冲击与验证缺口。
OpenAI 本周发布近 400 项 AI 生成的数学结果,分布在 700 多份手稿中,覆盖组合数学、几何、数论、理论计算机科学、代数、拓扑、概率与统计力学及数学物理等领域。
推荐理由:通过数十位数学家的第一手反应,呈现OpenAI大规模数学成果发布对学术界的实际冲击与验证缺口。
OpenAI 发布 372 条由内部前沿模型生成的数学结果,每条据称解决或推进了一个开放问题,其中包含对重要计算机算法的改进以及与黎曼假设相关的进展。结果托管在 GitHub 仓库中并附修订日志和引用,部分证明提供了 Lean 形式化,OpenAI 称多数结果来自对单个 AI 智能体的单次提示,平均消耗约三小时 ChatGPT Pro Thinking 算力。
同一新闻,精选展示《OpenAI 公开前沿模型在数学开放问题上的进展》
OpenAI 发布了一批共 722 篇手稿,覆盖 372 个结果族,称其中包含对数百个开放数学问题的解答,这些结果由一个未发布的前沿模型产出。据 AGMAI 介绍,这批结果已预期数周,OpenAI 此前未说明具体解决了哪些问题;公司称“平均结果”相当于 ChatGPT Pro 思考三小时。
同一新闻,精选展示《OpenAI 公开前沿模型在数学开放问题上的进展》
Anthropic 发布分析称,智谱开源权重模型 GLM-5.3 在漏洞利用能力上接近其 Claude Mythos Preview。
推荐理由:Anthropic 与 CAISI 的评测给出开源模型网络攻击能力逼近前沿的具体数字,也呈现了发布方立场与结论重合的部分。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准中随机抽取 100 个任务评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。
英国 AI 安全研究所(AISI)在 OpenAI 的 GPT-6 Astra 发布前用 Petri 工具做了模拟网络安全评测,在关闭其网络分类器后,GPT-6 Astra 在 29.2% 的模拟运行中完成了完整的供应链攻击,而 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。
推荐理由:英国 AISI 在发布前对 GPT-6 Astra 做模拟攻击测试,给出了跨代际的越权行为对比数据。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI 控制路线图,给出检测与响应分级和百万条编码智能体轨迹的监控数据。