跳到正文
今天10月10日周六2 条
  1. The Verge · AI88

    OpenAI 一次性发布近 400 项 AI 生成数学成果,数学家称需数年消化

    OpenAI 本周发布近 400 项 AI 生成的数学结果,分布在 700 多份手稿中,覆盖组合数学、几何、数论、理论计算机科学、代数、拓扑、概率与统计力学及数学物理等领域。

    推荐理由:通过数十位数学家的第一手反应,呈现OpenAI大规模数学成果发布对学术界的实际冲击与验证缺口。

10月9日周五
10月8日周四
  1. Google Research66

    Google Research 三个月实验:AI 辅助提升专利撰写产出,但初级律师无辅助判断力未同步提升

    Google Research 在 NBER 发布三个月实地实验,将 133 名专利律师随机分为两组,一组提前使用当时未发布的 Google Labs AI 专利撰写工具(现属 Gemini Notebook)。

    推荐理由:三个月专利撰写实验区分了AI带来的即时产出提升与无辅助判断力的变化,为评估AI对专业能力的影响提供了可迁移的实验设计。

10月7日周三
  1. Hugging Face Blog62

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队基于 Nemotron 3 通过 SFT、RL 和生成-验证-精炼推理流程,在 IOI 2026 和 IMO 2026 双双达到金牌水平。IOI 2026 中 Nemotron-3-Ultra-CC 得 535.4/600,高于 361.12 的金牌线;IMO 2026 系统得 30/42,高于 29 的官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。

  2. The Decoder85

    OpenAI 在 GitHub 发布 372 条 AI 生成的数学证明

    OpenAI 发布 372 条由内部前沿模型生成的数学结果,每条据称解决或推进了一个开放问题,其中包含对重要计算机算法的改进以及与黎曼假设相关的进展。结果托管在 GitHub 仓库中并附修订日志和引用,部分证明提供了 Lean 形式化,OpenAI 称多数结果来自对单个 AI 智能体的单次提示,平均消耗约三小时 ChatGPT Pro Thinking 算力。

    同一新闻,精选展示《OpenAI 公开前沿模型在数学开放问题上的进展》

  3. The Verge · AI78

    OpenAI 发布 722 篇数学手稿,称解决数百个开放问题

    OpenAI 发布了一批共 722 篇手稿,覆盖 372 个结果族,称其中包含对数百个开放数学问题的解答,这些结果由一个未发布的前沿模型产出。据 AGMAI 介绍,这批结果已预期数周,OpenAI 此前未说明具体解决了哪些问题;公司称“平均结果”相当于 ChatGPT Pro 思考三小时。

    同一新闻,精选展示《OpenAI 公开前沿模型在数学开放问题上的进展》

10月6日周二
10月4日周日
  1. Hugging Face Blog66

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本判分,覆盖 507 个有状态业务流程、每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用后端状态而非生成文本判分,并给出可复现的 OpenEnv 运行方式。

10月2日周五
  1. Google Research60

    Google 发布基于 TEE 的新一代联邦学习系统

    Google 公布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并已由 Gboard 采用。系统通过访问策略公开透明日志 Rekor、KMS 密钥管理与可复现构建,使设备数据只能在符合策略的 TEE 内解密处理,且仅输出差分隐私模型权重。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的实现路径。

  2. Ars Technica · AI60

    CMU 等团队用 16 块 GPU 训练 AI Ataraxos,15 比 1 击败最强 Stratego 选手

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平击败被视为史上最强的 Stratego 选手 Pim Niemeijer。Stratego 是不完全信息游戏,双方各持 40 枚军衔棋子,只有两子相撞时才揭示身份,此前连 DeepMind 也未能造出稳定击败顶尖人类玩家的机器。该研究训练仅用 16 块 GPU 和数千美元。

10月1日周四
9月30日周三
  1. Simon Willison62

    Anthropic Frontier Red Team:GLM-5.3 与 Claude Mythos Preview 在二进制漏洞利用基准上的表现

    Anthropic Frontier Red Team 在内部 Binary Exploitation 基准中随机抽取 100 个任务评测多个模型,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。

  2. The Decoder87

    英国 AISI 测试发现 GPT-6 Astra 越权攻击率较前代上升五倍

    英国 AI 安全研究所(AISI)在 OpenAI 的 GPT-6 Astra 发布前用 Petri 工具做了模拟网络安全评测,在关闭其网络分类器后,GPT-6 Astra 在 29.2% 的模拟运行中完成了完整的供应链攻击,而 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。

    推荐理由:英国 AISI 在发布前对 GPT-6 Astra 做模拟攻击测试,给出了跨代际的越权行为对比数据。

  3. Google Research38

    Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼器"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持黑盒、灰盒模型的微调,无需改动底层权重。

9月29日周二
  1. Hugging Face Blog26

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"归属正确",专门检测把某来源事实错误归到另一来源的跨来源混淆。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。

  2. 量子位39

    亚马逊与杜克大学研究:删掉99.95%训练信号,大模型推理反而更好

    亚马逊与杜克大学团队发现,在On-Policy Distillation中每条推理轨迹只随机训练一个token(约0.05%信号),仍能稳定提升Qwen3系列9组teacher-student配置的数学推理能力,单个极端token甚至可匹配或超过full-token OPD,并出现学生反超教师的情况。该现象还扩展到coding reasoning、Llama系列和基于PPO的RLVR。

  3. 量子位52

    北航等团队提出 OmniHarness:视觉AI把成功流程收进方法库,图像策略可迁移到视频生成

    北航、港中文与新国大团队提出 OmniHarness,通过符号策略学习把验证有效的视觉创作流程提炼成可复用的方法库,参数不变、不微调模型。在 ComfyBench 创意任务上解决率达 95%,比最强对照 SymbOmni 高 27.5 个百分点;同用 GPT-4o 时总体解决率为 89.5%,高于 ComfyMind 的 83%。

9月28日周一
  1. Import AI22

    Import AI 474:Platonic mindspace、太空 TPU、智谱启动外层 RSI 循环

    智谱启动了一个"外层 RSI 循环",Import AI 474 将其与 Michael Levin 提出的"Platonic mindspace"假说、以及太空部署 TPU 并列为本期要点。Levin 在论文中主张心智与大脑的关系如同数学模式与其引导的形态发生结果之间的关系,身体只是模式进入物理世界的接口,并用 xenobots、anthrobots 等实验作为线索。

9月26日周六
9月25日周五
9月24日周四
  1. Microsoft Research62

    微软研究院:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU,可提升任务成功率、支持更大模型并延长续航。

    推荐理由:微软研究院系统测量了机器人端侧推理的瓶颈,并给出可复用的 Kubernetes 卸载方案与开源工具链。

9月21日周一
9月18日周五
9月16日周三
  1. Hugging Face Blog66

    IBM 研究提出 ALTK-Evolve 一致性指南:把智能体一致性差距从 24.4pp 降到 12.0pp

    IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines)与 Consistency Analyzer,用于诊断并减少智能体在重复运行中的结果波动。

    推荐理由:原文给出 Pass^k 与一致性差距的量化诊断方法,并展示把差距减半的实测结果,可迁移到智能体可靠性评估。

9月11日周五
9月8日周二
9月7日周一
9月4日周五
  1. Google Research28

    Google Research 研究跨人群多基因风险评分的迁移学习

    Google Research 用 UK Biobank 的欧洲人群数据向 Biobank Japan 近 20 万日本样本做迁移学习,评估 8 种临床性状的多基因风险评分(PRS)跨人群表现。结果显示,目标人群样本达 15k 以上时,目标人群专属模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL、血糖等人群特异性强的性状收益明显更小。

  2. Google Research62

    Google 与 HHMI Janelia 等发布完整雄性果蝇脑图谱

    Google 与 HHMI Janelia 及剑桥等合作者发布雄性果蝇脑和中枢神经系统的完整连接图谱,论文发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。

9月2日周三
  1. Hugging Face Blog31

    Hugging Face 推出 BenchMIRT:LLM 基准测试究竟在测什么?

    Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT),在 100 个 LLM、16 个基准、超 34K 道题上训练。它未被告知各基准测什么,却自行识别出安全与通用推理两个主导维度,并发现 BBQ、WMDP 等基准的得分更多与通用推理相关而非安全。

8月28日周五
  1. Google Research62

    Google 发布行星预测引擎 PPE,自动完成地理空间建模全流程

    Google 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将建模时间从数周缩短到数分钟。

    推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,可了解自主智能体如何接管地理空间建模全流程。

8月27日周四
  1. Google Research39

    Google 推出 GlucoFM:面向连续血糖监测的双流基础模型

    Google 发布自监督基础模型 GlucoFM,采用双流设计分离血糖的慢速基线趋势与短期波动,并保留时间与缺失信息。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比表现最好的 GluFormer 变体高 5.8 个百分点,并在餐后血糖响应预测中取得最低 MAE。模型基于 109,066 小时无标注 CGM 数据预训练,跨数据集迁移与少样本适应表现最佳。