跳到正文
10月7日周三
  1. Hugging Face Blog62

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    英伟达团队基于 Nemotron 3 通过 SFT、RL 和生成-验证-精炼推理流程,在 IOI 2026 和 IMO 2026 双双达到金牌水平。IOI 2026 中 Nemotron-3-Ultra-CC 得 535.4/600,高于 361.12 的金牌线;IMO 2026 系统得 30/42,高于 29 的官方金牌线。

    推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方与数据集,可据此复现领域专家模型。

10月6日周二
  1. Simon Willison22

    Qwen3.8 27B 用英文单词做加法的基准测试

    本地 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时用英文单词做加法仅得 23.57% 数值准确率,格式合规率 96.17%,一至三位数操作数准确率 97.04%,十至十三位数骤降至 6.44%。启用推理后 169 次配对测试答对 167 次,但每次仅跑一个样本。该实验在 DGX Spark 上复现 GPT-4o 的单词加法测试。

10月2日周五
  1. Ars Technica · AI60

    CMU 等团队用 16 块 GPU 训练 AI Ataraxos,15 比 1 击败最强 Stratego 选手

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出 AI Ataraxos,以 15 胜 1 负 4 平击败被视为史上最强的 Stratego 选手 Pim Niemeijer。Stratego 是不完全信息游戏,双方各持 40 枚军衔棋子,只有两子相撞时才揭示身份,此前连 DeepMind 也未能造出稳定击败顶尖人类玩家的机器。该研究训练仅用 16 块 GPU 和数千美元。

9月29日周二
  1. 量子位39

    亚马逊与杜克大学研究:删掉99.95%训练信号,大模型推理反而更好

    亚马逊与杜克大学团队发现,在On-Policy Distillation中每条推理轨迹只随机训练一个token(约0.05%信号),仍能稳定提升Qwen3系列9组teacher-student配置的数学推理能力,单个极端token甚至可匹配或超过full-token OPD,并出现学生反超教师的情况。该现象还扩展到coding reasoning、Llama系列和基于PPO的RLVR。

9月16日周三
9月8日周二
8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过自身全精度版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始全精度模型蒸馏,而不是从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复方案,并附9项基准对比,可看方法差异与代价。

8月17日周一
8月13日周四
  1. Microsoft Research39

    MindTopo:微软推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、分离、顺序、包围和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上明显强于交互式规划任务,失败多发生在规划阶段而非感知阶段,且图像与视频生成工具在跨多步动作中维持拓扑关系并不可靠。

8月12日周三
  1. Google Research62

    Google Research:召回而非编码是 LLM 参数化事实性的瓶颈

    Google Research 提出知识画像框架,用编码、知识、召回三个行为概念区分事实错误来自知识未编码还是已编码但无法访问,并发布包含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。

    推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识可访问性而非知识缺失。

8月11日周二
7月29日周三
7月26日周日
  1. Berkeley AI Research38

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。

6月25日周四
  1. Google Research29

    Google Research 研究:推理如何解锁 LLM 的参数化知识

    Google Research 在 COLM 2026 论文中揭示,让模型生成推理链能解锁原本无法召回的事实答案,即使问题只是单跳事实查询。研究用 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 在 SimpleQA Verified 和 EntityQuestions 上对比推理开关两种模式,发现两个机制:额外 token 充当计算缓冲,以及生成相关事实的"事实启动"效应。

4月20日周一
4月16日周四
3月25日周三
  1. Google Research62

    Google 发布 TurboQuant 向量压缩算法,KV cache 压至 3 bit 无精度损失

    Google 发布 TurboQuant 压缩算法,用于解决向量量化中的内存开销问题,并同时提出 QJL 和 PolarQuant 两种配套方法,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。

    推荐理由:Google 提出的向量量化方法把 KV cache 压到 3 bit 且不损失精度,读者可据此判断长上下文推理的内存成本走向。

3月13日周五
  1. Berkeley AI Research28

    Berkeley AI Research 提出 SPEX 与 ProxySPEX,可在规模化下识别 LLM 关键交互

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在规模化下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约 10 倍更少的消融达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,而 LIME、Banzhaf 等边际方法忠实度明显更低。