跳到正文
热点事件历史事件

极端稀疏监督提升大模型推理能力

1 篇报道1 个报道来源11 天前更新

先了解这件事

报道摘要

亚马逊与杜克大学团队发现,在On-Policy Distillation中每条推理轨迹只随机训练一个token(约0.05%信号),仍能稳定提升Qwen3系列9组teacher-student配置的数学推理能力,单个极端token甚至可匹配或超过full-token OPD,并出现学生反超教师的情况。该现象还扩展到coding reasoning、Llama系列和基于PPO的RLVR。

摘自 量子位

报道时间线

沿着报道,了解事件的不同侧面。

9月29日
  1. 量子位
    亚马逊与杜克大学研究:删掉99.95%训练信号,大模型推理反而更好

    亚马逊与杜克大学团队发现,在On-Policy Distillation中每条推理轨迹只随机训练一个token(约0.05%信号),仍能稳定提升Qwen3系列9组teacher-student配置的数学推理能力,单个极端token甚至可匹配或超过full-token OPD,并出现学生反超教师的情况。该现象还扩展到coding reasoning、Llama系列和基于PPO的RLVR。