跳到正文
量子位· 关注前沿科技·· 11 天前AI 评分39

亚马逊与杜克大学研究:删掉99.95%训练信号,大模型推理反而更好

删掉99.95%训练信号,效果反而更好!极端稀疏监督刷新大模型后训练逻辑

AI 导读

亚马逊与杜克大学团队发现,在On-Policy Distillation中每条推理轨迹只随机训练一个token(约0.05%信号),仍能稳定提升Qwen3系列9组teacher-student配置的数学推理能力,单个极端token甚至可匹配或超过full-token OPD,并出现学生反超教师的情况。该现象还扩展到coding reasoning、Llama系列和基于PPO的RLVR。

来源:量子位 · mp.weixin.qq.com