极端稀疏监督提升大模型推理能力
热点事件历史事件
极端稀疏监督提升大模型推理能力
1 篇报道1 个报道来源11 天前更新
先了解这件事
报道摘要
亚马逊与杜克大学团队发现,在On-Policy Distillation中每条推理轨迹只随机训练一个token(约0.05%信号),仍能稳定提升Qwen3系列9组teacher-student配置的数学推理能力,单个极端token甚至可匹配或超过full-token OPD,并出现学生反超教师的情况。该现象还扩展到coding reasoning、Llama系列和基于PPO的RLVR。
摘自 量子位
最新进展9月29日 14:47
亚马逊与杜克大学研究:删掉99.95%训练信号,大模型推理反而更好报道时间线
沿着报道,了解事件的不同侧面。
9月29日
- 量子位亚马逊与杜克大学研究:删掉99.95%训练信号,大模型推理反而更好
亚马逊与杜克大学团队发现,在On-Policy Distillation中每条推理轨迹只随机训练一个token(约0.05%信号),仍能稳定提升Qwen3系列9组teacher-student配置的数学推理能力,单个极端token甚至可匹配或超过full-token OPD,并出现学生反超教师的情况。该现象还扩展到coding reasoning、Llama系列和基于PPO的RLVR。