OPD: On-Policy Distillation 介于 SFT 与 RL 之间的第三条路
作者:XD / 发表: 2026年6月30日 02:22 / 科研学习/ 阅读量:712
OPD: On-Policy Distillation 介于 SFT 与 RL 之间的第三条路
OPD: On-Policy Distillation 介于 SFT 与 RL 之间的第三条路
强化学习算法GRPO, DAPO, GSPO简单介绍
本站现有博文333篇,共被浏览910597次
本站已经建立2613天!