Back
从 next-token 条件分布出发,统一理解 SFT、RL/GRPO、OPD 三种训练范式的梯度机制,并以 slime 源码为例解析 On-Policy Distillation 的 advantage shaping 实现。
llm
rl