Back
从 next-token 条件分布出发,统一理解 SFT、RL/GRPO、OPD 三种训练范式的梯度机制,并以 slime 源码为例解析 On-Policy Distillation 的 advantage shaping 实现。
llm
rl
关于 Agent Infra、Coding Agent、LLM 后训练和 AI-native systems 的文章、研究笔记、论文、项目和资料整理。
personal