【清华代码熊】总结|Kimi / GLM / DeepSeek后训练OPD算法 本期对比总结Kimi K3/ GLM 5/ DeepSeek V4 后训练On-Policy Distillation 算法。