sf methods 才是「你连的这台服务器实际发布了什么」的权威答案。下面的表是一张地图,不是版本锁定。
控制台的方法页展示同一份 catalog 并把参数铺开,第一次提交前看那个更省事。
NeMo-RL
默认框架,覆盖完整后训练链路。当前 catalog 发布:nemo-rl@0.7.0。
verl
字节 verl 同步 trainer。catalog 发布:verl@0.9.0。入口和参数路径的版本差异写在版本矩阵里(Recipe)。
下面这些 RL 方法跑的都是同一个官方入口(verl.trainer.main_ppo),区别只在 recipe 钉死的 advantage estimator。
这是刻意的:estimator 不是可以写在 config.yaml 里的超参——写了会在提交时被拒,因为「配置和方法悄悄不一致」比报错更糟。
loss 变体——GSPO、CISPO、GMPO、clip-cov / kl-cov、GPG——不是独立方法:它们是上面任一 RL recipe 的
policy_loss_mode 参数。
rollout 校正(TIS / IcePop)同理:每个 verl RL 方法都带 rollout_is* 参数——rollout 引擎和训练器从来就不是同一个策略。
TRL
Hugging Face TRL + Accelerate。catalog 发布:trl@1.10.0。
OpenRLHF
DeepSpeed ZeRO + vLLM hybrid engine(colocate)。catalog 发布:openrlhf@0.11.0。镜像要自建(deploy/docker/Dockerfile.openrlhf),配 FORGE_IMAGE_OPENRLHF 或 runtime 注册表。上游官方 Dockerfile 不会放出带包本体的现成镜像。
评测和 custom
按框架的走法:NeMo-RL、verl、TRL、OpenRLHF。