Skip to main content
NeMo-RL 是完整后训练栈的默认 catalog,当前版本 0.7.0。方法有: nemo-rl/sftdpogrpogrpo-lorappormdistillationmaxrlopsd 可观测性是 platform,这意味着两件事你不用做:传 --observability-url, 以及自己调 starforge.report。adapter 和框架桥都替你做了。

创建和调参

模型和数据一般在 configs/base/configs/models/ 片段里。提交常常不需要 --model / --train-data 配置细节:config.yaml

提交

--profile 决定记账拓扑。adapter 用 FORGE_CLUSTER_*cluster.num_nodescluster.gpus_per_node,并把 checkpointing.checkpoint_dir / logger.log_dir 指到 FORGE_OUT_DIR。实验文件里不要和这些键对着干,会被覆盖。 异构池(训练和 rollout 用不同卡型)只在 kuberay / slurm
存在独立 rollout 池时,adapter 会设 policy.generation.colocated.enabled=false,并从 FORGE_POOL_TOPOLOGY 填生成侧资源。不必再维护一份 noncolocated overlay YAML。 localagent 不能跑多池作业。

入口

默认是版本化的 NeMo-RL 模块或文件。recipe 声明了 experiment_override 且实验目录里有那个文件时,用实验内文件(自带 run.py 的自定义环境/数据集实验)。JobSpec 里的 spec.source.entrypoint 会被拒绝;不能用提交 JSON 覆盖 recipe 入口。 容器需要 NEMO_RL_DIR(服务端 FORGE_NEMO_RL_DIR,NGC 镜像里一般是 /opt/nemo-rl)。缺了会编译失败:服务端没法代理 nemo-rl 作业。

训练之后

提交时加 --then export --then eval,会在 SUCCEEDED 之后自动跑。

工具环境

GRPO/PPO 可以指向 common/environments/ 下的模块。见智能体环境