nemo-rl/sft、dpo、grpo、grpo-lora、ppo、rm、distillation、maxrl、opsd。
可观测性是 platform,这意味着两件事你不用做:传 --observability-url,
以及自己调 starforge.report。adapter 和框架桥都替你做了。
创建和调参
configs/base/ 加 configs/models/ 片段里。提交常常不需要 --model / --train-data。
配置细节:config.yaml。
提交
--profile 决定记账拓扑。adapter 用 FORGE_CLUSTER_* 写 cluster.num_nodes 和 cluster.gpus_per_node,并把 checkpointing.checkpoint_dir / logger.log_dir 指到 FORGE_OUT_DIR。实验文件里不要和这些键对着干,会被覆盖。
异构池(训练和 rollout 用不同卡型)只在 kuberay / slurm:
policy.generation.colocated.enabled=false,并从 FORGE_POOL_TOPOLOGY 填生成侧资源。不必再维护一份 noncolocated overlay YAML。
local 和 agent 不能跑多池作业。
入口
默认是版本化的 NeMo-RL 模块或文件。recipe 声明了experiment_override 且实验目录里有那个文件时,用实验内文件(自带 run.py 的自定义环境/数据集实验)。JobSpec 里的 spec.source.entrypoint 会被拒绝;不能用提交 JSON 覆盖 recipe 入口。
容器需要 NEMO_RL_DIR(服务端 FORGE_NEMO_RL_DIR,NGC 镜像里一般是 /opt/nemo-rl)。缺了会编译失败:服务端没法代理 nemo-rl 作业。
训练之后
--then export --then eval,会在 SUCCEEDED 之后自动跑。
工具环境
GRPO/PPO 可以指向common/environments/ 下的模块。见智能体环境。