Skip to main content
Hugging Face TRL 1.10.0作为独立运行时,不走 custom 转发。方法有:trl/sftdpogrpormktorlooopsd 可观测性是 platform。TRL 自己的指标名(losseval_losslearning_rate) 会被映射到控制台的曲线上,所以你不用改名字曲线就会有数据。

创建

入口是实验目录里的 train.pykind: experiment)。除非你明确要改入口,超参写在 config.yaml / --set 里。

提交:模型和数据必填

和 verl 一样:--model--train-data(通常还有 --validation-data)必填,除非配置里绑定字段已经有了。
trl/opsd 需要词表一致的 teacher(recipe 参数里的 teacher_model)。缺了校验会失败。 门禁 Hub 仓库:在控制台关联 HuggingFace,提交预检才能核对权限。HuggingFace

启动

adapter 用 Accelerate(adapter_options.launcher: accelerate)。卡数仍来自 --profile / FORGE_CLUSTER_GPUS_PER_NODE

训练之后

checkpoint 是 HuggingFace 布局(checkpoint-*final_model)。recipe 声明了 export/eval 生命周期(starforge.lifecycle.export_complete、实验里的 eval.py)。