Skip to main content
跑 recipe 所属框架自带的评测——NeMo-RL 的 evaluation config、verl 的 SFT 验证循环。 这是框架自己那套「现在跑得怎么样」,用的是框架自己的口径。 这和 sf bench 不同:后者通过外部 harness 跑学术标准基准, 结果能跨 run、跨方法、跨别人的模型比较。在一个方法内部迭代时用 sf eval,要做比较时用 sf bench 它也能在训练后自动执行:

sf eval

Run a recipe’s native evaluation