Skip to main content
<EXP> 是一个评测实验,用 sf new my-bench --method evalkit/benchmark 建一次然后复用。 围绕这些命令的完整流程见跑一次评测

sf bench ls 打印什么

内置基准随平台发布,用户发布的经 sf recipe sync 同步下来。 每一行说明它用哪个 runner、主指标是什么、属于哪一类。

runner 通常轮不到你选

用哪个 runner、few-shot 给几个、样本上限多少,都由基准自己声明—— 所以你不用记住「gsm8k 要 5-shot」或者「humaneval 要加 --confirm_run_unsafe_code」。 --runner 只在评测平台没有收录的原始 suite 名时才需要。如果你选中的基准跨了两个 runner——比如 gsm8k 用 lm-eval、ceval 用 evalscope—— 提交会被拒绝,并告诉你分两次提交。一次评测作业是一个进程, 而悄悄把它拆成两次比明说更糟。

示例

sf bench

Run standard benchmarks

sf bench external

Report scores from an external harness

sf bench external create

Open an external evaluation

sf bench external submit

Report a score file

sf bench ls

List the available benchmarks

sf bench new

Scaffold a safety benchmark pack

sf bench run

Submit a benchmark evaluation job