> ## Documentation Index
> Fetch the complete documentation index at: https://starforge.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Benchmarks 看板

> 标准基准分数矩阵：跨 run、跨方法、跨基座可比

**Benchmarks** 页（`/benchmarks`）汇总所有 `sf bench` 产出的分数：

<Frame caption="Benchmarks 看板。跑过 `sf bench` 之后才会有分数。">
  <img src="https://mintcdn.com/starforge/GatXR2rI5-_Vm4_H/images/console/benchmarks.png?fit=max&auto=format&n=GatXR2rI5-_Vm4_H&q=85&s=4c566bdcc2e13ced6378a9d975671356" alt="StarForge Benchmarks 页" width="2160" height="1350" data-path="images/console/benchmarks.png" />
</Frame>

* 行 = 模型 / run，列 = 基准（GSM8K / MMLU / C-Eval…）。单元格是分数和样本数。
* 每列最优分标绿。
* 过滤：基座、方法、runner、时间范围。
* 点分数跳到那次评测作业（日志和 runner 参数）。

## 数据从哪来

`sf bench` 的评测作业在训练容器内跑 lm-eval / evalscope，分数经 ingest 幂等入库（同 run 同基准重跑覆盖旧分，不产生重复行）。两个 runner 遵守同一分数契约，同一基准跨 runner 可比。

<Tip>
  养成「训练前先评基座」的习惯，看板上才有提升幅度的参照系。用法见[标准基准评测](/zh-Hans/guides/benchmarks)。
</Tip>
