> ## Documentation Index
> Fetch the complete documentation index at: https://starforge.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 对比复盘

> 叠加多个 run，决定留哪一个。

选两个或更多作业，控制台会叠加它们的曲线、对比配置差异，并给出一张记分卡。
它要回答的问题不是「发生了什么」，而是「这次有没有变好，我们留哪一个」。

<Frame caption="复盘页：叠加的曲线、记分卡，以及解释差异来源的配置 diff。">
  <img src="https://mintcdn.com/starforge/GatXR2rI5-_Vm4_H/images/console/review.png?fit=max&auto=format&n=GatXR2rI5-_Vm4_H&q=85&s=c0f89b6e81c660ea39a15053b551c9a9" alt="StarForge 复盘页" width="2160" height="1350" data-path="images/console/review.png" />
</Frame>

## 你会看到什么

| 区域            | 显示什么                         |
| ------------- | ---------------------------- |
| **记分卡**       | 并排的评测分数，按每个指标声明的方向标出回退       |
| **主曲线**       | 验证 accuracy 和训练 reward，叠加显示  |
| **配置 diff**   | 只显示真正不同的键，五十个键的配置被压缩成你改过的那三个 |
| **Ask Agent** | 用自然语言问「有没有变好、该留哪个」           |

配置 diff 是最被低估的那一块。两个 run 曲线不一致，几乎总有某个配置键不一致，
而 diff 找到它的速度远快于对着读两份 YAML。

## 你可以做什么

* **增删 run** —— 叠加图会即时更新，不用刷新。
* **Ask Agent** —— 对所选 run 的自然语言分析。除非部署设了 `FORGE_PREMIUM_PUBLIC`，否则仅管理员可用。
* **分享** —— 生成这份对比的只读链接，带过期时间。见[分享](/zh-Hans/console/sharing)。

## 诚实地读一次对比

<AccordionGroup>
  <Accordion title="配置完全相同，曲线却不同" icon="dices">
    随机种子。后训练在完全相同的配置之间也会有波动，有时还不小。
    两个 run 不构成一个结论；如果这个差异重要，把那个变体再跑一次。
  </Accordion>

  <Accordion title="主指标更好，别的更差" icon="scale">
    这是正常结果，也是记分卡展示多个基准而不是一个数的原因。
    后训练会稳定地改进一个轴，同时悄悄损伤另一个——数学、代码、知识、中文、指令遵循
    这几个轴的划分就是为了让这件事可见。
  </Accordion>

  <Accordion title="reward 在涨，评测分数不动" icon="trending-up">
    模型是在变得更擅长你的 reward，而不是更擅长这个任务。
    庆祝之前先看看验证样本：单看曲线的话，reward hacking 长得和这一模一样。
  </Accordion>
</AccordionGroup>
