> ## Documentation Index
> Fetch the complete documentation index at: https://starforge.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 数据集

> 有版本的数据集资产、文件清单，以及数据质量报告。

<Frame caption="数据集版本，含文件清单与质量指标。">
  <img src="https://mintcdn.com/starforge/GatXR2rI5-_Vm4_H/images/console/datasets.png?fit=max&auto=format&n=GatXR2rI5-_Vm4_H&q=85&s=1a111ce729c2bf41b4baf6c6ba7409c6" alt="StarForge 数据集页" width="2160" height="1350" data-path="images/console/datasets.png" />
</Frame>

## 你会看到什么

| 区域       | 显示什么                       |
| -------- | -------------------------- |
| **版本**   | 每个不可变版本及其校验和               |
| **文件清单** | 这个版本里有什么，以及每个文件的大小         |
| **预览**   | 控制台能渲染的格式的样本记录——且仅在策略允许时   |
| **数据质量** | 推送时对全量数据计算                 |
| **使用情况** | 哪些作业引用过它，这是判断某个版本能否安全删除的依据 |

## 质量报告

在推送时算一次，覆盖全量数据——只有非常大的数据集才采样。
它统计的是机器能统计的东西，不假装能判断内容。

| 指标               | 为什么有它                                      |
| ---------------- | ------------------------------------------ |
| **记录数**          | 确认你以为自己上传的那个数                              |
| **重复**           | 近似重复和完全字节相同分开统计。重复率高意味着模型会对重复样本过拟合         |
| **空记录**          | 没有可用内容的记录                                  |
| **长度 p50 / p95** | 用 p95 而不是均值来定 `max_seq_len`——按均值会截掉五分之一的数据 |
| **字段漂移**         | 字段集合与多数派不同的记录，以及它们缺了哪些字段                   |

<Tip>
  字段漂移是最能抓到真 bug 的那一项。几百条记录缺了你的 loss 要读的字段，作业不会失败；
  它们会安静地在空值上训练，然后把曲线拖下去。
</Tip>

## 受保护的数据集

一个数据集可以被治理成「可以用于训练，但读不到内容」。这样的数据集在控制台上只显示
身份、版本、schema、血缘和授权状态——没有预览、没有样本记录、没有下载。

这是在服务端强制的，不是把按钮藏起来。日志、验证样本和产物受同一套策略约束，
所以它们不会变成另一条导出通道。

## 你可以做什么

* 在配置里或用 `--train-dataset` **引用某个版本**。
* 用 `sf dataset push` **推送新版本**。
* 推送前用 `sf dataset check` 和 `sf dataset quality` **先检查质量**。

完整流程见[数据集](/zh-Hans/guides/datasets)。
