Skip to main content
用户侧语义见资源模型;本页讲运维怎么配。

卡型 series

一类卡的规格与调度参数(内置 h200 / h100 默认,FORGE_HARDWARE_SERIES JSON 覆盖):

Profile

卡型 + 默认形状 + 调优覆盖(内置默认,FORGE_CLUSTER_PROFILES 覆盖):
  • name / series / num_nodes / gpus_per_node:形状即配额与训练的权威拓扑;
  • env:进程环境(NCCL、Ray 内存阈值、PyTorch 分配器)——多节点须与 ray start 同一份;
  • overrides:框架覆盖项(并行度、vLLM 显存比、micro batch)。只放所有实验共有的键(CLI override 是 struct 模式,改不存在的键会报错)。
控制台 管理 → 平台设置 → 硬件 可视化编辑,热生效(实例按 FORGE_HWCONFIG_REFRESH_INTERVAL 拉取)。

用户配额

FORGE_QUOTA_ENFORCE=0 可整体降为「只记录不拦截」(试运行期用)。

存储配额

--max-storage-gb 限制该用户全部 run 目录(工作目录 + checkpoint + 日志)的合计占用。 计量口径是 runs/<用户>/;缓存(权重 / 数据集 / 语料)属于平台共享,不归到个人 —— 一个作业拉下来的权重,后面每个作业都在用。 两者管的是不同的事:配额是「谁占得太多」,水位线是「盘要满了」。

时段窗口

按卡型限制每日可运行时段(管理 → 平台设置 → 时段): 窗口重开后被暂停的作业自动续训。