Skip to main content
需要 admin 角色。CLI 等价操作见 sf admin

用户与配额(/admin)

  • 用户列表:角色、状态、当前占用;
  • 新建本地账号、改角色(admin / operator)、停用 / 启用、删除;
  • 逐用户配额:并发 GPU、并发作业、每日 GPU-时、允许的 profile、排队优先级;
  • Rubrics 卡:LLM 裁判的判分规则模板(版本化 CRUD),供裁判服务引用。

并发配额与日额度是两件事

只有并发配额时,一个人用 8 卡连轴跑一整天与跑十分钟,在平台看来一样合规——而账单差 140 倍。日额度填 0 表示不限。 判定口径与用量页显示的「今日卡时」是同一个数(按平台时区的本地日积分,含在跑作业已跑的部分),所以一条「今日额度已用满」的排队理由,用户能在自己的用量页上对上。 两者都受 FORGE_QUOTA_ENFORCE 总开关约束;关闭时只展示不拦截。

出队顺序:先到先得,还是公平优先

priority-fifo(默认)按优先级降序 + 先到先得。单团队够用。 fair-share同优先级内让近期用得少的人排前面。管理员显式给的优先级仍然最大——公平不该覆盖决策。比的是相对占用(近期卡时 ÷ 配额卡数):配额 64 卡的人用了 100 卡时,与配额 8 卡的人用了 100 卡时,不是一回事。 什么时候换:共用一个集群的团队超过 3 个。在那之前,先到先得让人更容易预期;在那之后,一个人在额度内连提 20 个作业就会把队列占满,而那会立刻变成人际问题,并且被归咎于平台。

管理页用户表:角色、启用/停用、并发 GPU 与作业配额。

平台设置(/admin/settings)

卡型 series(算力权重、显存、Ray pin、Slurm constraint、总卡数)与 profile(形状 + 调优覆盖)注册表管理。改动热生效(各实例按刷新间隔拉取)。

审计(/admin/audit)

全部敏感操作的审计流水:谁在何时改了配额 / 角色 / 硬件注册表、停了谁的作业、发布或禁用了哪个插件。可按操作者 / 类型 / 时间过滤。

用量(/usage)

GPU-时统计:按用户 / 卡型 / 日聚合,日报自动生成。配额调整的依据就在这。

维护模式

管理页顶部的维护开关 = sf admin maintenance drain/resume:排空集群(作业暂停、保留 checkpoint)→ 升级 → 恢复(自动续训)。状态页显示「是否可安全重启集群」。