Skip to main content

配额、随时间变化的 GPU-时,以及按项目的成本归因。

你会看到什么

时长是怎么算的

归因在作业结束时结算,运行中的作业按已经跑过的部分计入。 这就是为什么数字白天在动、晚上才稳定下来,也是为什么一个长 run 看起来是在增长, 而不是最后一次性落账。 计费的时钟从训练真正开始那一刻起算——也就是 running 这个生命周期打点—— 而不是执行器报告容器已启动的那一刻。两者之间是建虚拟环境和拉权重, 可能好几分钟,那不是训练。按它计费会系统性地多算, 而且恰好惩罚那些网络链路最慢的作业。

你可以做什么

  • 按项目按用户之间切换归因口径。
  • 改时间范围。
  • 从某个项目跟进到它的项目页

明明有空闲 GPU 却被拒

三种不同的限制因为三种不同的原因拒绝你,错误信息会说明是哪一种: 这三种都不是「集群满了」。集群满了会明说,而且调度器最终会为饿太久的作业 预留容量