配额、随时间变化的 GPU-时,以及按项目的成本归因。
你会看到什么
时长是怎么算的
归因在作业结束时结算,运行中的作业按已经跑过的部分计入。 这就是为什么数字白天在动、晚上才稳定下来,也是为什么一个长 run 看起来是在增长, 而不是最后一次性落账。 计费的时钟从训练真正开始那一刻起算——也就是running 这个生命周期打点——
而不是执行器报告容器已启动的那一刻。两者之间是建虚拟环境和拉权重,
可能好几分钟,那不是训练。按它计费会系统性地多算,
而且恰好惩罚那些网络链路最慢的作业。
你可以做什么
- 在按项目和按用户之间切换归因口径。
- 改时间范围。
- 从某个项目跟进到它的项目页。
明明有空闲 GPU 却被拒
三种不同的限制因为三种不同的原因拒绝你,错误信息会说明是哪一种:
这三种都不是「集群满了」。集群满了会明说,而且调度器最终会为饿太久的作业
预留容量。