本地校验、打包上传、服务端准入(catalog / 配额 / 预检)、排队、投放。下面是这条路上的开关。
资源:—profile
--profile 是唯一资源入口,语义见资源模型。
超参:—set
可重复;按方法声明本地校验类型与区间,拼错立即报错。只影响本次提交,不改实验文件。
模型与数据
模型与数据在 config 里声明(基底 + 模型片段),提交时通常不需要额外参数。
--model(HF id 或路径)与 --train-data / --validation-data 必填。引用平台数据集(<owner>/<name>[@version])时,作业启动自动拉到共享缓存并注入 <NAME>_DATA_DIR;--train-data 写数据集内相对路径。推荐写在 config 的 data.train.dataset,CLI 参数仅作临时覆盖。详见数据集。
项目名
控制台按 starforge.yaml 的 name 聚合本项目下的所有 run,提交时自动带上,不必再写 --project。
单次作业覆盖镜像
一等框架和 custom 都能用 --image;custom 必须显式给。解析顺序:--image → Console 框架默认 → runtime registry → catalog。tag 能用,生产建议 digest。仓库要在服务端 allowlist 里。
日志跟 stdout 走。控制台曲线要在训练里调 starforge.report。当前 catalog 的 custom 默认是外部观测,那种提交还要带 --observability-url。完整写法:自定义训练。Docker 和白名单:自定义镜像。
溯源与豁免
打包器有敏感文件黑名单(.env、*.pem、id_rsa* 等),命中会拒绝打包——密钥不应进入作业包,平台侧有专门的密钥注入通道。
训练后自动动作:—then
训练成功后自动执行导出 / 评测,详见流水线。
提交之后
服务端受理时可能拒绝的常见原因(都会给出明确报错):catalog 握手失败(锁过期)、配额不足(进队列等待不算失败)、镜像 registry 不在 allowlist、HF gated 模型未授权、批大小校验不过。排查见故障排查。