Skip to main content
路径是稳定的,请求体是推理引擎认的那一套,响应也原样返回。StarForge 负责认证、路由到该部署当前 推广中的 revision、并记录这次调用——它不改写请求内容。

基础地址

任何 OpenAI 兼容客户端指向这里即可直接工作:
/v1 下的一切都会被透传:chat/completionscompletionsembeddingsmodels, 以及推理引擎暴露的其他路径。流式输出可用。

认证

只有 deployment token 能打开这条路径。登录 token 不行,ingest token 也不行。
在控制台的部署页面创建和吊销 token。流量记录里每个 token 是分开标识的, 所以同一个部署内部也能分清哪一路调用方用了多少。
deployment token 是一个不过期的 bearer 凭据。请放进密钥管理系统,不要放进代码仓库; 并且每个调用方服务发一个,这样吊销其中一个不会波及其他。

由哪个模型作答

请求体里的 model 字段会传给推理引擎。除非引擎被配置成同时提供多个名字,否则填 default 真正作答的是该部署当前推广中的 revision——模型来源与服务配置的那一份快照。推广新的 revision 会改变 这个 URL 返回的内容,而 URL 本身不变;回滚同理。调用方不受影响,也不需要知道。

错误

其余错误来自推理引擎,措辞也是它的。

确认成功

能列出模型,说明 token 有效且有 revision 在服务。之后在控制台的部署页面可以看到请求量、延迟; 如果开了 Reflow,还能看到缓冲区正在被真实流量填满, 等着你挖掘成下一版的训练数据。

Playground 会话不是这个

Playground 会话是从某次 run 的产物启动的短命 vLLM 实例,给人聊天用,会自己过期。它没有稳定地址, 也没有 deployment token。要把应用接到模型上,你要的是部署;要判断某个 checkpoint 好不好, 你要的是 Playground。