Skip to main content
训练结束后,用产物起一个 vLLM OpenAI 兼容服务,浏览器里聊天。两个服务可以并排 A/B。只支持 localkuberay

启动服务

推理服务占用真实 GPU 配额。服务有闲置 TTL(默认由服务端配置),到期自动停止释放卡——这是防止「起了忘了关」把卡占死的保护,不是故障。需要长时间使用就 extend

聊天与 A/B 对比

  • 聊天:流式输出、可调 temperature / max tokens、system prompt;
  • A/B 对比:同一输入并排发给两个服务(如 SFT 产物 vs GRPO 产物),直观感受对齐差异;
  • 服务是 OpenAI 兼容端点,也可以从代码直连(端点与 token 见 sf serve ls)。

执行后端语义

权限

Playground 属于可配置的进阶功能:管理员可按角色 / 用户开放。未开放时页面显示引导卡片而不是报错。