Skip to content

推理服务上线全流程

本文以「从零把一个模型部署为可调用、可计费、可在线体验的推理服务」为目标,串联管理员与开发者的完整操作链路。单步功能的详细字段说明见 算力服务模型管理

角色分工:「准备工作」大多由管理员在管理后台完成;「启动与访问」由开发者在用户界面完成。

1. 准备工作(管理员)

1.1 上传推理引擎镜像

将推理引擎镜像(如 vLLM、SGLang、vllm-ascend)推送到平台可访问的镜像仓库:

bash
# 离线环境:导入镜像包
docker load -i vllm-ascend:v0.22.1rc1.tar.gz
# 互联网环境:直接拉取
docker pull m.daocloud.io/quay.io/ascend/vllm-ascend:v0.22.1rc1

# 改 tag 为内部镜像仓库地址(示例仓库 harbor.rise.io,按实际替换)
docker tag m.daocloud.io/quay.io/ascend/vllm-ascend:v0.22.1rc1 \
  harbor.rise.io/ascendhub/vllm-ascend:v0.22.1rc1

# 登录并推送
docker login harbor.rise.io
docker push harbor.rise.io/ascendhub/vllm-ascend:v0.22.1rc1

然后在 AI 智算管理 > AI 资产管理 > 镜像服务 中同步镜像,并在镜像详情中「修改标签」,在任务场景里勾选 推理服务——只有打了推理标签的镜像才能在创建推理服务时被选中。

镜像服务列表

镜像详情「修改标签」

1.2 下载模型文件到共享存储

bash
# 公网下载(以 ModelScope 为例),共享文件路径按实际替换
cd /data/share/models/
git lfs install
GIT_LFS_SKIP_SMUDGE=1 git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B.git
cd DeepSeek-R1-Distill-Qwen-1.5B/
git lfs pull

# 或从本地同步
rsync -ah --progress --stats /opt/Deepseek-R1-bf16-hfd-w8a8 /data/share/models/

也可以使用 SFTP 客户端(XFTP、WinSCP 等)上传到存储对应的 models 目录,SFTP 服务的初始化见 账号安全 > SFTP 配置

1.3 配置部署模板

进入 AI 智算管理 > 模型管理 > 部署模板,确认已有与推理引擎匹配的部署模板(模板决定默认启动参数与引擎标签)。没有则创建,注意先同步推理引擎镜像并配置引擎标签。

部署模板列表

1.4 配置模型信息

进入 AI 智算管理 > 模型管理 > 模型仓库,点击「创建模型」:填写模型名称、分类、上下文长度、模型文件在存储中的路径等。配置后模型才会出现在模型广场与推理服务的模型下拉中。

模型仓库列表

创建模型表单

2. 启动推理服务(开发者)

  1. 进入 AI 智算开发 > 算力服务 > 推理服务,点击「创建推理服务」。
  2. 模型来源选择「模型广场」,选择上一步配置的模型;部署模板会自动带出默认值。
  3. 选择算力规格与实例数量,挂载包含模型文件的存储。
  4. 启动命令与启动参数可按需自定义,其余保持默认。
  5. 点击「创建」,等待状态变为 运行中

创建推理服务表单

提示:使用内置工作空间(如 gen-studio)部署前,确认该工作空间已分配 GPU 配额,详见 平台初始化

3. 访问推理服务

3.1 Web 对话

  • 在线体验:进入 大模型服务 > 在线体验,页面会自动列出运行中的模型,左上角切换模型即可对话,详见 在线体验
  • OpenWebUI 聊天:部署时选择对接 OpenWebUI 的服务,可在 推理服务详情页右上角 点击「聊天」打开对话界面。

3.2 API 调用

  1. 个人中心 > 账号安全 > API 密钥 创建 API Key,并确认 Key 已被授予目标模型的调用权限(授权后台同步约需 1 分钟)。
  2. 在推理服务详情页复制调用示例(curl),选择 API Key 后直接粘贴到终端测试。
  3. 调用产生的 Token 计量与费用可在 我的调用与用量 中查看。

推理服务详情与 API 调用

4. 服务管理与排错

推理服务列表页支持快捷停止、启动、升级、扩缩容副本数、调整授权。详情页各页签用途:

页签用途
概览模型信息、镜像版本、规格、创建时的高级配置
容器组副本 Pod 列表:Pod IP、所在节点、显卡 ID、Web 终端、YAML、describe、单 Pod 重启
服务监控推理引擎指标:首 Token 时延、端到端耗时、Token 数
资源监控显存、算力、CPU、内存、网络
运行日志容器组标准输出日志
事件平台、控制器、Pod 事件
调度过程各节点调度评分与失败原因(Pending 排错首选)
版本记录升级历史,支持查看 YAML 与一键回滚

常见问题

  • 服务长时间 Pending:看「调度过程」与「事件」,多为配额不足或镜像拉取失败。
  • 状态运行中但调用 503:检查健康检查配置与模型文件挂载路径。
  • 在线体验里看不到模型:确认服务状态为运行中,且当前账号的 API Key 有该模型权限。

5. 管理员视角(可选)

管理员可在 AI 智算管理 > 算力服务 > 推理服务 查看全平台所有工作空间的推理服务,进行统一的启停与排错。

管理员侧推理服务列表

基于 Rise 智算平台 release-2606.v2.2.x 生成