Skip to content

算力服务

「算力服务」是开发者日常使用最多的模块,提供三类工作负载:

  • 容器实例:带 GPU 的交互式开发环境(Jupyter / VS Code / SSH)。
  • 推理服务:将模型部署为在线 API 服务(vLLM / SGLang / MindIE 等引擎)。
  • 自定义服务:将任意容器镜像发布为长稳 HTTP 服务。

入口路径:左侧菜单 AI 智算开发 > 算力服务,页面路由 /admin/ai/deployer/compute

算力服务列表页,包含容器实例/推理服务/自定义服务三个 Tab

容器实例

容器实例适合调试代码、运行 Notebook、保存环境镜像。一个实例对应一个 Kubernetes Pod,关机不释放资源,释放才会回收。

创建容器实例

  1. 进入 AI 智算开发 > 算力服务 > 容器实例,点击「创建容器实例」。
  2. 基础信息
    • 工作空间/项目:默认带入当前租户和项目;无权限的项目不会显示。
    • 实例名称:2-50 个字符,支持中文、字母、数字、中划线和下划线。
  3. 算力规格
    • 选择架构(x86 / ARM)。
    • 选择 GPU 类型:共享 GPU、独享 GPU 或超分 GPU。
    • 在规格列表中选择一行,确认 CPU、内存、GPU 卡数/算力百分比/显存。
  4. 实例镜像
    • 基础镜像:平台预置的 Jupyter / PyTorch / TensorFlow 等镜像。
    • 自定义镜像:租户或项目自己保存/上传的镜像。
    • 外部镜像地址:填写 docker pull 后的镜像地址;如有仓库密码,填写用户名/密码。
  5. 存储配置
    • 公共存储:平台管理员配置的只读或读写存储,可多选。
    • 自定义存储:租户数据存储,用于存放代码、数据、模型文件。
  6. 高级配置(选填)
    • 开发工具:勾选 Jupyter / VS Code / SSH,实例运行后列表会显示对应入口。
    • 注解/环境变量:按 key-value 添加,会注入到容器。
    • Web 服务配置:暴露额外 HTTP 端口。
    • 启动命令/启动参数:覆盖镜像默认启动行为。
    • 密钥:选择已创建的镜像仓库密钥或 SSH 密钥。
    • 自动关机/自动释放:按时间点或运行 N 小时后自动执行。
    • 共享内存:多卡通信场景建议开启。
  7. 底部选择创建数量(1-10 个),点击「创建」。

创建容器实例表单,标注基础信息/规格/镜像/存储/高级配置

使用容器实例

容器实例详情与开发工具入口

实例状态变为 运行中 后:

  • 点击列表行内的 Jupyter / VS Code / Web 终端 图标进入开发环境。
  • 点击「SSH 信息」查看登录地址与端口,用于本地 IDE 远程连接。
  • 在实例内修改环境后,点击「保存镜像」可将当前容器保存为新的自定义镜像。

常见操作

操作说明
开机/关机关机保留磁盘,停止计费;开机恢复环境。
释放彻底删除实例并回收资源;误删可先到回收站恢复。
克隆用已有实例的配置快速创建新实例。
编辑仅部分字段(如存储、开发工具)支持编辑后更新。
TensorBoard多选运行中实例,一键对比指标。

容器实例列表行操作按钮

推理服务

推理服务用于将模型部署为可被 Playground 或外部系统调用的 API。平台默认以 StatefulSet 部署,支持单机与多机(LWS)两种模式。

创建推理服务

  1. 进入 AI 智算开发 > 算力服务 > 推理服务,点击「创建推理服务」。
  2. 基础信息
    • 工作空间/项目:默认带入,可在管理员视角切换。
    • 模型来源:选择「模型广场」或「自定义模型」。
    • 模型:从下拉中选择要部署的模型。
    • 服务别名:用于在列表和调用示例中识别该服务。
    • 部署方式:
      • 单机:单 Pod 单卡/多卡,适合大多数模型。
      • 多机(LWS):多个节点组成 Leader-Worker Set,适合大参数模型分布式推理。
    • 部署模板:选择预置的 vLLM / SGLang / MindIE 模板,模板会决定默认启动参数。
    • 实例数量:服务运行副本数。
    • 滚动更新:升级/回滚时允许的最大不可用百分比。
  3. 算力规格:同容器实例,选择 GPU 规格。
  4. 实例镜像:基础/自定义/外部镜像,系统会根据部署模板自动推荐推理引擎标签。
  5. 存储配置:挂载公共/自定义存储,用于加载模型文件或输出日志。
  6. 部署参数(选填)
    • 注解、标签、环境变量、启动命令、启动参数。
    • 健康检查:就绪/存活/启动探针。
    • workingDir、hostNetwork、hostIPC、启动用户、共享内存。
  7. 点击「创建」,等待服务状态变为 运行中

创建推理服务表单,重点标注模型选择、部署方式、部署模板、实例数量

调用推理服务

推理服务详情与 API 调用

服务运行后:

  1. 在列表点击服务名称进入详情。
  2. 详情页顶部会显示 API 调用地址API Key
  3. 复制 curl 示例,或在 大模型服务 > 在线体验 中选择该模型进行对话测试。

服务运维

操作说明
启动/停止停止后不再计费,释放 GPU;保留配置便于下次启动。
升级/回滚修改配置或切换模型版本后重新部署;支持按版本回退。
扩缩容手动调整副本数;也支持 HPA 按 GPU/显存/QPS 自动扩缩。
克隆基于当前服务配置快速创建新服务。
OpenWebUI一键将服务绑定到 OpenWebUI 聊天界面。

推理服务详情页 API 调用示例

自定义服务

自定义服务适合部署任意 HTTP 长稳应用(如模型网关、业务 API、可视化工具)。底层是 Kubernetes Deployment + Ingress。

创建自定义服务

  1. 进入 AI 智算开发 > 算力服务 > 自定义服务,点击「创建自定义服务」。
  2. 基础信息:工作空间/项目、服务名称、副本数、滚动更新百分比。
  3. HTTP 服务:添加端口与路径映射,平台会自动生成 Ingress 访问地址。
  4. 算力规格:如服务无需 GPU,可选择纯 CPU 规格。
  5. 实例镜像:选择或填写镜像地址。
  6. 存储配置:挂载需要的存储卷。
  7. 部署参数:环境变量、启动命令、启动参数、工作目录、启动用户等。
  8. 高级配置:健康检查、共享内存、定时扩缩容(CronScale)、自动扩缩容(HPA)。
  9. 点击「创建」。

自定义服务创建表单

访问自定义服务

服务运行后,在列表查看暴露的 访问地址,或在详情页「HTTP 服务」页签复制 URL。

自定义服务详情页:概览、HTTP 服务地址与运行信息

常见问题

Q:实例一直 Pending 怎么办? A:进入详情页查看「事件」或「调度事件」,常见原因是资源池配额不足、镜像拉取失败或节点 GPU 不足。

Q:推理服务状态 Running 但调用返回 503? A:检查服务详情中的健康检查配置与启动参数,确认模型文件路径已正确挂载到存储。

Q:自定义服务如何绑定域名? A:在 HTTP 服务配置中填写路径与端口后,平台会自动生成集群域名;如需自定义域名,请联系平台管理员配置 Ingress。

基于 Rise 智算平台 release-2606.v2.2.x 生成