平台初始化
Rise 智算平台部署完成后,管理员需要完成一系列基础配置,租户/用户才能正常登录并创建容器实例、提交训练任务、部署推理服务等。本文按依赖顺序列出必经步骤与推荐步骤。
适用对象:平台管理员、租户管理员、运维工程师
入口:https://<camp-domain>/camp/admin/login
1. 登录管理后台并确认集群状态
1.1 登录管理后台

- 使用默认平台管理员账号登录
https://<camp-domain>/camp/admin/login。 - 首次登录后建议立即修改初始密码。
- 确认顶部导航栏当前集群是否正确;如为多集群环境,后续可在顶部切换。
「平台管理」入口:平台管理不在顶部导航栏,点击页面右上角的 齿轮图标 即可进入「平台管理」视图(含平台与成员、平台配置等菜单)。
1.2 纳管 Kubernetes 集群

- 进入 平台管理 > 平台与成员。
- 点击「新增集群」,填写集群名称、KubeConfig、API Server 地址等信息。
- 保存后,进入 K8s 集群管理 > 资源总览,确认集群状态为「正常」,节点、GPU、Pod 信息已同步。
如果部署时已经自动纳管了默认集群,此步骤可跳过,但仍需确认集群状态。

1.3 多集群认证同步(仅多集群场景)
单集群部署可忽略本节。
当平台纳管多个 K8s 集群时,各成员(member)集群中的平台组件需要与主(host)集群使用相同的 JWT 密钥,否则用户在 member 集群上的操作会因鉴权失败而报错。同步步骤:
- 在 host 集群 上查看 JWT 密钥:bash
kubectl get secrets -n rise-vast-system camp-jwt-secret -oyaml - 在各 member 集群 上编辑同名 Secret,将密钥内容改为与 host 集群一致:bash
kubectl edit secrets -n rise-vast-system camp-jwt-secret - 重启 member 集群中的平台组件,使新密钥生效:bash
kubectl rollout restart deploy -n rise-vast-system \ auc nova console-ui vgpu novanotebook-controller-manager - 在管理后台顶部切换集群,验证 member 集群上的资源与操作正常。
2. 申请 License 许可
Rise 智算平台通常需要 License 才能解锁完整功能。部署完成后,请联系厂商或运营人员申请 License。

2.1 获取授权信息
进入 集群管理 > 算力配置 > 许可证,页面列出平台中各算力卡的 显卡 UUID(点击列头旁的复制图标可一键复制全部)。将显卡 UUID 列表连同以下信息一并提交给厂商申请许可:
- 集群 UID:执行以下命令获取:bash
kubectl get namespace kube-system -o jsonpath='{.metadata.uid}' - 节点信息:部署 Rise 智算平台所使用的服务器/集群主机名或标识。
2.2 导入 License
- 获得 License 后,在 集群管理 > 算力配置 > 许可证 页面点击「导入」。
- 将许可内容粘贴到对话框,点击「确定」。
- 确认列表中各显卡的授权状态变为「已授权」,并关注页面顶部统计(总数、已到期、30 天内到期、最早到期时间),核对授权显卡数量与过期时间是否满足需求。
若 License 过期或授权不足,平台可能会限制新资源创建或核心功能使用(显卡无法参与调度、新任务排队失败),请提前规划续期。
3. 配置平台级参数

- 进入 平台管理 > 平台配置 > 全局参数(平台管理入口见 1.1 节右上角齿轮)。
- 在参数列表的行操作中点击「修改」,在抽屉中调整配置项的值:

- 根据企业环境配置:
- 平台名称、Logo、Favicon:修改
TITLE、LOGO、FAVICON。 - 主题开关:
CUSTOM_THEME_ENABLED控制是否显示主题设置入口;开启后,用户可在顶部导航栏点击主题图标,切换浅色/深色/跟随系统外观,并自定义主色调。 - 用户注册/登录策略:是否开放注册、密码复杂度、登录失败锁定策略。
- 资源回收默认策略、配额超限策略、告警通知全局开关。
- 平台名称、Logo、Favicon:修改
- 如需对接企业身份源,在 第三方登录 或 OAuth 应用 中配置 SSO。
3.1 网络与访问地址参数(部署后必查)
以下三个参数决定平台生成的各类访问地址是否正确,部署后若未按实际环境修改,会导致容器实例 WebSSH、在线 IDE、SFTP 等入口打不开。均在 平台管理 > 平台配置 > 全局参数 中修改:
| 参数 | 含义 | 配置说明 |
|---|---|---|
GATEWAY_ADDR | 网关地址 | 平台对外提供服务的网关 IP/域名与端口,容器实例、推理服务等生成的访问地址基于此参数拼接。 |
IDE_DOMAIN | 在线 IDE 域名 | Jupyter / VS Code 等在线开发工具的访问域名,一般改为平台页面的访问地址(ip:port 或域名)。 |
SFTP_SERVE | SFTP 服务地址 | 数据上传使用的 SFTP Server 真实 IP,用户侧「SFTP 配置」显示的连接地址来源于此。 |
修改后建议在用户侧创建一个测试容器实例,实际打开 WebSSH / Jupyter 验证地址可达。
主题切换实际操作:全局参数中的
CUSTOM_THEME_ENABLED只是「是否允许用户切换主题」的总开关。开关开启后,最终用户通过顶部导航栏右侧的主题/外观图标进行切换,配置保存在浏览器本地。
4. 创建平台用户
平台用户分为两类:
- 平台级用户:可登录管理后台,进行平台管理、租户管理、运维等工作。
- 普通用户:登录智算开发平台,创建容器实例、训练任务、推理服务等;需要被加入具体工作空间/项目才有操作权限。
4.1 创建平台管理员/租户管理员

- 进入 平台管理 > 平台与成员 > 平台用户。
- 点击「新增」。
- 填写:
- 用户名:登录账号,建议使用邮箱前缀或工号。
- 真实姓名、邮箱、手机号码:用于通知、找回密码、二次验证。
- 组织架构:选择所属部门(可多选)。
- 平台角色:可多选,如「超级管理员」「平台管理员」等;普通用户选择普通平台角色即可。
- 点击「确定」保存。
- 在用户列表的行操作中点击「修改密码」,为用户设置初始密码并分发(首次登录后建议修改)。
4.2 创建普通用户

普通用户可以通过以下两种方式进入系统:
方式一:平台管理员预创建(推荐)
- 进入 平台管理 > 平台与成员 > 平台用户,点击「新增」,按 4.1 的表单填写,平台角色选择普通角色。
- 创建后在列表行操作中管理账号:「修改」(调整姓名/部门/角色)、「修改密码」、「启用/禁用」(对应入职/离职状态)、「删除」。
- 加入租户与项目:进入 AI 智算管理 > 工作空间与项目 > 成员管理,点击「添加用户」,将用户绑定到工作空间或项目,并分配角色:
- 工作空间级:工作空间管理员 / 工作空间成员;
- 项目级:项目管理员 / 项目成员。 普通用户一般分配「工作空间成员」或「项目成员」;需要其管理租户时分配对应管理员角色(工作空间管理员会自动继承其下所有项目的管理员权限)。
方式二:开放注册或 SSO 同步
- 在 平台管理 > 平台配置 > 全局参数 中开启用户注册(如适用)。
- 或在 第三方登录 中配置钉钉/飞书/LDAP 等 SSO,用户首次通过 SSO 登录时自动同步到平台。
普通用户创建后,默认没有所属工作空间,必须完成第 7 章「规划租户」中的成员绑定,才能使用算力服务。
5. 配置 AI 资产管理
AI 资产是后续所有算力服务、训练/推理任务的基础依赖,建议优先配置。
5.1 存储服务

- 进入 AI 智算管理 > AI 资产管理 > 存储服务,添加/启用存储后端(NFS、JuiceFS 等)。
- 进入 AI 智算管理 > AI 资产管理 > 存储,创建具体存储实例,设置访问权限(公共/工作空间)与挂载路径,供后续工作空间挂载。

集群底层的 StorageClass 可在 集群管理 > 存储 > 存储类 中核对。
5.2 镜像源与镜像服务

- 进入 AI 智算管理 > AI 资产管理 > 镜像源,添加镜像仓库地址与拉取凭证。

- 进入 AI 智算管理 > AI 资产管理 > 镜像服务,同步或上传公共镜像(如 PyTorch、Jupyter、vLLM 等)。进入镜像详情可通过「修改标签」配置镜像的任务场景、支持厂商与开发工具(VS Code/Jupyter/SSH 等),决定用户创建实例/任务时可选的能力。
5.3 算力规格

算力规格是用户创建容器实例、训练任务、推理服务时可选择的「套餐」,建议部署后按实际硬件提前规划一套命名规范并创建好常用规格。
- 进入 AI 智算管理 > AI 资产管理 > 规格,点击「创建规格」。
- 推荐命名规范(示例):
cpu-4c-16g-amd64:纯 CPU 规格,4 核 16 GiB 内存,x86 架构。npu-1-910b4-1:ARM 架构独享 1 张 910B NPU。gpu-1-a100:x86 架构独享 1 张 A100 GPU。vgpu-1-16g-910b4-1/vnpu-1-16g-910b4-1:共享算力卡,表示 1 张卡的 1/4(16 GiB 显存)。
- 切分规则参考:
- 共享算力卡:按 1/8、1/4、1/2 卡切分(需 GPU 虚拟化支持)。
- 独享算力卡:按 1、2、4、8 整卡划分。
- CPU / 内存:按实际服务器硬件配置调整,一般为每张算力卡搭配固定比例的 CPU 与内存。
- 保存后,用户侧创建资源时即可在下拉列表中选择对应规格。
5.4 凭证与密钥

- 进入 AI 智算管理 > AI 资产管理 > 凭证与密钥。
- 添加镜像仓库凭证、Git 凭证、对象存储 AK/SK 等公共资源。
5.5 SFTP 配置(可选)

用户若需要通过 SFTP 客户端(FileZilla、WinSCP 等)向平台存储上传数据文件,需要先初始化 SFTP 密码:
- 点击管理后台或用户界面右上角 个人中心 > 账号安全 > SFTP 配置。
- 点击「初始化密码」,系统生成 SFTP 登录密码。
- 关联需要上传数据的存储(如
models)后,即可使用 SFTP 客户端连接上传。
SFTP 服务地址由全局参数
SFTP_SERVE决定(见 3.1 节),请确保该参数已配置为 SFTP Server 的真实 IP,否则用户拿到的连接地址不可达。
6. 配置 GPU 与资源池
GPU 与资源池是平台最核心的算力底座,直接决定租户能否申请到 GPU、训练任务能否被调度。整体流程:节点配置(集群管理)→ 分配显卡给租户 → 租户资源池添加显卡(工作空间详情)→ 用户按规格使用。
6.1 确认 GPU 调度策略

- 进入 集群管理 > 算力配置 > 调度策略。
- 确认 GPU 调度器已安装并启用,检查默认调度策略(全局共享大资源池或按子资源池独立调度)。
- 检查节点上 GPU 设备是否被正确识别:
- 在 集群管理 > 资源总览 > 节点管理 中查看节点及其显卡列表。
- 在 集群管理 > 资源总览 > GPU 中查看显卡数量、显存、状态。
- 如果使用 GPU 虚拟化/超分,确认相关 Device Plugin 和 Scheduler Extender 已部署。
6.2 节点配置与分配显卡

- 进入 集群管理 > 资源总览 > 节点管理。
- 选中目标节点,点击「节点配置」(多节点可勾选后使用「批量配置」),设置场景(如训练/微调、推理)、厂商(如 Ascend、NVIDIA)与设备插件,平台据此识别并纳管该节点上的算力卡。
- 节点配置完成后,勾选节点并点击工具栏「分配卡」,在抽屉中选择目标租户(工作空间)与厂商,确认后该节点上的算力卡即分配给对应租户。

- 分配出去的显卡会先进入该租户工作空间详情中的「未分配资源池」(见 6.3)。
6.3 租户资源池:向资源池添加显卡

算力卡分配到租户后并不会立即可用,还需要在工作空间内将显卡加入具体的资源池:
- 进入 AI 智算管理 > 工作空间与项目 > 工作空间管理,打开目标工作空间的详情页。
- 切换到「资源池管理」页签,可看到四个资源池分区:未分配资源池、共享资源池、独享资源池、超分资源池。
- 新分配的显卡默认位于「未分配资源池」。
- 在 共享资源池 / 独享资源池 / 超分资源池 分区右上角点击「添加显卡」,从未分配显卡中勾选目标显卡加入该资源池:
- 独享资源池:整卡分配,用户按整卡规格使用。
- 共享资源池:按显存/算力切分(1/8、1/4、1/2 卡等),供多个任务共享。
- 超分资源池:配合超配比策略使用(见 6.4)。
只有显卡加入资源池后,该工作空间下的用户在创建容器实例、训练任务、推理服务时才能选到对应的 GPU 规格。
若「未分配资源池」始终为空,通常是节点侧尚未完成分配:先确认 集群管理 > 资源总览 > 节点管理 中节点已做「节点配置」,且 GPU 厂商列未显示「不支持分配」(部分调度场景与厂商组合不支持分配卡,需调整节点的调度场景),再执行「分配卡」。
显卡回收顺序(与分配相反,必须按序操作):
- 先释放该显卡上运行的所有资源(停止/删除使用中的容器实例、训练任务、推理服务)。
- 在工作空间详情「资源池管理」中将显卡从资源池移除,显卡回到「未分配资源池」。
- 回到 集群管理 > 资源总览 > 节点管理,通过「分配卡」将显卡从租户侧收回,完成回收。
6.4 配置 GPU 超分与虚拟卡(可选)

- 进入 集群管理 > 算力配置 > 超配比策略,设置显存超分倍数等。
- 进入 集群管理 > 算力配置 > 虚拟卡,配置显存切分粒度(如 1 GiB、2 GiB、4 GiB)与算力比例限制。
- 保存后,在工作空间的「超分资源池」中添加显卡,用户创建资源时即可选择小于整卡的 vGPU 规格。
6.5 集群侧资源池视图

进入 集群管理 > 算力配置 > 资源池,可从集群视角查看所有资源池的类型(共享/整卡/预留/超分)、vGPU 配额、算力与显存的分配率/使用率,以及池内 GPU 设备明细,用于运维核对。
建议按 GPU 卡类型(A100、H800、4090 等)或业务用途(训练、推理、开发)规划资源池,便于后续配额与计费。
7. 规划租户:工作空间、项目、资源池、配额
7.1 创建工作空间

- 进入 AI 智算管理 > 工作空间与项目 > 工作空间管理。
- 点击「创建工作空间」,填写名称、负责人、描述。
- 在工作空间详情中,挂载第 5 步创建的存储服务;显卡资源通过第 6 章「节点分配显卡 → 资源池管理添加显卡」的方式注入。
7.2 创建项目

- 进入 AI 智算管理 > 工作空间与项目 > 项目管理。
- 为每个业务团队创建独立项目(映射到 K8s Namespace)。
- 项目会自动继承工作空间的资源池,也可单独调整。
7.3 设置配额

配额分两个层面设置:
- 工作空间配额:进入 AI 智算管理 > 工作空间与项目 > 工作空间管理,打开工作空间详情页的「配额管理」页签,调整 CPU、内存配额,以及共享/独享 GPU 的配额。
- 集群/资源池级配额(可选):进入 集群管理 > 算力配置 > 配额管理,按集群或资源池维度限制 namespace 资源使用。
7.4 添加成员

- 进入 AI 智算管理 > 工作空间与项目 > 成员管理。
- 点击「添加用户」,将用户加入工作空间/项目,分配工作空间管理员/工作空间成员、项目管理员/项目成员等角色。
8. 配置调度与回收策略

- 进入 AI 智算管理 > 策略管理 > 训练调度策略。
- 配置队列、优先级、抢占策略,避免任务长期排队或资源饿死。
- 进入 AI 智算管理 > 策略管理 > 资源回收策略。
- 设置闲置容器实例、已完成任务的自动回收时间。
- 进入 AI 智算管理 > 策略管理 > 优先级策略(可选)。
- 为不同项目或任务类型设置调度权重。
9. 配置大模型服务(可选)

如果租户需要使用模型广场、在线体验或模型 API,管理员还需完成:
- 进入 AI 智算管理 > 模型管理,发布模型到模型广场并创建部署模板。
- 进入 AI 智算管理 > AI 网关 > 渠道管理,接入外部模型渠道或内部推理服务。
- 进入 AI 智算管理 > AI 网关 > AI 路由,配置模型路由、限流、降级策略。
- 进入 AI 智算管理 > AI 网关 > API Key 管理,创建平台级或租户级 API Key。
10. 配置告警与值班(推荐)

- 进入 告警中心 > 规则管理,创建平台/集群级告警规则(GPU 故障、节点离线、配额不足等)。
- 进入 告警中心 > 告警管理 > 消息模板,配置通知内容。
- 进入 告警中心 > 告警管理 > 订阅策略,指定告警接收人与渠道(邮件、短信、钉钉、飞书)。
- 进入 告警中心 > 告警管理 > 降噪配置,配置告警收敛,避免告警风暴。
- 进入 告警中心 > 值班管理,创建值班小组与排班计划。
11. 配置计量计费(可选)
如需成本分摊与账单,管理员可配置计量计费。平台计费分为三类策略:
11.1 租户资源计费(按实际使用计费)

- 进入 计量计费 > 工作空间资源总览 > 资源计费策略。
- 部署后默认只有 CPU / 内存 的计费规则;算力卡(GPU/NPU)的计费规则需要手动创建:
- 独享算力卡与共享(vGPU/vNPU)分别建规则。
- 共享算力一般按 1 GiB 显存每小时 的单价计费,平台按实际占用时长与显存折算费用。
- 租户资源计费按「实际使用」计费:只有用户真正创建并运行了资源,才产生费用。
11.2 物理资源计费(分配即计费)

- 进入 计量计费 > 物理资源总览 > 资源计费策略。
- 物理资源计费面向底层机器/节点维度,采用「分配即计费」模式:资源一旦被分配(划出给租户/资源池),即开始计费,与用户是否实际使用无关。
- 计费维度包括 CPU、内存、显存、算力卡等,用于核算底层硬件成本。
11.3 模型计量(Token 计费)

- 进入 计量计费 > Token 治理 > 模型计费策略。
- 按 千 Token 分别设置输入、输出单价:
- 平台内置了全局默认策略,可直接修改单价。
- 也可按「模型 + 租户」粒度新建策略,实现不同租户/不同模型差异化定价。
- 如需核算上游成本,在 计量计费 > API 渠道 > 渠道成本策略 配置渠道采购成本。
费用明细与账单查看方式参见 费用说明。
12. 验证租户用户可用性

完成以上配置后,建议按以下步骤验证:
- 使用普通用户账号登录
https://<camp-domain>/camp/login。 - 确认用户能看到正确的工作空间与项目。
- 进入 AI 智算开发 > 算力服务 > 容器实例,创建一个测试容器实例,确认能运行并访问 Jupyter/VS Code。
- 进入 AI 智算开发 > 模型开发 > 训练任务,提交一个测试训练任务,确认能正常调度运行。
- 进入 AI 智算开发 > 算力服务 > 推理服务,部署一个测试推理服务,确认能获取调用地址。
初始化清单速查
| 步骤 | 关键操作 | 验证标准 |
|---|---|---|
| 1 | 纳管 K8s 集群(多集群需同步 JWT 密钥) | 集群状态正常,节点/GPU 可见 |
| 2 | 申请并导入 License | 许可证状态「已授权」,授权满足需求 |
| 3 | 配置全局参数(含 GATEWAY_ADDR/IDE_DOMAIN/SFTP_SERVE) | 实例 WebSSH、在线 IDE、SFTP 地址可达 |
| 4 | 创建平台用户并加入租户/项目 | 管理员、租户管理员、普通用户可登录 |
| 5 | 配置 AI 资产(存储、镜像、规格、凭证、SFTP) | 存储可挂载,规格可选,镜像可拉取 |
| 6 | 节点配置 → 分配显卡 → 资源池添加显卡 | 租户在工作空间能看到并使用 GPU 规格 |
| 7 | 创建工作空间/项目/配额/成员 | 普通用户归属到项目并有配额 |
| 8 | 配置调度与回收策略 | 训练任务能调度,闲置资源能回收 |
| 9 | 配置大模型服务 | 模型广场/在线体验/API 可用 |
| 10 | 配置告警与值班 | 告警能触发并通知到接收人 |
| 11 | 配置计量计费(租户资源/物理资源/模型 Token) | 费用与用量可统计 |
| 12 | 用户验证 | 容器实例、训练任务、推理服务均正常 |