产品介绍
产品定位
Rise 智算平台面向企业级 AI 算力场景,帮助算法团队、运维团队与平台运营团队高效管理异构 GPU 算力、模型服务、数据资产与成本。
AI 算力需求持续增长,企业普遍面临 GPU 资源利用率低(直通模式整卡独占)、弹性不足、多厂商硬件生态碎片化、无法统一调度管理等痛点。Rise 智算平台通过「软件定义 GPU 算力」的理念实现算力资源池化,提供跨厂商、中立化的异构算力统一管理与动态交付能力。
Rise 智算平台默认包含四个产品模块,本文档的功能介绍涵盖全部模块能力:
| 模块 | 定位 |
|---|---|
| Rise VAST | 算力池化底座:异构 GPU 显卡的切分与超分、异构算力资源监控,统一纳管国内外主流 GPU/NPU 计算卡 |
| Rise CAMP | 算力管理平台(Console):基于池化算力的资源调度与管理界面,本文档介绍的用户界面与管理后台两套控制台由它承载 |
| Rise ModelX | 模型管理:模型市场与模型广场,支持自定义上架/下架、一键部署(vLLM/SGLang/MindIE 等引擎)、调用量与 Token 多维统计 |
| Rise Router | 大模型 API 网关:统一接入不同厂商、不同框架的模型服务,对外提供统一 API,支持智能路由、服务降级、灰度发布、限流配额与多租户鉴权 |

我能用 Rise 智算平台做什么
| 角色 | 典型场景 |
|---|---|
| 算法工程师 | 申请 GPU 算力、运行 Jupyter/VS Code 开发环境、提交分布式训练与微调任务、部署推理服务。 |
| 数据工程师 | 创建数据集、执行数据清洗与增强、准备训练语料。 |
| AI 应用开发者 | 在模型广场发现模型、一键部署、在线体验、调用推理 API。 |
| 项目/租户管理员 | 管理团队与项目、配置配额与资源池、查看资源与任务运行状态。 |
| 平台运维 | 纳管 K8s 集群、配置告警规则与值班、监控 GPU/节点/任务状态。 |
| 平台运营/财务 | 分析租户资源成本、Token 调用成本、API 渠道成本,制定计费策略。 |

两套控制台界面
Rise 智算平台按使用角色拆分为两套入口,登录后看到的顶部导航和左侧菜单会有所不同:
| 入口 | 地址 | 主要使用者 | 核心能力 |
|---|---|---|---|
| 智算开发平台 | /camp/login | 算法工程师、数据工程师、AI 应用开发者 | 我的工作台、算力服务、模型开发、数据管理、AI 资产、大模型服务在线体验 |
| 管理后台 | /camp/admin/login | 项目/租户管理员、平台运维、平台运营/财务 | AI 智算管理(工作空间/项目/成员/资源/策略)、计量计费、告警中心、平台与集群管理、K8s 集群管理 |
同一套账号体系可以分别登录两个入口;具体能看到的菜单由账号所属角色与权限决定。普通用户登录智算开发平台后通常只能管理自己的任务与服务;管理员登录管理后台后可查看并管理多个工作空间、项目与集群资源。
产品优势
- 中立化 GPU 资源管理:跨厂商异构 GPU 算力资源池化管理,支持资源调度、网络拓扑感知调度、多集群调度、在离线混部,大幅提高算力利用率。
- 灵活的算力管理策略:支持 NVIDIA、昇腾、昆仑芯、天数、沐曦、燧原等卡的拓扑感知调度;优先级系统保障关键任务;分布式调度器支撑大规模批量化训练与推理。
- 多集群多租户体系:工作空间/项目维度的算力配额灵活分配;同一资源池可由不同节点上的特定卡组成异构资源池;多集群统一管理,管控与计算分离。
- GPU 资源超分能力(NVIDIA/昇腾/昆仑芯):算力超分与显存超分(虚拟显存)在提升资源利用率的同时保障任务稳定性与整体吞吐。
- 增强的安全与隔离:用户数据与计算任务安全隔离,RBAC 多级权限、全量操作审计、API Key 调用管控。
- 高可用架构:故障自愈、组件多副本部署、滚动升级零停机。
- 全面的性能监控:GPU 算力/显存分配率与使用率、温度、功率等指标的实时采集与趋势展示。
- 多维度精确计量计费:资源类(CPU/内存/GPU)、物理设备类(节点/显卡)、模型类(平台/租户/用户调用、Token)三大计费维度,支持账单明细与报表导出。
- 模型统一管理:商业与开源模型统一上架/下架、一键部署、Token 计量计费,覆盖模型开发、训练微调、服务部署到运营的完整生命周期。
- MCP 智能分析:内置 AI 助手,以问答形式查询平台信息、分析日志,并具备图表可视化能力。
产品功能
平台涵盖从硬件到应用的全流程管理:底层支持 NVIDIA、昇腾、海光、寒武纪等异构算力,通过 GPU 池化管理提升资源利用率;上层提供算力调度、任务编排、模型管理等能力,支撑各领域的 AI 应用;并通过算力监控、计量计费实现高效运维和智能运营。

异构资源池化
- 基础资源纳管:通过 License 授权模式统一纳管 NVIDIA、昇腾、海光、寒武纪、天数智芯等计算卡;纳管后可按虚拟化切分、超分、整卡直通等多种形态交付。未纳管的 GPU 资源也可接入平台查看基础使用情况。
- 资源池化管理:抽象各厂商 GPU 虚拟化技术,在统一管理界面完成算力资源的池化与分配;资源池支持按节点、按卡两个维度灵活划分。
- 资源限额管理:租户管理(面向 AI 开发团队)与资源池管理(面向 GPU 运维)双层模式,将一类或多类计算卡划分为逻辑资源组,为不同部门/团队约束算力与显存使用范围。
任务调度管理
- 算力规格管理:自定义标准化算力规格(GPU 卡型号、共享/独占模式、vCPU 架构与数量、vGPU 算力/显存),用户在创建推理和训练任务时直接选用。
- AI 开发管理:容器实例、分布式训练、推理服务三类任务的全生命周期管理,覆盖创建(算力分配、启动参数、镜像/存储配置)、启动、挂起、恢复、关机与资源释放。
- 智能调度:三层协同机制打通多元算力全生命周期——资源抽象层对接各厂商 Device Plugin,将 GPU/DCU/NPU 等异构设备统一抽象为标准算力单元;智能调度层提供拓扑感知(NVLink、多芯互联亲和性)与分级抢占(Volcano 优先级队列,保障推理 SLA、闲时释放给训练);动态适配层通过弹性资源配额按硬件类型调整超卖比例。调度算法支持先来先服务、最短作业优先、高优先级优先,并支持节点级/显卡级的分散或紧凑调度。
资源集成管理
- 镜像库管理:接入 Harbor 等镜像仓库,管理操作系统、容器、PyTorch/TensorFlow 等常用基础镜像及版本,支持仓库地址、凭据、权限、启用/禁用管理。
- 存储服务管理:接入 NFS、JuiceFS、Local 等存储引擎,管理容量、访问模式、静态/动态供给,以及数据存储的挂载路径、权限与启用状态。
- 资源容量观测:面向集群、资源池、节点的容量观测,覆盖物理 GPU 与 vGPU 设备,报表化展示任务分配/使用状态。
模型管理
- 模型体验与模型广场:支持自定义模型上架/下架;模型卡片按名称、推理引擎、任务场景、上下文长度、提供方、芯片厂商等多维度筛选;从模型卡片一键部署并在线问答体验。
- 模型部署:支持 vLLM、SGLang、MindIE 等推理引擎;模型与规格、引擎联动校验,自动屏蔽不可用组合;支持部署模板与自定义引擎启动参数;推理服务支持按负载动态扩缩容与定时扩缩容;可指定特定用户访问特定模型。
- 模型网关(Rise Router):将不同厂商、不同框架的模型服务统一接入,对外提供统一 API,屏蔽底层模型差异;按请求内容、用户、业务标签智能路由;支持服务降级(故障时切换到降级模型)、A/B 测试与灰度发布;按用户、按模型的 QPS 限流与并发配额控制;多租户独立访问凭证隔离。
- API Key 管理:密钥的创建、分发、更新、禁用与审计;完整调用日志(调用时间、调用方、请求参数、耗时、状态码)与按时间范围筛选;支持全局关闭 API Key 调用方式与匿名访问开关。
多租户体系
- 租户与项目管理:租户创建与资源概览(CPU/内存/共享/独享 GPU 配额的分配与使用);项目维度协作,任务创建时绑定项目;成员批量添加与角色分配。
- 租户配额:CPU、内存总量配置;GPU 共享/独享模式、卡类型(厂商及型号)、超配比,以及 vGPU 总数与算力/显存配额。
- 资源回收:按显存利用率、算力利用率、持续时间等维度,对实例、训练任务、推理服务执行自动回收。
- 灵活算力区:同一资源池可由不同节点上的特定卡组成异构资源池;任务按业务需求、适配卡型、价格选择对应算力区;支持按集群/租户设置差异化定价并统一结算。
运维与运营
- 统一观测:从 GPU 设备层到 K8s 任务层的全链路透视——设备层真实负载采集(SM 算力时间片占比、显存占用、板间通信流量)、任务-GPU 绑定拓扑下钻、平台级健康全景(利用率水位、碎片率、故障卡分布)、阈值告警与故障卡自动隔离、告警分级通知与处置闭环。
- 资源监控告警:集群、资源池、节点、vGPU 设备健康状态与 AI 任务运行状态监控;NVIDIA/昇腾详细故障码分级告警(严重/高/中/低),精细化掌控显卡状态。
- 计量计费:资源类(CPU/内存/GPU,分钟级计量)、物理设备类(节点/显卡)、模型类(平台/租户/用户调用与 Token)多维计费策略;实时账单明细、历史汇总、成本趋势与占比分析、报表导出。
安全管理
- RBAC 多级权限体系与全量操作审计。
- MFA 多因素认证与高危操作二次验证(登录、数据删除、权限变更等关键操作),保障企业核心资产与操作合规。
适用场景
推理场景
| 行业 | 典型应用 |
|---|---|
| 金融 | 银行交易风险实时分析(结合历史行为模式识别洗钱/欺诈);证券量化投资预测(毫秒级分析海量舆情与行情数据)。 |
| 制造 | 产线零部件外观检测(批量高清图片并行推理,高准确率识别划痕、锈斑);设备预测性维护(7×24 小时分析振动、温度传感器数据,提前预判故障)。 |
| 能源 | 风电场机组声纹/转速实时分析,毫秒级异常保护;地质勘探中几十 TB 反射波数据的并行处理与 3D 地质结构重构。 |
| 医疗 | CT 影像快速重建与多维数据分析;抗癌药物研发中的蛋白质折叠大规模并行计算;心电图等高优先级任务的算力抢占保障。 |
| 自动驾驶 | 车辆、行人、道路传感器数据的实时融合推理,毫秒级响应。 |
| 通信 | 「中训边推」四级架构:总部统一资源统筹与模型市场、省中心模型调试与训练、边缘轻量化模型低延迟推理、设备端海量异构设备管理,形成「数据本地化—模型区域化训练—边缘实时推理—设备端执行」全链路闭环。 |
训练场景
企业专有大模型训练:训练期间通常需要调用几百到几千张 GPU 卡执行大规模分布式训练。未使用平台前,算力分配和调用策略依赖手工或脚本,效率低、出错率高;使用 Rise 智算平台后,可实现千卡级 GPU 资源下分布式任务的自动化分配与调度,通过调度策略和队列优先级设定,大幅减少任务部署与资源调度工作量,获得标准化、自动化的算力资源管理能力。
详细技术架构与组件清单见 产品架构,运行环境要求见 运行环境,核心概念释义见 基本概念。
