最佳实践
本节汇总 Rise 智算平台常见业务场景下的推荐配置与操作路径,帮助用户少走弯路。
端到端操作手册
以下三篇是从环境准备到上线使用的完整链路指南(源自管理员手册,适配 2.2 版本):
- 推理服务上线全流程:镜像上传 → 模型下载 → 部署模板 → 模型仓库 → 启动推理 → Web/API 访问 → 运维排错。
- 容器实例开发环境:开发镜像标签 → 创建实例 → Web 终端 / VS Code → 保存镜像 → 实例管理。
- 分布式训练任务:训练镜像/数据/调度策略/队列准备 → 创建任务(含 torchrun 参数示例)→ 观察训练 → 任务管理。
安全配置
- 二次验证安全配置:管理员开启短信/邮箱/MFA 三种二次验证方式,配置受保护接口,设置登录二次验证;用户绑定 MFA 认证器、使用验证码登录与操作验证。
场景一:为新团队开通算力
- 平台管理员 在
平台管理 > 平台与成员中创建/纳管集群。 - 在
AI 智算管理 > 工作空间与项目中新建工作空间,分配项目。 - 为工作空间配置 资源配额(Quota)与 资源池 绑定。
- 邀请成员加入工作空间/项目,并分配角色(如项目管理员、开发者)。
- 成员登录后即可在
AI 智算开发中创建实例与任务。
场景二:从模型广场一键部署推理服务
- 进入
大模型服务 > 模型广场,筛选需要的模型(按引擎、芯片、场景、价格)。 - 点击「一键部署」,选择目标项目、规格与实例数。
- 部署完成后,在
AI 智算开发 > 算力服务 > 推理服务中查看服务状态。 - 复制调用地址与 API Key,即可在 Playground 或本地代码中调用。
场景三:训练任务排错
- 任务提交后,在列表中观察状态;若长时间 Pending,查看详情页 事件/调度事件。
- 常见原因:
- 资源池配额不足 → 联系管理员扩容或调整 Quota。
- 镜像拉取失败 → 检查镜像地址、凭证与网络。
- 启动命令错误 → 查看 日志 页签修正启动命令。
- 任务运行后可开启 TensorBoard 监控训练曲线。
场景四:数据准备闭环
- 在
AI 智算开发 > 数据管理 > 数据集中创建数据集并上传文件。 - 如数据质量不佳,创建
数据清洗任务(基于 Data-Juicer)。 - 如需要扩充样本,创建
数据增强任务(LLM 生成式增强)。 - 清洗/增强完成后产生新的数据集版本,可直接在微调任务中引用。
场景五:API 渠道成本对账
- 平台管理员在
AI 智算管理 > AI 网关 > API 渠道中接入外部渠道。 - 在
计量计费 > API 渠道中查看渠道总览与调用记录。 - 对比上游账单与平台记录的
cost_microcents,定位差异。 - 如需调整采购价,在
渠道成本策略中维护 API 渠道级价格。
通用建议
- 命名规范:实例/任务/服务名称使用语义化命名,便于后续检索与成本归因。
- 定期清理:对不再使用的实例、服务与任务及时释放,避免资源浪费。
- 回收站兜底:误删资源后先在回收站中恢复;确认不需要后再彻底清除。
- 配额告警:在
告警中心中配置资源分配率/使用率告警,提前发现瓶颈。
