Skip to content

最佳实践

本节汇总 Rise 智算平台常见业务场景下的推荐配置与操作路径,帮助用户少走弯路。

端到端操作手册

以下三篇是从环境准备到上线使用的完整链路指南(源自管理员手册,适配 2.2 版本):

  • 推理服务上线全流程:镜像上传 → 模型下载 → 部署模板 → 模型仓库 → 启动推理 → Web/API 访问 → 运维排错。
  • 容器实例开发环境:开发镜像标签 → 创建实例 → Web 终端 / VS Code → 保存镜像 → 实例管理。
  • 分布式训练任务:训练镜像/数据/调度策略/队列准备 → 创建任务(含 torchrun 参数示例)→ 观察训练 → 任务管理。

安全配置

  • 二次验证安全配置:管理员开启短信/邮箱/MFA 三种二次验证方式,配置受保护接口,设置登录二次验证;用户绑定 MFA 认证器、使用验证码登录与操作验证。

场景一:为新团队开通算力

  1. 平台管理员平台管理 > 平台与成员 中创建/纳管集群。
  2. AI 智算管理 > 工作空间与项目 中新建工作空间,分配项目。
  3. 为工作空间配置 资源配额(Quota)与 资源池 绑定。
  4. 邀请成员加入工作空间/项目,并分配角色(如项目管理员、开发者)。
  5. 成员登录后即可在 AI 智算开发 中创建实例与任务。

场景二:从模型广场一键部署推理服务

  1. 进入 大模型服务 > 模型广场,筛选需要的模型(按引擎、芯片、场景、价格)。
  2. 点击「一键部署」,选择目标项目、规格与实例数。
  3. 部署完成后,在 AI 智算开发 > 算力服务 > 推理服务 中查看服务状态。
  4. 复制调用地址与 API Key,即可在 Playground 或本地代码中调用。

场景三:训练任务排错

  1. 任务提交后,在列表中观察状态;若长时间 Pending,查看详情页 事件/调度事件
  2. 常见原因:
    • 资源池配额不足 → 联系管理员扩容或调整 Quota。
    • 镜像拉取失败 → 检查镜像地址、凭证与网络。
    • 启动命令错误 → 查看 日志 页签修正启动命令。
  3. 任务运行后可开启 TensorBoard 监控训练曲线。

场景四:数据准备闭环

  1. AI 智算开发 > 数据管理 > 数据集 中创建数据集并上传文件。
  2. 如数据质量不佳,创建 数据清洗 任务(基于 Data-Juicer)。
  3. 如需要扩充样本,创建 数据增强 任务(LLM 生成式增强)。
  4. 清洗/增强完成后产生新的数据集版本,可直接在微调任务中引用。

场景五:API 渠道成本对账

  1. 平台管理员在 AI 智算管理 > AI 网关 > API 渠道 中接入外部渠道。
  2. 计量计费 > API 渠道 中查看渠道总览与调用记录。
  3. 对比上游账单与平台记录的 cost_microcents,定位差异。
  4. 如需调整采购价,在 渠道成本策略 中维护 API 渠道级价格。

通用建议

  • 命名规范:实例/任务/服务名称使用语义化命名,便于后续检索与成本归因。
  • 定期清理:对不再使用的实例、服务与任务及时释放,避免资源浪费。
  • 回收站兜底:误删资源后先在回收站中恢复;确认不需要后再彻底清除。
  • 配额告警:在 告警中心 中配置资源分配率/使用率告警,提前发现瓶颈。

训练任务详情页事件/日志、模型广场一键部署弹窗

基于 Rise 智算平台 release-2606.v2.2.x 生成