Skip to content

模型开发

「模型开发」面向算法工程师,提供训练任务、微调任务和评测任务三条流水线,覆盖从分布式训练到模型效果评估的完整闭环。

入口路径:左侧菜单 AI 智算开发 > 模型开发,页面路由 /admin/ai/deployer/model

模型开发模块菜单与训练任务列表

训练任务

训练任务基于 Volcano 调度,支持 PyTorch / TensorFlow / MPI / DeepSpeed 等分布式框架。

创建训练任务

  1. 进入 AI 智算开发 > 模型开发 > 训练任务,点击「创建训练任务」。
  2. 基础信息
    • 工作空间/项目:默认带入当前租户和项目。
    • 任务名称:2-50 个字符,便于识别。
    • 训练框架:PyTorch / TensorFlow / MPI / DeepSpeed。
    • 队列:选择 Volcano 训练队列;不同队列权重和可回收策略不同。
    • 优先级:高/中/低,影响调度顺序。
    • TensorBoard:平台会自动为训练任务挂载 TensorBoard 日志存储。
  3. 任务规格
    • 选择架构与 GPU 类型。
    • 在规格列表中选择 CPU、内存、GPU 卡数/算力/显存配置。
  4. 任务镜像
    • 基础镜像:平台预置的训练镜像。
    • 自定义镜像:租户保存的镜像。
    • 外部镜像地址:填写完整镜像地址及仓库密码。
  5. 存储配置
    • 挂载公共存储(如预训练模型仓库)。
    • 挂载自定义存储(如代码、数据、输出目录)。
  6. 任务配置
    • Master/Worker 副本数:按框架显示不同名称(如 PyTorch 为 master/worker)。
    • 最小可用实例数:调度时至少满足的实例数,低于此值任务不会开始运行。
    • 启动命令/启动参数:每行一条命令或一个参数。
    • 注解、环境变量。
  7. 高级配置(选填)
    • 超时时间:任务运行最大小时数。
    • 自动重试:失败后的最大重试次数。
    • workingDir、启动用户、共享内存。
  8. 点击「创建」,返回列表查看任务状态。

创建训练任务表单,标注框架、规格、任务配置

查看训练进度

训练任务详情页

  • 列表页展示状态、运行时长、框架、优先级。
  • 进入详情页:
    • 基本信息:查看规格、镜像、存储、启动命令。
    • 运行日志:实时刷新容器标准输出。
    • 事件:查看调度、拉镜像、挂载存储等事件。
    • 训练进度:部分框架支持进度条展示。
    • TensorBoard:点击图标打开可视化页面,查看 loss/learning rate 曲线。

常见操作

操作说明
重新提交用相同配置再跑一次,常用于修改代码或参数后快速复用。
开启/关闭关闭任务会释放资源,保留配置;开启后重新调度。
释放彻底删除任务并回收资源;误删可到回收站恢复。
下载日志在详情页日志页签复制或下载完整日志。

训练任务详情页 TensorBoard 入口

微调任务

微调任务基于 LLaMA-Factory,支持 LoRA / Full / QLoRA 等多种微调方法,以及 SFT / DPO / KTO / RM / PPO 等训练阶段。

创建微调任务

  1. 进入 AI 智算开发 > 模型开发 > 微调任务,点击「创建微调任务」。
  2. 基础信息
    • 工作空间/项目、任务名称。
    • 训练阶段:SFT / DPO / KTO / RM / PPO。
    • 微调方法:LoRA / Full / QLoRA;PPO/RM 阶段仅支持 LoRA/QLoRA。
  3. 数据集
    • 选择已创建的训练数据集和版本。
    • 如开启自动评测,选择评测数据集。
  4. 模型
    • 基础模型路径:填写模型在存储中的绝对路径(如 /models/qwen2-7b),或 HuggingFace/ModelScope 仓库 ID。
    • 如果填写本地绝对路径,必须先在「存储配置」中挂载覆盖该路径的存储。
  5. 算力规格与镜像
    • 选择 GPU 规格;平台会根据显卡厂商自动过滤可用镜像。
    • 选择或填写微调镜像。
  6. 存储配置
    • 挂载公共/自定义存储,覆盖模型路径、数据集路径和输出目录。
    • 输出目录:必须在已挂载的可写自定义存储路径下,用于保存 LoRA 适配器或全量模型。
  7. 训练参数
    • 选择预设模板(快速 / 标准 / 质量)或手动配置:
      • epochs、learning rate、batch size、gradient accumulation steps
      • cutoff len、val size、lora rank、lora alpha
    • 高级用户可在 yamlOverride 中覆盖任意 LLaMA-Factory 参数。
  8. 点击「创建」,任务开始运行。

微调任务创建表单,标注训练阶段、数据集、模型路径、训练参数

微调任务后续操作

微调任务详情页

  • 导出模型:微调完成后,可将 LoRA 适配器与基础模型合并,导出为可部署的完整模型。
  • 对比推理:导出后发起临时推理服务,对比微调前后效果。
  • 自动评测:训练完成后自动触发评测任务,查看评测报告。

评测任务

评测任务用于评估模型在标准数据集上的效果,支持 Auto-Eval(LLaMA-Factory 内置指标)和 LLM-as-Judge(裁判模型打分)两种模式。

创建评测任务

  1. 进入 AI 智算开发 > 模型开发 > 评测任务,点击「创建评测任务」。
  2. 关联微调任务:选择一个已有的微调任务,系统会自动带入模型路径与数据集;也可独立创建。
  3. 评测模式
    • Auto-Eval:使用 LLaMA-Factory 内置指标(如 perplexity、bleu、rouge)。
    • LLM-as-Judge:选择裁判模型和评分模板,对生成结果进行打分。
  4. 数据集与模型:选择评测数据集版本,确认模型路径。
  5. 算力规格:选择 GPU 规格;部分轻量评测可用 CPU。
  6. 点击「创建」,等待任务完成后查看评测报告。

评测任务创建表单

评测任务详情与报告

常见问题

Q:训练任务状态 Pending 很久? A:查看详情页「事件」,常见原因是队列资源不足、镜像拉取慢、或最小可用实例数设置过高。

Q:微调任务提示「模型路径未挂载」? A:基础模型路径若是本地绝对路径,必须在「存储配置」中挂载包含该路径的存储;例如 /models/qwen2-7b 需要挂载 /models

Q:评测任务失败但日志看不出原因? A:检查裁判模型是否可达、评测数据集格式是否符合要求(如 ShareGPT 格式),以及输出目录是否有写入权限。

基于 Rise 智算平台 release-2606.v2.2.x 生成