模型开发
「模型开发」面向算法工程师,提供训练任务、微调任务和评测任务三条流水线,覆盖从分布式训练到模型效果评估的完整闭环。
入口路径:左侧菜单 AI 智算开发 > 模型开发,页面路由
/admin/ai/deployer/model。

训练任务
训练任务基于 Volcano 调度,支持 PyTorch / TensorFlow / MPI / DeepSpeed 等分布式框架。
创建训练任务
- 进入 AI 智算开发 > 模型开发 > 训练任务,点击「创建训练任务」。
- 基础信息
- 工作空间/项目:默认带入当前租户和项目。
- 任务名称:2-50 个字符,便于识别。
- 训练框架:PyTorch / TensorFlow / MPI / DeepSpeed。
- 队列:选择 Volcano 训练队列;不同队列权重和可回收策略不同。
- 优先级:高/中/低,影响调度顺序。
- TensorBoard:平台会自动为训练任务挂载 TensorBoard 日志存储。
- 任务规格
- 选择架构与 GPU 类型。
- 在规格列表中选择 CPU、内存、GPU 卡数/算力/显存配置。
- 任务镜像
- 基础镜像:平台预置的训练镜像。
- 自定义镜像:租户保存的镜像。
- 外部镜像地址:填写完整镜像地址及仓库密码。
- 存储配置
- 挂载公共存储(如预训练模型仓库)。
- 挂载自定义存储(如代码、数据、输出目录)。
- 任务配置
- Master/Worker 副本数:按框架显示不同名称(如 PyTorch 为 master/worker)。
- 最小可用实例数:调度时至少满足的实例数,低于此值任务不会开始运行。
- 启动命令/启动参数:每行一条命令或一个参数。
- 注解、环境变量。
- 高级配置(选填)
- 超时时间:任务运行最大小时数。
- 自动重试:失败后的最大重试次数。
- workingDir、启动用户、共享内存。
- 点击「创建」,返回列表查看任务状态。

查看训练进度

- 列表页展示状态、运行时长、框架、优先级。
- 进入详情页:
- 基本信息:查看规格、镜像、存储、启动命令。
- 运行日志:实时刷新容器标准输出。
- 事件:查看调度、拉镜像、挂载存储等事件。
- 训练进度:部分框架支持进度条展示。
- TensorBoard:点击图标打开可视化页面,查看 loss/learning rate 曲线。
常见操作
| 操作 | 说明 |
|---|---|
| 重新提交 | 用相同配置再跑一次,常用于修改代码或参数后快速复用。 |
| 开启/关闭 | 关闭任务会释放资源,保留配置;开启后重新调度。 |
| 释放 | 彻底删除任务并回收资源;误删可到回收站恢复。 |
| 下载日志 | 在详情页日志页签复制或下载完整日志。 |

微调任务
微调任务基于 LLaMA-Factory,支持 LoRA / Full / QLoRA 等多种微调方法,以及 SFT / DPO / KTO / RM / PPO 等训练阶段。
创建微调任务
- 进入 AI 智算开发 > 模型开发 > 微调任务,点击「创建微调任务」。
- 基础信息
- 工作空间/项目、任务名称。
- 训练阶段:SFT / DPO / KTO / RM / PPO。
- 微调方法:LoRA / Full / QLoRA;PPO/RM 阶段仅支持 LoRA/QLoRA。
- 数据集
- 选择已创建的训练数据集和版本。
- 如开启自动评测,选择评测数据集。
- 模型
- 基础模型路径:填写模型在存储中的绝对路径(如
/models/qwen2-7b),或 HuggingFace/ModelScope 仓库 ID。 - 如果填写本地绝对路径,必须先在「存储配置」中挂载覆盖该路径的存储。
- 基础模型路径:填写模型在存储中的绝对路径(如
- 算力规格与镜像
- 选择 GPU 规格;平台会根据显卡厂商自动过滤可用镜像。
- 选择或填写微调镜像。
- 存储配置
- 挂载公共/自定义存储,覆盖模型路径、数据集路径和输出目录。
- 输出目录:必须在已挂载的可写自定义存储路径下,用于保存 LoRA 适配器或全量模型。
- 训练参数
- 选择预设模板(快速 / 标准 / 质量)或手动配置:
- epochs、learning rate、batch size、gradient accumulation steps
- cutoff len、val size、lora rank、lora alpha
- 高级用户可在
yamlOverride中覆盖任意 LLaMA-Factory 参数。
- 选择预设模板(快速 / 标准 / 质量)或手动配置:
- 点击「创建」,任务开始运行。

微调任务后续操作

- 导出模型:微调完成后,可将 LoRA 适配器与基础模型合并,导出为可部署的完整模型。
- 对比推理:导出后发起临时推理服务,对比微调前后效果。
- 自动评测:训练完成后自动触发评测任务,查看评测报告。
评测任务
评测任务用于评估模型在标准数据集上的效果,支持 Auto-Eval(LLaMA-Factory 内置指标)和 LLM-as-Judge(裁判模型打分)两种模式。
创建评测任务
- 进入 AI 智算开发 > 模型开发 > 评测任务,点击「创建评测任务」。
- 关联微调任务:选择一个已有的微调任务,系统会自动带入模型路径与数据集;也可独立创建。
- 评测模式
- Auto-Eval:使用 LLaMA-Factory 内置指标(如 perplexity、bleu、rouge)。
- LLM-as-Judge:选择裁判模型和评分模板,对生成结果进行打分。
- 数据集与模型:选择评测数据集版本,确认模型路径。
- 算力规格:选择 GPU 规格;部分轻量评测可用 CPU。
- 点击「创建」,等待任务完成后查看评测报告。


常见问题
Q:训练任务状态 Pending 很久? A:查看详情页「事件」,常见原因是队列资源不足、镜像拉取慢、或最小可用实例数设置过高。
Q:微调任务提示「模型路径未挂载」? A:基础模型路径若是本地绝对路径,必须在「存储配置」中挂载包含该路径的存储;例如 /models/qwen2-7b 需要挂载 /models。
Q:评测任务失败但日志看不出原因? A:检查裁判模型是否可达、评测数据集格式是否符合要求(如 ShareGPT 格式),以及输出目录是否有写入权限。