Training 训练
通过 Tinker 兼容 SDK 接口训练模型,再使用发布版 el CLI 查询作业与 Checkpoint。EnvPlatform 管理训练后端和资源。
选择工作流
| 目标 | 入口 |
|---|---|
| 监督微调(SFT) | SFT 快速开始 |
| 保存权重、恢复训练 | Checkpoint 与恢复 |
| 查询作业和估算费用 | 作业与费用 |
训练概念
- Train Job 使用独立
train_job_id记录训练状态与归属,与 Agent Job、Task、Trial 分开管理。 - Session 使用
session_id关联 SDK 操作与后端资源。Gateway 创建 Session 时也生成 Train Job 记录。 - Training client 持有可训练模型状态,用于梯度计算、优化器更新与 Checkpoint 操作。
- Policy 是管理员批准并绑定工作区与用户的配置,固定模型、资源、预算和截止时间。修改脚本的模型参数不会创建或覆盖 Policy。
- Checkpoint 保存训练状态或采样权重,其归属与用途决定可执行的操作。
SDK 脚本控制训练循环,应保持运行,等待操作和 finish 请求完成。关闭终端不代表训练成功。Agent rollout 或评测使用独立的 Agent 资源与 ID。
现有入口
| 入口 | 当前行为 |
|---|---|
发布版 envloop-cli 0.1.1 | el train job list/status、checkpoint list、billing usage |
| envloop 源码 0.1.0 | envloop.training 直接导出 Tinker 0.30.2;源码 CLI 提供 el train submit/status |
| Tinker 兼容 SDK | 通过 /tinker 创建 Session、模型,执行训练、Checkpoint 与可选采样操作 |
| 托管 Train Job API | /v1/train/jobs 的提交、结果与取消要求配置托管 TrainJobService;Gateway 记录可读不代表写接口已启用 |
envloop.Client 没有 client.train 属性。训练使用独立导入 from envloop import training,保留 Tinker 的方法、future 和异常语义。training.TrainingRun 是数据类型,不是生命周期管理器。不要认为发布版 CLI 包含源码 SDK 或提交命令。
验证范围
2026-10-11 核对 EnvPlatform 7fcf9ed8 和 envloop 39ecb502。已有 GPU smoke 记录完成 2×H200 actor-only LoRA 训练及 Checkpoint 校验,不代表完整数据集质量、计费准确性或双卡采样通过。本次文档修改没有重新运行 GPU 训练。