跳到主要内容

Training 训练

通过 Tinker 兼容 SDK 接口训练模型,再使用发布版 el CLI 查询作业与 Checkpoint。EnvPlatform 管理训练后端和资源。

选择工作流​

目标入口
监督微调(SFT)SFT 快速开始
保存权重、恢复训练Checkpoint 与恢复
查询作业和估算费用作业与费用

训练概念​

  • Train Job 使用独立 train_job_id 记录训练状态与归属,与 Agent Job、Task、Trial 分开管理。
  • Session 使用 session_id 关联 SDK 操作与后端资源。Gateway 创建 Session 时也生成 Train Job 记录。
  • Training client 持有可训练模型状态,用于梯度计算、优化器更新与 Checkpoint 操作。
  • Policy 是管理员批准并绑定工作区与用户的配置,固定模型、资源、预算和截止时间。修改脚本的模型参数不会创建或覆盖 Policy。
  • Checkpoint 保存训练状态或采样权重,其归属与用途决定可执行的操作。

SDK 脚本控制训练循环,应保持运行,等待操作和 finish 请求完成。关闭终端不代表训练成功。Agent rollout 或评测使用独立的 Agent 资源与 ID。

现有入口​

入口当前行为
发布版 envloop-cli 0.1.1el train job list/status、checkpoint list、billing usage
envloop 源码 0.1.0envloop.training 直接导出 Tinker 0.30.2;源码 CLI 提供 el train submit/status
Tinker 兼容 SDK通过 /tinker 创建 Session、模型,执行训练、Checkpoint 与可选采样操作
托管 Train Job API/v1/train/jobs 的提交、结果与取消要求配置托管 TrainJobService;Gateway 记录可读不代表写接口已启用

envloop.Client 没有 client.train 属性。训练使用独立导入 from envloop import training,保留 Tinker 的方法、future 和异常语义。training.TrainingRun 是数据类型,不是生命周期管理器。不要认为发布版 CLI 包含源码 SDK 或提交命令。

验证范围​

2026-10-11 核对 EnvPlatform 7fcf9ed8 和 envloop 39ecb502。已有 GPU smoke 记录完成 2×H200 actor-only LoRA 训练及 Checkpoint 校验,不代表完整数据集质量、计费准确性或双卡采样通过。本次文档修改没有重新运行 GPU 训练。