Skip to content

阅读指南

这份文档按使用路径组织:先跑通 Weaver,再深入 API,最后接入 NexRL 和 NexAU 做 Agentic 模型训练。

文档结构

快速开始

适合第一次接触 Weaver 的读者:

  • 什么是 Weaver?:理解 Weaver 解决的问题、核心抽象和适用场景。
  • 安装与配置:安装 Python SDK,配置 API key,运行第一个训练示例。

Weaver API

适合编写训练脚本或接入现有训练框架:

  • 训练与采样ServiceClientTrainingClientDatum、训练循环、采样和 logprobs。
  • 损失函数:交叉熵、importance sampling、PPO/GRPO 相关 loss,以及自定义 loss 路径。
  • 保存与加载:sampler 权重导出、持久 checkpoint、optimizer 状态恢复和 TTL。
  • 模型列表:支持模型、训练模式、长上下文命名和选型建议。

控制台与访问控制

适用于租户配置、权限管理和成本管理:

Agentic 模型训练

适合训练会使用工具、执行多步任务或自我改进的模型:

  • 微调模型:使用 NexRL 编排 rollout、轨迹池、reward 和 Weaver 训练后端。
  • 构建与微调 Agent:使用 NexAU 定义 Agent,并把 Agent 轨迹接入 NexRL/Weaver。

推荐阅读路径

如果你只想先跑通最小示例,按这个顺序读:

  1. 安装与配置
  2. 训练与采样
  3. 保存与加载

如果你要做 RL 或 Agent 训练,按这个顺序读:

  1. 损失函数
  2. 微调模型
  3. 构建与微调 Agent

如果你要接入生产实验管理,优先关注:

  • checkpoint 的保存策略和 TTL。
  • sampler 权重导出的默认 1 小时生命周期。
  • performance_tier 对训练吞吐和成本的影响。
  • wait=False 返回的异步 OperationHandle

Weaver API 中文文档