Skip to content

阅读指南

这份文档按使用路径组织:先跑通 Weaver,再深入 API,最后接入 NexRL 和 NexAU 做 Agentic 模型训练。

文档结构

快速开始

适合第一次接触 Weaver 的读者:

  • 什么是 Weaver?:理解 Weaver 解决的问题、核心抽象和适用场景。
  • 核心概念:理解组织、项目、训练会话、训练运行和检查点之间的关系。
  • 安装与配置:安装 Python SDK,配置 API 密钥,运行第一个训练示例。

Weaver API

适合编写训练脚本或接入现有训练框架:

  • 训练与采样:训练会话元信息、同步/异步 client、指标、训练循环、采样和 logprobs。
  • 损失函数:交叉熵、importance sampling、PPO/GRPO 相关 loss,以及自定义 loss 路径。
  • 保存与加载:sampler 权重导出、持久检查点、optimizer 状态恢复和 TTL。
  • 支持的模型:运行时模型发现、训练模式、上下文限制、价格和性能档位。

控制台与访问控制

适合多人协作、项目配置和成本管理:

Agentic 模型训练

适合训练会使用工具、执行多步任务或自我改进的模型:

  • 微调模型:使用 NexRL 编排 rollout、轨迹池、reward 和 Weaver 模型训练。
  • 构建与微调 Agent:使用 NexAU 定义 Agent,并把 Agent 轨迹接入 NexRL/Weaver。

推荐阅读路径

如果你只想先跑通最小示例,按这个顺序读:

  1. 安装与配置
  2. 核心概念
  3. 训练与采样
  4. 保存与加载

如果你要做 RL 或 Agent 训练,按这个顺序读:

  1. 损失函数
  2. 微调模型
  3. 构建与微调 Agent

如果你要接入生产实验管理,优先关注:

  • 检查点的保存策略和 TTL。
  • sampler 权重导出的默认 1 小时生命周期。
  • performance_tier 对训练吞吐和成本的影响。
  • wait=False 返回的异步 OperationHandle

Weaver 中文文档