阅读指南
这份文档按使用路径组织:先跑通 Weaver,再深入 API,最后接入 NexRL 和 NexAU 做 Agentic 模型训练。
文档结构
快速开始
适合第一次接触 Weaver 的读者:
- 什么是 Weaver?:理解 Weaver 解决的问题、核心抽象和适用场景。
- 核心概念:理解组织、项目、训练会话、训练运行和检查点之间的关系。
- 安装与配置:安装 Python SDK,配置 API 密钥,运行第一个训练示例。
Weaver API
适合编写训练脚本或接入现有训练框架:
- 训练与采样:训练会话元信息、同步/异步 client、指标、训练循环、采样和 logprobs。
- 损失函数:交叉熵、importance sampling、PPO/GRPO 相关 loss,以及自定义 loss 路径。
- 保存与加载:sampler 权重导出、持久检查点、optimizer 状态恢复和 TTL。
- 支持的模型:运行时模型发现、训练模式、上下文限制、价格和性能档位。
控制台与访问控制
适合多人协作、项目配置和成本管理:
Agentic 模型训练
适合训练会使用工具、执行多步任务或自我改进的模型:
- 微调模型:使用 NexRL 编排 rollout、轨迹池、reward 和 Weaver 模型训练。
- 构建与微调 Agent:使用 NexAU 定义 Agent,并把 Agent 轨迹接入 NexRL/Weaver。
推荐阅读路径
如果你只想先跑通最小示例,按这个顺序读:
如果你要做 RL 或 Agent 训练,按这个顺序读:
如果你要接入生产实验管理,优先关注:
- 检查点的保存策略和 TTL。
- sampler 权重导出的默认 1 小时生命周期。
performance_tier对训练吞吐和成本的影响。wait=False返回的异步OperationHandle。