阅读指南
这份文档按使用路径组织:先跑通 Weaver,再深入 API,最后接入 NexRL 和 NexAU 做 Agentic 模型训练。
文档结构
快速开始
适合第一次接触 Weaver 的读者:
- 什么是 Weaver?:理解 Weaver 解决的问题、核心抽象和适用场景。
- 安装与配置:安装 Python SDK,配置 API key,运行第一个训练示例。
Weaver API
适合编写训练脚本或接入现有训练框架:
- 训练与采样:
ServiceClient、TrainingClient、Datum、训练循环、采样和 logprobs。 - 损失函数:交叉熵、importance sampling、PPO/GRPO 相关 loss,以及自定义 loss 路径。
- 保存与加载:sampler 权重导出、持久 checkpoint、optimizer 状态恢复和 TTL。
- 模型列表:支持模型、训练模式、长上下文命名和选型建议。
控制台与访问控制
适用于租户配置、权限管理和成本管理:
- 组织、团队与项目:资源归属、共享与归档语义。
- 用量、计费与额度:North Ledger 计量、余额、申请与对账。
- 角色与权限:组织角色与 Weaver 系统角色的区别。
- 邀请与 OAuth:邮箱邀请与小北已验证身份的匹配规则。
- SDK 范围选择:用 ID、slug 或名称发现和选择组织、项目。
Agentic 模型训练
适合训练会使用工具、执行多步任务或自我改进的模型:
- 微调模型:使用 NexRL 编排 rollout、轨迹池、reward 和 Weaver 训练后端。
- 构建与微调 Agent:使用 NexAU 定义 Agent,并把 Agent 轨迹接入 NexRL/Weaver。
推荐阅读路径
如果你只想先跑通最小示例,按这个顺序读:
如果你要做 RL 或 Agent 训练,按这个顺序读:
如果你要接入生产实验管理,优先关注:
- checkpoint 的保存策略和 TTL。
- sampler 权重导出的默认 1 小时生命周期。
performance_tier对训练吞吐和成本的影响。wait=False返回的异步OperationHandle。