模型列表
Weaver 支持多种 open-weight 基座模型,并允许服务端按模型、训练模式和性能档位自动选择训练资源。
TIP
可用模型会随服务端配置更新。运行时可以用 service_client.list_supported_models() 查询当前健康可用的模型列表。
查询可用模型
python
from weaver import ServiceClient
with ServiceClient() as service_client:
models = service_client.list_supported_models()
print(models)查询某个模型的服务端配置:
python
config = service_client.get_supported_model_config("Qwen/Qwen3-8B")
print(config)常见模型
Nex-AGI 优化模型
这些模型面向推理、指令跟随、工具使用和 Agent 工作流做过优化,适合 agentic training 起步。
| Model ID | 参数规模 | 类型 | 上下文长度 |
|---|---|---|---|
nex-agi/Qwen3-30B-A3B-Nex-N1 | 30B, 约 3B active | MoE | 128K |
nex-agi/Qwen3-32B-Nex-N1 | 32B | Dense | 128K |
nex-agi/DeepSeek-V3.1-Nex-N1 | 671B, 约 37B active | MoE | 128K |
Qwen 系列
| Model ID | 参数规模 | 类型 | 上下文长度 |
|---|---|---|---|
Qwen/Qwen3-8B | 8B | Dense | 128K |
Qwen/Qwen3-32B | 32B | Dense | 128K |
Qwen/Qwen3-30B-A3B | 30B, 约 3B active | MoE | 128K |
Qwen/Qwen3-235B-A22B | 235B, 约 22B active | MoE | 128K |
DeepSeek 系列
| Model ID | 参数规模 | 类型 | 上下文长度 |
|---|---|---|---|
deepseek-ai/DeepSeek-V3.1 | 671B, 约 37B active | MoE | 128K |
deepseek-ai/DeepSeek-V3.2 | 671B, 约 37B active | MoE | 128K |
训练模式
LoRA
默认训练模式,适合快速实验、低成本微调和 RL 循环中的频繁更新。
python
training_client = service_client.create_model(
base_model="Qwen/Qwen3-8B",
training_mode="lora",
lora_config=types.LoraConfig(
rank=32,
train_attn=True,
train_mlp=True,
train_unembed=True,
),
)Full Fine-Tuning
全参数微调适合需要更高容量、更深度行为迁移或 LoRA 不足以表达目标任务的场景。
python
training_client = service_client.create_model(
base_model="Qwen/Qwen3-8B",
training_mode="full_ft",
)长上下文模型
部分模型支持通过 base_model 后缀指定最大上下文长度:
python
training_client = service_client.create_model(
base_model="Qwen/Qwen3-8B:262144",
training_mode="full_ft",
)选择长上下文变体时,应确保数据长度、训练成本和吞吐预期都匹配。
性能档位
performance_tier 用于请求不同吞吐档位:
python
training_client = service_client.create_model(
base_model="Qwen/Qwen3-8B",
performance_tier="fast",
)常见值:
normal:默认或标准吞吐。fast:更高吞吐,通常成本也更高。flash:更高性能档位,具体可用性以服务端为准。
选型建议
第一次跑通 Weaver:选择 Qwen/Qwen3-8B,默认 LoRA,rank 32。
SFT 基线:从 8B 或 32B dense 模型开始,便于调试数据格式、mask 和 learning rate。
Agent 场景:优先评估 nex-agi/* 优化模型,尤其是需要工具调用、多步推理或长链路任务时。
高质量 RL:根据预算选择更大的 Qwen/DeepSeek MoE 模型,并通过 NexRL 管理 rollout 和策略更新。
长上下文任务:使用明确的上下文后缀,并在采样、reward 和训练 batch 中控制 token 数。