Skip to content

支持的模型

Weaver 支持的模型由部署配置决定。请在运行时查询 Console 或 SDK,不要依赖静态模型名单。

查找可用模型

Console 的 支持的模型 页面展示当前组织可以使用的模型,包括可用状态、上下文信息,以及训练、输入、缓存输入和输出 token 的价格。

Weaver Console 中支持的模型

开始训练前,可以复制模型名称并比较不同类型 token 的价格。

SDK 使用相同的可见性和可用性规则:

python
from weaver import ServiceClient

with ServiceClient(organization="research") as client:
    models = client.list_supported_models()
    config = client.get_supported_model_config(models[0]) if models else None

list_supported_models() 返回当前可用的模型名称;get_supported_model_config() 返回选择该模型所需的信息。

注意

请使用“支持的模型”页面或 SDK 返回的完整名称。不同组织和环境中可用的模型可能不同。

训练模式

LoRA

LoRA 是默认模式,通常最适合快速实验和频繁更新:

python
training_client = service_client.create_model(
    base_model="<model-from-catalog>",
    training_mode="lora",
    lora_config=types.LoraConfig(
        rank=32,
        train_attn=True,
        train_mlp=True,
        train_unembed=True,
    ),
)

Full Fine-Tuning

当 LoRA 容量不足,且所选模型支持全参数训练时使用:

python
training_client = service_client.create_model(
    base_model="<model-from-catalog>",
    training_mode="full_ft",
)

上下文长度

上下文长度属于模型标识。一些部署使用 :<max_seq_len> 后缀表示长上下文变体,另一些会直接写在基座模型名称中。不要自行拼接后缀,应复制页面或 SDK 返回的完整值。

当训练或采样请求的有效 token 长度超过模型配置的 max_seq_len 时,Weaver 会拒绝请求。设置采样上限时还要为生成 token 预留空间。

性能档位

performance_tier 独立于模型名称,用于选择吞吐和价格档位:

python
training_client = service_client.create_model(
    base_model="<model-from-catalog>",
    performance_tier="fast",
)

常见值为 normalfastflash,具体可用性取决于模型和部署。更高档位通常以更高成本提供更高吞吐。

选型建议

  • 验证数据和 loss mask 时,先选择 featured、available 的较小模型和默认 LoRA。
  • 采样占比较高时,先检查四类 token 价格;output 与 prefill 分别计费。
  • 只有实验确实需要时,再选择 full fine-tuning、长上下文或更高性能档位。

下一步

Weaver 中文文档