模型信息
- 基座模型:
Qwen/Qwen3.5-9B。
- 参数规模:约 9.4B。
- 微调方法:4-bit NF4 QLoRA SFT;发布文件为合并后的 bf16 完整权重。
- 训练样本:99,450 条;验证样本:5,525 条;独立测试集:5,526 条。
- 训练结果:最终训练损失 0.464494;86 条分层独立抽检的字符级 F1 为 83.46%,
ROUGE-L F1 为 82.81%。
使用方式
下载完整模型
pip install -U huggingface_hub
hf download xidrug/qwen3.5-9b-kh-trade-logistics-merged-v1 \
--local-dir ./qwen3.5-9b-kh-trade-logistics-merged-v1
模型由四个 safetensors 分片组成,合计约 18.8 GB。下载目录必须保留全部权重分片、
权重索引、配置和 tokenizer 文件。本模型已合并 Adapter,不需要再加载 QLoRA 文件。
import torch
from transformers import AutoModelForImageTextToText, AutoTokenizer
model_id = "xidrug/qwen3.5-9b-kh-trade-logistics-merged-v1"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForImageTextToText.from_pretrained(
model_id,
torch_dtype=torch.bfloat16,
device_map="auto",
trust_remote_code=True,
)
vLLM 本地 API
安装较新版本的 vLLM 和 BitsAndBytes 后,单张 24GB 显卡可采用 4-bit 在线量化加载:
pip install -U vllm bitsandbytes
vllm serve xidrug/qwen3.5-9b-kh-trade-logistics-merged-v1 \
--served-model-name qwen3.5-9b \
--host 127.0.0.1 \
--port 8000 \
--dtype bfloat16 \
--quantization bitsandbytes \
--gpu-memory-utilization 0.90 \
--max-model-len 4096
--quantization bitsandbytes 会在加载时将 bf16 合并权重进行 4-bit 在线量化。完整的
本地部署说明和 YAML 配置位于项目 GitHub 仓库的 docs/MODEL_USAGE.md 与
configs/serve_vllm_merged.yaml。本地 API 服务地址为 http://127.0.0.1:8000/v1,
模型名称为 qwen3.5-9b。
适用范围与限制
模型适合作为 RAG 辅助的贸易物流问答流程组件。对于实时政策、税率、汇率、价格、
口岸状态、运输轨迹和时效等动态信息,应先检索最新业务知识库、权威公告或业务系统,
并保留人工复核。
JSON 提取专项在现有独立测试中的合法 JSON 比例为 0.00%,因此需要严格 JSON 输出时,
应增加结构化样本、输出校验或约束解码。
来源与许可
项目数据来源、构建过程和评测协议见项目 GitHub 仓库。模型按 Apache-2.0 发布;
使用者应同时遵守基座模型及其上游数据来源的相关要求。