from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
import torch
BASE = "unsloth/Qwen3.5-4B"
ADAPTER = "thbhybhybyhb/lab21-2A202601454-qwen35-triage-vi"
tok = AutoTokenizer.from_pretrained(BASE, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(BASE, dtype=torch.float16,
device_map="auto", trust_remote_code=True)
model = PeftModel.from_pretrained(model, ADAPTER)
msgs = [
{"role": "system", "content": "Phân loại ticket sau."},
{"role": "user", "content": "Alo shop, mình đặt balo laptop mã đơn VN411453. "
"Cho tôi trả lại. Đã 3 ngày rồi. Cho tôi hỏi."},
]
text = tok.apply_chat_template(msgs, tokenize=False, add_generation_prompt=True)
out = model.generate(**tok(text, return_tensors="pt").to(model.device),
max_new_tokens=160, do_sample=False)
print(tok.decode(out[0], skip_special_tokens=True))