from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base_id = "Qwen/Qwen3.5-0.8B"
tok = AutoTokenizer.from_pretrained(base_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(base_id, trust_remote_code=True,
dtype="auto", device_map="auto")
model = PeftModel.from_pretrained(model, "anybody12345678/lab21-qwen35-triage-vi")
msgs = [
{"role": "system", "content": "Phân loại ticket sau."},
{"role": "user", "content": "Shop ơi, mình đặt bàn phím cơ mã đơn DH123456. "
"Giao hàng chậm. Đã 3 ngày rồi. Nhờ shop kiểm tra."},
]
text = tok.apply_chat_template(msgs, tokenize=False, add_generation_prompt=True,
enable_thinking=False)
out = model.generate(**tok(text, return_tensors="pt").to(model.device),
max_new_tokens=160, do_sample=False)
print(tok.decode(out[0][len(tok(text)["input_ids"]):], skip_special_tokens=True))