import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base_id = "Qwen/Qwen3.5-0.8B"
adapter_id = "RehmanKhalid/Qwen3.5-0.8B-CommonsenseQA-LoRA"
tokenizer = AutoTokenizer.from_pretrained(base_id)
model = AutoModelForCausalLM.from_pretrained(
base_id,
torch_dtype="auto",
device_map="auto",
)
model = PeftModel.from_pretrained(model, adapter_id)
model.eval()
messages = [
{
"role": "system",
"content": "You are a helpful assistant. Answer with only the letter (A, B, C, D, or E).",
},
{
"role": "user",
"content": (
"Question: A revolving door is convenient for two direction travel, "
"but it also serves as a security measure at a what?\n"
"A) bank\n"
"B) library\n"
"C) department store\n"
"D) mall\n"
"E) new york\n"
"Answer:"
),
},
]
prompt = tokenizer.apply_chat_template(
messages, tokenize=False, add_generation_prompt=True
)
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
with torch.no_grad():
outputs = model.generate(**inputs, max_new_tokens=4, do_sample=False)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))