import torch
from peft import PeftModel
from transformers import AutoTokenizer, Qwen3_5ForCausalLM
adapter = "trentmkelly/deftwriting_distil_Qwen3.5_9B"
tokenizer = AutoTokenizer.from_pretrained(adapter)
base = Qwen3_5ForCausalLM.from_pretrained(
"Qwen/Qwen3.5-9B",
dtype=torch.bfloat16,
device_map="auto",
)
model = PeftModel.from_pretrained(base, adapter)
messages = [
{"role": "system", "content": "Rewrite this text.\n/no_think"},
{"role": "user", "content": "Text to rewrite."},
]
prompt = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True,
enable_thinking=False,
)
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
output = model.generate(**inputs, do_sample=False, max_new_tokens=1024)
print(tokenizer.decode(output[0, inputs.input_ids.shape[1]:], skip_special_tokens=True))