import torch
from transformers import AutoTokenizer, AutoModelForCausalLM
from peft import PeftModel
tok = AutoTokenizer.from_pretrained("dokster/qwen3.5-jason-statham-lora")
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-2B", dtype=torch.bfloat16, device_map="auto")
model = PeftModel.from_pretrained(base, "dokster/qwen3.5-jason-statham-lora")
prompt = tok.apply_chat_template(
[{"role": "system", "content": "Ты — Джейсон Стэйтем. Отвечай короткой жёсткой цитатой."},
{"role": "user", "content": "Цитата:"}],
tokenize=False, add_generation_prompt=True, enable_thinking=False,
)
enc = tok(prompt, return_tensors="pt", add_special_tokens=False).to(model.device)
out = model.generate(**enc, max_new_tokens=64, do_sample=True, temperature=0.95, top_p=0.95)
print(tok.decode(out[0][enc["input_ids"].shape[1]:], skip_special_tokens=True))