import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base_id = "Qwen/Qwen3.5-2B"
lora_id = "MDK-YLC/Qwen3.5-2B-WMT26-Ukrainian-LoRA"
tokenizer = AutoTokenizer.from_pretrained(lora_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
base_id,
torch_dtype=torch.bfloat16,
device_map="auto",
trust_remote_code=True,
)
model = PeftModel.from_pretrained(model, lora_id)
model.eval()
messages = [
{"role": "system", "content": "You are a professional English-to-Ukrainian translator."},
{"role": "user", "content": "Hello, how are you?\n\nUkrainian:"},
]
prompt = tokenizer.apply_chat_template(
messages, tokenize=False, add_generation_prompt=True
)
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
with torch.no_grad():
out = model.generate(**inputs, max_new_tokens=128, do_sample=False)
print(tokenizer.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))