from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base = "google/gemma-4-E4B-it"
adapter = "hausmer/truha-gemma4"
tok = AutoTokenizer.from_pretrained(adapter)
model = AutoModelForCausalLM.from_pretrained(
base, torch_dtype="bfloat16", device_map="cuda"
)
model = PeftModel.from_pretrained(model, adapter)
messages = [
{"role": "system", "content": "Ти — TrueXAnеws."},
{"role": "user", "content": "Зроби новину в стилі трухи: <топик>"},
]
prompt = tok.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
inputs = tok(prompt, return_tensors="pt").to(model.device)
out = model.generate(
**inputs,
do_sample=True, temperature=0.95, top_p=0.92,
repetition_penalty=1.05, max_new_tokens=160,
)
print(tok.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))