from transformers import AutoProcessor, AutoModelForImageTextToText
model = AutoModelForImageTextToText.from_pretrained(
"GParlatto/spoky-qwen-merged-v2",
dtype="auto",
device_map="auto",
)
processor = AutoProcessor.from_pretrained("GParlatto/spoky-qwen-merged-v2")
messages = [{"role": "user", "content": "Hola, quien eres?"}]
inputs = processor.apply_chat_template(
messages, tokenize=True, add_generation_prompt=True,
return_dict=True, return_tensors="pt",
).to(model.device)
out = model.generate(**inputs, max_new_tokens=200)
print(processor.batch_decode(out[:, inputs["input_ids"].shape[-1]:],
skip_special_tokens=True)[0])