from peft import AutoPeftModelForCausalLM
from transformers import AutoTokenizer
model = AutoPeftModelForCausalLM.from_pretrained("nelsondiasandre/qwen25-1.5b-pt-qa-lora")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-1.5B-Instruct")
def perguntar(pergunta: str) -> str:
prompt = f"<|im_start|>user\n{pergunta}<|im_end|>\n<|im_start|>assistant\n"
inputs = tokenizer(prompt, return_tensors="pt")
outputs = model.generate(
**inputs,
max_new_tokens=100,
do_sample=True,
temperature=0.7,
repetition_penalty=1.3,
pad_token_id=tokenizer.eos_token_id,
)
resposta = tokenizer.decode(outputs[0], skip_special_tokens=False)
resposta = resposta.split("<|im_start|>assistant\n")[-1].split("<|im_end|>")[0].strip()
return resposta
print(perguntar("Qual e a capital de Portugal?"))