from transformers import AutoModelForCausalLM, AutoTokenizerfrom peft import PeftModelimport torch base_model = "unsloth/Qwen2.5-3B-Instruct"adapter = "AmareshHebbar/discharge-qa-qwen25-3b" tokenizer = AutoTokenizer.from_pretrained(base_model)model = AutoModelForCausalLM.from_pretrained( base_model, torch_dtype=torch.bfloat16, device_map="auto",)model = PeftModel.from_pretrained(model, adapter) messages = [ {"role": "system", "content": "You are a clinical QA assistant. Answer the question based on the discharge summary provided. Be specific and cite relevant details."}, {"role": "user", "content": "DISCHARGE SUMMARY: [72M, CHF admission, discharged on furosemide 80mg, carvedilol 12.5mg BD, sacubitril/valsartan]\n\nQUESTION: What medications was the patient discharged on?"},]inputs = tokenizer.apply_chat_template(messages, return_tensors="pt", add_generation_prompt=True).to(model.device)outputs = model.generate(inputs, max_new_tokens=128, temperature=0.1, do_sample=True)print(tokenizer.decode(outputs[0][inputs.shape[1]:], skip_special_tokens=True))