from transformers import AutoModelForCausalLM, AutoTokenizerfrom peft import PeftModelimport torch base_model = "unsloth/Qwen2.5-3B-Instruct"adapter = "AmareshHebbar/medical-billing-qwen25-3b" tokenizer = AutoTokenizer.from_pretrained(base_model)model = AutoModelForCausalLM.from_pretrained( base_model, torch_dtype=torch.bfloat16, device_map="auto",)model = PeftModel.from_pretrained(model, adapter) messages = [ {"role": "system", "content": "You are a medical billing assistant. Given a clinical encounter description, return the CPT code, ICD-10-CM code, and modifier if applicable."}, {"role": "user", "content": "Procedure: Office visit, established patient, 25 minutes, moderate complexity."},]inputs = tokenizer.apply_chat_template(messages, return_tensors="pt", add_generation_prompt=True).to(model.device)outputs = model.generate(inputs, max_new_tokens=128, temperature=0.1, do_sample=True)print(tokenizer.decode(outputs[0][inputs.shape[1]:], skip_special_tokens=True))