import torchfrom transformers import AutoModelForCausalLM, AutoTokenizerfrom peft import PeftModel # Load adapter on top of base modeltokenizer = AutoTokenizer.from_pretrained("Rut-ai/indian-history-qlora")model = AutoModelForCausalLM.from_pretrained( "Qwen/Qwen2.5-0.5B-Instruct", dtype=torch.bfloat16, device_map="auto")model = PeftModel.from_pretrained(model, "Rut-ai/indian-history-qlora")model.eval() # Generatedef ask(instruction, context=""): if context: prompt = f"### Instruction:\n{instruction}\n\n### Input:\n{context}\n\n### Response:\n" else: prompt = f"### Instruction:\n{instruction}\n\n### Response:\n" inputs = tokenizer(prompt, return_tensors="pt").to(model.device) with torch.no_grad(): out = model.generate(**inputs, max_new_tokens=200, temperature=0.7, do_sample=True, repetition_penalty=1.1) return tokenizer.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True) # Exampleprint(ask( "Continue the following passage about Indian history:", "The Mughal Empire was one of the largest empires in Indian history."))