import torchfrom transformers import AutoTokenizer, AutoModelForCausalLMfrom peft import PeftModel base_model_name = "google/gemma-2-2b"adapter_model_name = "coder1969/gemma-2-2b-scientific-summarizer" # Load tokenizertokenizer = AutoTokenizer.from_pretrained(base_model_name)if tokenizer.pad_token is None: tokenizer.pad_token = tokenizer.eos_token # Load base modelmodel = AutoModelForCausalLM.from_pretrained( base_model_name, torch_dtype=torch.float16, device_map="auto") # Apply adaptersmodel = PeftModel.from_pretrained(model, adapter_model_name) # Inference Exampleprompt = "Document:\nTopic: quantum machine learning\n\nRelevant Literature:\n[Insert relevant abstracts or papers here]\n\nSummary:\n"inputs = tokenizer(prompt, return_tensors="pt").to(model.device) with torch.no_grad(): outputs = model.generate( **inputs, max_new_tokens=256, do_sample=True, temperature=0.7, top_p=0.9 ) print(tokenizer.decode(outputs[0], skip_special_tokens=True))