import torchfrom transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfigfrom peft import PeftModel # Base modelbase_model_name = "TinyLlama/TinyLlama-1.1B-Chat-v1.0"adapter_name = "zaid646/tinyllama-1.1b-alpaca-qlora" # Load tokenizertokenizer = AutoTokenizer.from_pretrained(base_model_name)tokenizer.pad_token = tokenizer.eos_token # Load model with 4-bit quantizationquant_config = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_compute_dtype=torch.bfloat16, bnb_4bit_use_double_quant=True, bnb_4bit_quant_type="nf4",) model = AutoModelForCausalLM.from_pretrained( base_model_name, quantization_config=quant_config, device_map="auto", torch_dtype=torch.bfloat16,) # Load adaptermodel = PeftModel.from_pretrained(model, adapter_name) # Inferenceprompt = "### Instruction:\nExplain what machine learning is.\n### Response:\n"inputs = tokenizer(prompt, return_tensors="pt").to(model.device)outputs = model.generate(**inputs, max_new_tokens=256, temperature=0.7)print(tokenizer.decode(outputs[0], skip_special_tokens=True))