import torchfrom transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig model_id = "shawaz03/vibe-coder-7b-max" bnb_config = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_quant_type="nf4", bnb_4bit_use_double_quant=True, bnb_4bit_compute_dtype=torch.float16,) tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)model = AutoModelForCausalLM.from_pretrained( model_id, quantization_config=bnb_config, device_map="auto", trust_remote_code=True) system_prompt = """You are Vibe Coder, a world-class principal full-stack software engineer and UI/UX designer.Write complete, modern, production-grade code in TypeScript, React, Next.js, and Node.js with ZERO placeholders.""" messages = [ {"role": "system", "content": system_prompt}, {"role": "user", "content": "Build an interactive pricing matrix in React with Tailwind CSS, supporting monthly/annual toggle and feature checkmarks."}] prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)inputs = tokenizer(prompt, return_tensors="pt").to("cuda") outputs = model.generate( **inputs, max_new_tokens=2048, temperature=0.2, top_p=0.95, repetition_penalty=1.05, do_sample=True,) print(tokenizer.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))