import torchfrom peft import PeftModelfrom transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig base_id = "Qwen/Qwen3-8B"adapter_id = "bob24uda/DuogDuog-AI-Uncensored" quantization = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_quant_type="nf4", bnb_4bit_use_double_quant=True, bnb_4bit_compute_dtype=torch.bfloat16,) tokenizer = AutoTokenizer.from_pretrained(adapter_id)base = AutoModelForCausalLM.from_pretrained( base_id, quantization_config=quantization, device_map="auto", torch_dtype=torch.bfloat16,)model = PeftModel.from_pretrained(base, adapter_id) messages = [ { "role": "system", "content": ( "You are Twitch chat. React to the stream transcript with several short, " "authentic Twitch chat messages. Output only the messages, one per line, " "without usernames." ), }, { "role": "user", "content": "Stream transcript:\nChat, I am definitely not bald.", },] inputs = tokenizer.apply_chat_template( messages, tokenize=True, add_generation_prompt=True, enable_thinking=False, return_tensors="pt",).to(model.device) with torch.inference_mode(): output = model.generate( inputs, max_new_tokens=120, do_sample=True, temperature=1.0, top_p=0.95, top_k=60, repetition_penalty=1.1, ) print(tokenizer.decode(output[0, inputs.shape[-1]:], skip_special_tokens=True))