from transformers import AutoTokenizer, AutoModelForCausalLMimport torch model_id = "micymike/CodeMate-Qwen-1.5B-32K-Distilled-on-Claude-Fable-5" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype=torch.bfloat16, device_map="auto") messages = [ { "role": "system", "content": "You are CodeMate, an expert programming assistant." }, { "role": "user", "content": "Write a Python function to compute edit distance." }] prompt = tokenizer.apply_chat_template( messages, tokenize=False, add_generation_prompt=True,) inputs = tokenizer(prompt, return_tensors="pt").to(model.device) outputs = model.generate( **inputs, max_new_tokens=512, temperature=0.7, top_p=0.9, do_sample=True) print(tokenizer.decode(outputs[0], skip_special_tokens=True))