import torchfrom transformers import AutoModelForCausalLM, AutoTokenizer model = AutoModelForCausalLM.from_pretrained( "dustarrr/reasoning-rob", torch_dtype=torch.float16, device_map="auto",)tokenizer = AutoTokenizer.from_pretrained("dustarrr/reasoning-rob")model.eval() messages = [ {"role": "system", "content": "You are a helpful assistant that thinks step by step."}, {"role": "user", "content": "If a train travels 60 km in 1.5 hours, what is its speed?"},]text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)inputs = tokenizer(text, return_tensors="pt") with torch.no_grad(): outputs = model.generate(**inputs, max_new_tokens=1024, do_sample=False) response = tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=False)print(response)