from transformers import AutoModelForCausalLM, AutoTokenizer, TextStreamermodel_id = "kurakurai/Luth-2-2B"model = AutoModelForCausalLM.from_pretrained( model_id, device_map="auto", dtype="bfloat16", # attn_implementation="flash_attention_2" # uncomment on compatible GPU)tokenizer = AutoTokenizer.from_pretrained(model_id)streamer = TextStreamer(tokenizer, skip_prompt=True, skip_special_tokens=True)prompt = "Quelle est la capitale de la France?"input_ids = tokenizer.apply_chat_template( [{"role": "user", "content": prompt}], add_generation_prompt=True, return_tensors="pt", tokenize=True,)["input_ids"].to(model.device)output = model.generate( input_ids, do_sample=True, temperature=0.8, top_p=0.95, top_k=20, max_new_tokens=512, streamer=streamer,)