from transformers import AutoModelForCausalLM, AutoTokenizerimport torch model_name = "FutureMa/Eva-4B-V2"tokenizer = AutoTokenizer.from_pretrained(model_name)model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype=torch.bfloat16, device_map="auto") # Prompt templateprompt = """You are a financial analyst. Your task is to Detect Evasive Answers in Financial Q&A Question: What is the expected margin for Q4?Answer: We expect it to be 32%. Response format:```json{"label": "direct|intermediate|fully_evasive"}``` Answer in ```json content, no other text""" messages = [{"role": "user", "content": prompt}]text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True, enable_thinking=False)inputs = tokenizer(text, return_tensors="pt").to(model.device) with torch.no_grad(): outputs = model.generate(**inputs, max_new_tokens=64, temperature=0.1, do_sample=False) generated = outputs[0][inputs["input_ids"].shape[1]:]print(tokenizer.decode(generated, skip_special_tokens=True))# Output: ```json# {"label": "direct"}# ```