from transformers import AutoTokenizer, AutoModelForCausalLMimport torch REPO = "shareit/cycleinstruct-phi4-supervisor" tok = AutoTokenizer.from_pretrained(REPO)model = AutoModelForCausalLM.from_pretrained( REPO, torch_dtype=torch.bfloat16, attn_implementation="sdpa", device_map="auto").eval() SYSTEM = "당신은 전자제품 CS 챗봇의 품질을 평가하는 수퍼바이저입니다."USER = "[Category] W/M\n[Conversation Transcript] …\n[Retrieved Document] …" # Phi-4-reasoning ChatML with our clean system prompt (skip default Thought scaffold)prompt = ( f"<|im_start|>system<|im_sep|>{SYSTEM}<|im_end|>" f"<|im_start|>user<|im_sep|>{USER}<|im_end|>" f"<|im_start|>assistant<|im_sep|>")out = model.generate( **tok(prompt, return_tensors="pt", add_special_tokens=False).to(model.device), do_sample=False, max_new_tokens=1200, pad_token_id=tok.pad_token_id,)print(tok.decode(out[0], skip_special_tokens=False))