from huggingface_hub import hf_hub_download
from transformers import AutoTokenizer
from vllm import LLM, SamplingParams
repo = "MooreMuaMu/Qwen3.5-27B-Ancient-Scheme1b-Tender100"
tokenizer = AutoTokenizer.from_pretrained(repo)
with open(hf_hub_download(repo, "system_prompt.txt"), encoding="utf-8") as f:
system_prompt = f.read()
messages = [
{"role": "system", "content": system_prompt},
{"role": "user", "content": "请将以下原文翻译为简体中文:<在这里填入原文>"},
]
prompt = tokenizer.apply_chat_template(
messages, tokenize=False, add_generation_prompt=True, enable_thinking=True
)
llm = LLM(
model=repo, tensor_parallel_size=4, dtype="bfloat16",
max_model_len=16384, max_num_seqs=32, max_num_batched_tokens=8192,
enforce_eager=True, enable_prefix_caching=False,
gpu_memory_utilization=0.78,
limit_mm_per_prompt={"image": 0, "video": 0}, mm_processor_cache_gb=0,
)
params = SamplingParams(
temperature=0.7, top_p=0.95, top_k=-1, max_tokens=8192,
skip_special_tokens=False, seed=20260906,
)
result = llm.generate([prompt], params)[0].outputs[0]
print(result.text)