vllm serve ./Qwen3.6-27B-mixed-autoround \
--tensor-parallel-size 2 \
--performance-mode interactivity \
--max-model-len auto \
--max-num-batched-tokens 2048 \
--max-num-seqs 1 \
--gpu-memory-utilization 0.97 \
-O3 \
--async-scheduling \
--language-model-only \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}' \ # 3 should be slightly faster but uses more VRAM
--default-chat-template-kwargs.preserve_thinking true \
--mamba-cache-mode all \
--enable-prefix-caching \
--enable-chunked-prefill