# 1. Models (pulls into ~/.cache/huggingface)
hf download lued/Qwen3.8-27B-INT8-W8A16-DFlash2
hf download lued/Qwen3.8-27B-DFlash2-W8
# 2. Patches (DFlash2 support is not in a released vLLM yet)
git clone https://github.com/noonghunna/club-3090.git
# 3. Serve (condensed; full command in TECHNICAL.md)
export CLUB3090="$HOME/club-3090"
podman run --rm --replace --device nvidia.com/gpu=all --ipc=host -p 8080:8080 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
-v "$CLUB3090/models/qwen3.6-27b/vllm/patches/vllm-pr52816-dflash2":/etc/club3090/pr52816:ro \
-v "$CLUB3090/models/qwen3.6-27b/vllm/patches/vllm-pr48375-mamba-drop-eagle-block":/etc/club3090/pr48375:ro \
--entrypoint bash docker.io/vllm/vllm-openai:nightly-5a4c8d99242e9e069b604d0e9b969e77f7dd501d \
-c 'bash /etc/club3090/pr48375/install.sh || exit 1; bash /etc/club3090/pr52816/install.sh || exit 1; exec vllm serve "$@"' -- \
lued/Qwen3.8-27B-INT8-W8A16-DFlash2 \
--tensor-parallel-size 2 --max-model-len 262144 --kv-cache-dtype fp8_e4m3 \
--speculative-config '{"method":"dflash","model":"lued/Qwen3.8-27B-DFlash2-W8","num_speculative_tokens":7}'