docker pull ghcr.io/r0b0tlab/xyz-aquila-mini-nvfp4-vllm:v0.25.0-sm121-702f4814
docker run --gpus all --ipc=host --network host \
-e PORT=18082 \
-e MODEL_ID=/models/model \
-e SERVED_MODEL_NAME=xyz-aquila-nvfp4 \
-e QUANTIZATION=modelopt_mixed \
-e KV_CACHE_DTYPE=fp8 \
-e ATTENTION_BACKEND=flashinfer \
-e MOE_BACKEND=flashinfer_b12x \
-e LINEAR_BACKEND=flashinfer_cutlass \
-e LANGUAGE_MODEL_ONLY=1 \
-e GPU_MEMORY_UTILIZATION=0.85 \
-e MAX_MODEL_LEN=32768 \
-e MAX_NUM_SEQS=16 \
-v $PWD:/models/model:ro \
ghcr.io/r0b0tlab/xyz-aquila-mini-nvfp4-vllm:v0.25.0-sm121-702f4814