Kalibracja
PTQ przez llm-compressor, 512 próbek polskiej Wikipedii,
długość sekwencji 2048. Kalibracja na polskim tekście dla zachowania jakości w języku docelowym.
Sprzęt
NVFP4 jest akcelerowany sprzętowo na Blackwellu (sm_100+). Na starszych GPU (np. Ada/RTX 4090) vLLM
ładuje model przez kernel Marlin (weight-only FP4) — działa wszędzie, zysk to mniejszy VRAM.
Użycie (vLLM)
vllm serve <repo>/Bielik-PL-Minitron-7B-v3.0-Instruct-NVFP4 --max-model-len 8192
Speculative decoding z draftem Bielik-1.5B-NVFP4
(ten sam tokenizer, num_speculative_tokens=2 optymalne na RTX 4090):
vllm serve <repo>/Bielik-PL-Minitron-7B-v3.0-Instruct-NVFP4 --max-model-len 8192 \
--speculative-config '{"model": "<repo>/Bielik-1.5B-NVFP4", "num_speculative_tokens": 2}'
Licencja i atrybucja
Apache-2.0, dziedziczona z modelu bazowego. Model bazowy: SpeakLeash & ACK Cyfronet AGH.
Ten checkpoint to wyłącznie kwantyzacja oryginalnych wag.