from transformers import AutoModelForCausalLM
from llmcompressor import oneshot
from llmcompressor.modifiers.quantization import QuantizationModifier
from llcompressor.utils import load_context
model_id = "nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16"
recipe = QuantizationModifier(
targets="Linear",
scheme="NVFP4",
ignore=[
r"re:.*conv1d.*",
r"backbone\.embeddings",
r"re:.*\_latent_proj.*",
r"re:.*mixer\.gate\..*",
"backbone.norm_f",
"lm_head",
],
)
with load_context(AutoModelForCausalLM):
model = AutoModelForCausalLM.from_pretrained(model_id, dtype="bfloat16")
oneshot(
model=model,
recipe=recipe,
dataset="perfectblend",
splits="train[:8]",
output_dir="/workspace/models/Nemotron-3.5-Lightning-30B-NVFP4-MTP",
max_seq_length=256,
num_calibration_samples=8,
batch_size=1,
moe_calibrate_all_experts=True,
mtp_scheme="NVFP4",
)