@article{frantar2023sparsegpt,
title={SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot},
author={Frantar, Elias and Alistarh, Dan},
journal={arXiv preprint arXiv:2301.00774},
year={2023}
}
@article{sun2023wanda,
title={A Simple and Effective Pruning Approach for Large Language Models},
author={Sun, Mingjie and Liu, Zhuang and Bair, Anna and Kolter, J Zico},
journal={arXiv preprint arXiv:2306.11695},
year={2023}
}
@article{lin2023awq,
title={AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration},
author={Lin, Ji and Tang, Jiaming and Tang, Haotian and Yang, Shang and Dang, Xingyu and Han, Song},
journal={arXiv preprint arXiv:2306.00978},
year={2023}
}
@article{qwen25,
title={Qwen2.5 Technical Report},
author={Qwen Team},
journal={arXiv preprint arXiv:2407.10671},
year={2024}
}