GPTQ
-
大模型量化部署实战:GPTQ与AWQ压缩算法对比与推理加速
大模型量化部署的核心问题与量化基础 大模型量化部署是将高精度浮点权重压缩到低比特定点数(INT4/INT8)的过程,目标是降低显存占用和推理延迟。量化分为训练后量化(PTQ)和量化…
-
大模型量化部署实战:GPTQ与AWQ算法原理及GGUF格式转换
大模型量化部署是将百亿参数规模的LLM压缩到消费级GPU上运行的核心技术。量化通过降低权重精度(FP16转INT4/INT8),在几乎不损失推理质量的前提下将显存占用减少4倍以上,…