大模型显存优化
-
KV Cache量化技术原理与vLLM推理显存优化实战
什么是KV Cache量化 KV Cache量化是LLM推理优化领域的一项关键技术,其核心在于对Transformer模型自回归生成阶段产生的Key和Value缓存张量进行低位宽表…
-
AI模型部署实战:vLLM推理引擎搭建与PagedAttention显存优化指南
为什么选择vLLM作为大模型推理引擎 大模型部署环节里,推理引擎的选择直接决定服务吞吐和GPU资源利用率。vLLM由UC Berkeley团队开源,核心卖点是PagedAttent…