大模型推理优化
-
大模型推理优化实战:vLLM与TensorRT-LLM部署性能对比
大模型推理优化是AI模型部署环节的核心瓶颈。当模型参数达到70B甚至更大规模时,推理延迟、吞吐量和显存利用率直接影响线上服务质量。当前主流推理框架中,vLLM凭借PagedAtte…
-
大模型推理优化实战:vLLM部署PagedAttention与投机解码全链路加速方案
大模型推理为什么成为部署瓶颈 当参数量跨越700亿阈值后,模型推理阶段的显存占用和延迟成为线上服务最棘手的问题。单次推理的KV Cache在长上下文场景下轻松吃掉40GB以上显存,…