vLLM框架
-
大模型推理服务部署实战:从vLLM单卡推理到多节点Tensor Parallel完整方案
大模型推理部署面临的核心挑战 大语言模型从训练走向线上推理服务,工程团队要解决的远不止”能跑起来”。延迟指标、吞吐量上限、显存占用峰值、多节点通信开销——每…
-
大模型本地部署实战:Ollama + vLLM 混合推理方案配置指南
为什么需要 Ollama 与 vLLM 混合部署 大模型部署面临一个核心矛盾:开发调试阶段需要快速切换不同模型验证效果,而生产环境对吞吐量和延迟有苛刻要求。Ollama 以其一行命…