vLLM框架
-
Qwen3.8大模型本地部署实战:从环境搭建到推理加速全流程
Qwen3.8大模型部署环境准备与硬件选型 阿里Qwen3.8模型总参数量达到2.4万亿,在Arena榜单上仅次于Claude系列,编程与专业办公能力显著提升。本地部署该模型对硬件…
-
大模型推理服务部署实战:从vLLM单卡推理到多节点Tensor Parallel完整方案
大模型推理部署面临的核心挑战 大语言模型从训练走向线上推理服务,工程团队要解决的远不止”能跑起来”。延迟指标、吞吐量上限、显存占用峰值、多节点通信开销——每…
-
大模型本地部署实战:Ollama + vLLM 混合推理方案配置指南
为什么需要 Ollama 与 vLLM 混合部署 大模型部署面临一个核心矛盾:开发调试阶段需要快速切换不同模型验证效果,而生产环境对吞吐量和延迟有苛刻要求。Ollama 以其一行命…