vLLM推理框架
-
开源大模型部署实战:从MiMo-V2.5到本地推理环境搭建全流程
开源大模型本地部署的硬件选型与准备 2026年8月,OpenRouter最新一周全球大模型调用量榜单显示,排名前五的产品全部由中国企业研发,其中小米MiMo-V2.5以单周10.5…
-
AI模型部署实战:vLLM推理框架安装配置与性能调优指南
vLLM作为当前主流的大模型推理加速框架,通过PagedAttention技术和连续批处理机制,显著提升了GPU显存利用率和吞吐量。本文以实际部署流程为主线,覆盖环境准备、模型加载…