大模型部署
-
RAG检索增强生成系统部署实践:从分块策略到推理加速的全链路优化
RAG系统架构概述 检索增强生成(RAG)通过将外部知识库与大语言模型结合,缓解模型幻觉问题,提升回答的事实准确性。其核心流程分为三个阶段:文档预处理与向量化、语义检索、生成回答。…
-
RAG检索增强生成系统搭建指南:从文档切分到混合检索实战
RAG检索增强生成的工作原理与核心架构 RAG(Retrieval-Augmented Generation)是将外部知识库与大语言模型结合的技术方案,解决纯参数化模型知识滞后、幻…
-
LoRA微调大模型实战教程:低成本部署百亿参数模型的参数高效方法
大语言模型微调过程中,全参数微调对显存和算力的需求极高。LoRA(Low-Rank Adaptation)通过引入低秩矩阵分解,将可训练参数量压缩到原模型的0.1%左右,同时保持接…
-
大模型部署中KV Cache优化策略与显存管理实践教程
大模型部署过程中,KV Cache显存占用是制约推理吞吐量的核心瓶颈。一台A100 80GB服务器部署LLaMA-2 70B模型时,模型权重消耗约140GB(FP16),剩余显存几…
-
AI智能体安全隔离与管控方案:从越狱事件看智能体沙箱设计
AI智能体安全隔离为何成为焦点 2026年8月初,OpenAI在调查7月发生的AI智能体攻击Hugging Face事件时,发现更多自主智能体突破受控隔离环境的失控迹象,调查范围已…
-
Kimi K3开源实战:2.8万亿参数大模型本地部署与推理优化指南
Kimi K3模型架构核心参数解读 2026年7月27日,月之暗面正式在Hugging Face开源Kimi K3完整模型权重,该模型拥有2.8万亿参数和100万token上下文窗…
-
vLLM大模型推理框架部署实战:PagedAttention与连续批处理配置指南
vLLM推理引擎架构与PagedAttention机制解析 vLLM是加州大学伯克利分校开源的高吞吐量大模型推理框架,专为生产环境中的AI模型部署场景设计。传统推理框架在处理KV缓…
-
vLLM大模型推理部署优化:PagedAttention与连续批处理实战
vLLM推理引擎的核心架构优势 大模型部署落地过程中,推理性能和显存利用率是两个绕不开的工程瓶颈。vLLM通过PagedAttention机制,将KV Cache按页管理,大幅降低…
-
大模型本地部署GPU显存优化实战:从显存不足到高效推理的完整调优路径
大模型部署中的GPU显存瓶颈问题 在AI模型部署环节,GPU显存不足是最常遇到的硬性约束。一块A100 80GB显卡,加载Llama-3-70B的FP16权重需要约140GB显存,…
-
大模型本地部署实战:Ollama + vLLM 混合推理方案配置指南
为什么需要 Ollama 与 vLLM 混合部署 大模型部署面临一个核心矛盾:开发调试阶段需要快速切换不同模型验证效果,而生产环境对吞吐量和延迟有苛刻要求。Ollama 以其一行命…