长文本推理
-
大模型KV Cache优化实战:长文本推理的显存瓶颈与量化方案
大模型推理进入长上下文时代后,KV Cache成为显存消耗的第一大来源。一个70B参数的模型在8K上下文下,KV Cache占用可达数十GB,超过权重本身。本文围绕KV Cache…
-
LLM长文本推理Ring Attention环形注意力机制实现与优化
Ring Attention环形注意力机制原理与超长序列处理 大语言模型在处理长文本时,标准自注意力机制的显存消耗随序列长度呈二次增长,10万token序列在单卡上几乎无法完成计算…