RadixAttention
-
大模型推理引擎SGLang部署实战:结构化生成与RadixAttention缓存优化
大模型推理引擎SGLang通过RadixAttention前缀缓存和结构化生成约束,在多轮对话和复杂输出场景下显著降低延迟并提升吞吐。相比vLLM的PagedAttention,S…
大模型推理引擎SGLang通过RadixAttention前缀缓存和结构化生成约束,在多轮对话和复杂输出场景下显著降低延迟并提升吞吐。相比vLLM的PagedAttention,S…