大模型本地推理
-
llama.cpp本地大模型量化部署实战:从编译到推理服务搭建
为什么需要对大模型进行量化 百亿参数级别的大语言模型直接部署到消费级硬件上面临显存瓶颈。一个130亿参数的模型以FP16精度存储需要约26GB显存,而消费级显卡通常只有8GB到24…
-
Kimi K3 开源模型本地部署实战:2.8万亿参数MoE大模型的离线推理方案
为什么选择本地部署Kimi K3 2026年7月27日,月之暗面正式开源Kimi K3完整权重,这款2.8万亿参数的大模型此前已登顶代码榜单,力压GPT、Claude等主流闭源模型…
-
Kimi K3 开源模型本地部署实战:2.8万亿参数MoE大模型的离线推理方案
为什么选择本地部署Kimi K3 2026年7月27日,月之暗面正式开源Kimi K3完整权重,这款2.8万亿参数的大模型此前已登顶代码榜单,力压GPT、Claude等主流闭源模型…