#显存优化
AirLLM:4GB 显存跑 70B 大模型的逐层加载推理方案
之前通过 Ollama、SGLang 在本地部署过大模型的朋友都知道,受限于显卡显存,基本上只能部署小参数且量化后的模型。
这些模型在本地跑基本是残血状态,拿来玩玩还可以,但效果往往差强人意。
最近在 GitHub 上发现一个 3 万 St…