Loading...
Loading...
AirLLM 70B inference with single 4GB GPU
想玩本地大模型的人不少,但一查配置就劝退了:动不动要 A100、H100,一张几十万。
但你家里那块吃灰的 4GB 老显卡,其实就能跑 70B。
靠的是 AirLLM,一个开源项目,一条 pip install airllm 就能装。
这些数字我当时也不信:
70B 的 Llama 3,4GB 显存就够。
405B 的 Llama 3.1,8GB。
DeepSeek-V3 671B,12GB 左右。
最狠的是 Kimi K3,2.8T 参数,目前开源最大的模型,只占 3.72GB。
一个 2.8T 的模型,显存占得比 70B 还少。
它没把模型变小,没量化,没剪枝。
就一招:分层加载。首次运行先把模型按 Transformer 层拆成一堆小文件,丢硬盘上。推理的时候,GPU 里只留当前在算的那一层,算完就换下一层。
显存装得下一层,就够跑整个模型。
还做了个预取:算这一层时,CPU 提前把下一层从硬盘搬进内存,能再快 10% 左右。
丑话说前面,这是拿时间换空间。
实测 GTX 1050 Ti 跑 70B,生成 200 个 token 要七八分钟。
所以别指望它陪你聊天,等不起。
它适合干这些:本地跑批、离线处理、做做实验,或者就是不想把数据传云上。慢是慢,但能跑,还不损精度。