AirLLM:在 4GB 显卡上跑 70B 大模型的推理内存优化库
2026/9/18 17:43:48 网站建设 项目流程

AirLLM:在 4GB 显卡上跑 70B 大模型的推理内存优化库

无需量化、蒸馏或剪枝,AirLLM 把 70B 大语言模型的推理内存需求压缩到单张 4GB 显卡即可运行;405B 的 Llama 3.1 也能在 8GB 上跑,671B 的 DeepSeek-V3 只需约 12GB。

📦项目源码备份下载(夸克网盘)
完整项目已同步备份到夸克网盘,永久有效、无需提取码
👉https://pan.quark.cn/s/f07260e96b53

项目简介

AirLLMlyogavin/airllm)是 Gavin Li 开源的一款大语言模型推理内存优化库。它的宣传语非常直接:“dramatically reduces inference memory usage, letting 70B large language models run on a single 4GB GPU card — without quantization, distillation, or pruning.”——核心思路是让模型以 layer-by-layer 流式加载的方式运行,GPU 上始终只有一层权重,从而实现极低的显存占用。

它瞄准的是现有工具的痛点:70B 级模型通常需要多卡或大显存才能跑,普通人手里 4GB / 8GB 的消费级显卡根本无力承担;而量化、蒸馏又往往牺牲精度。AirLLM 从架构层面彻底重构推理过程,不改动模型本身,即可让普通人用一张小显卡跑超大模型。

为什么选 AirLLM

  • 🚀 无需量化、蒸馏或剪枝:直接在原始模型精度下运行,不牺牲任何 accuracy。
  • ⚡ 极简使用方式:一行代码AutoModel.from_pretrained(...),不区分模型类型,自动检测并加载。
  • 📦 极低的显存门槛:单次只加载一层到 GPU,显存消耗取决于单层大小而非模型总量——671B 的 DeepSeek-V3 在 ~12GB 上跑,405B 的 Llama 3.1 在 8GB 上跑。
  • 🔌 支持 3x 推理加速:内置基于 block-wise quantization 的压缩模式(4bit / 8bit),在不明显损失精度的前提下最高提速 3 倍。
  • 🌐 跨平台支持:macOS(Apple Silicon)、Linux、Windows 均可运行;CPU 推理也已支持。
  • 📈 持续跟进最新模型:Llama 3.x、Qwen3、DeepSeek V2/V3、Kimi K3(2.8T)等,几乎发布当天即支持。

核心特性

Layer-by-layer 流式推理

AirLLM 的核心 trick:一次只在 GPU 上保留一层权重。这样显存需求取决于单层的大小,而不是整个模型的参数量——这也是为什么 671B 模型能在 12GB 显存上跑起来。

AutoModel 全自动检测

无需指定模型架构类,直接传入 HuggingFace repo ID 或本地路径,AirLLM 自动检测模型类型并完成加载:

fromairllmimportAutoModel model=AutoModel.from_pretrained("Qwen/Qwen3-32B")
模型压缩:4x / 8bit 量化加速
model=AutoModel.from_pretrained("garage-bAInd/Platypus2-70B-instruct",compression='4bit')

与常规量化不同,AirLLM 只量化权重部分(不量化 activation),因为瓶颈在磁盘加载而非计算,所以精度损失几乎可以忽略。

预取机制重叠加载与计算

默认开启的 prefetching 在加载下一层的同时进行当前层的推理计算,带来约 10% 的速度提升。

安装

方式一:pip 安装

pipinstallairllm

方式二:从源码构建

gitclone https://github.com/lyogavin/airllm.git&&cdairllm pipinstall-e.

方式三:CPU 推理(无 GPU)

model=AutoModel.from_pretrained("Qwen/Qwen3-32B",device_map="cpu")

上手:运行第一个示例

安装后,只需三行代码即可运行 70B 模型:

fromairllmimportAutoModel model=AutoModel.from_pretrained("Qwen/Qwen3-32B")input_text=['What is the capital of United States?']input_tokens=model.tokenizer(input_text,return_tensors="pt",return_attention_mask=False,truncation=True,max_length=128,padding=False)output=model.generate(input_tokens['input_ids'].cuda(),max_new_tokens=20,use_cache=True,return_dict_in_generate=True)print(model.tokenizer.decode(output.sequences[0]))

支持的其他模型示例:

# Qwen 系列model=AutoModel.from_pretrained("Qwen/Qwen3.8-27B")# 27B dense VL, 3.33GBmodel=AutoModel.from_pretrained("Qwen/Qwen3.8-Flash-Next")# 125B MoE + 51B PLE, 5.95GBmodel=AutoModel.from_pretrained("deepseek-ai/DeepSeek-V3")# 671B, ~12GBmodel=AutoModel.from_pretrained("Qwen/Qwen3-235B-A22B")# 235B, ~3GB# Kimi K3(2.8T,2026/07 支持)model=AutoModel.from_pretrained("Kimi/Kimi-K3")# 2.8T 级,<4GB

性能 / 对比(可选)

模型参数量所需显存
Qwen3 / Mistral / Phi≈8B~1–2 GB
Qwen3-30B / Mixtral (MoE)30–47B~1–3 GB
Qwen3.8-27B (dense VL)27B3.33 GB
Qwen3.8-Flash-Next (MoE+PLE)~180B5.95 GB
Qwen3-235B (MoE)235B~3 GB
Llama 3.x 70B (full precision)70B~4 GB
Llama 3.1 405B405B~8 GB
DeepSeek-V3671B~12 GB

启用compression='4bit'后,推理速度最高提升3x,精度损失可忽略。

适用场景

  • 消费级显卡用户:只有 4GB / 8GB 显存,却想用 70B+ 大模型。
  • 研究 / 教学环境:需要快速跑大模型实验,又不想申请昂贵 GPU 配额。
  • 边缘部署:在资源受限的设备上部署大语言模型推理服务。
  • AI Agent 本地后端:本地跑 LLM 作为 Agent 的底层推理引擎,无需云端 API 费用。

结语

AirLLM 用一种优雅的方式解决了"大模型显存门槛"的问题——不是通过牺牲精度的量化,而是通过改变推理的加载方式。它让普通人的小显卡也能跑 671B 的模型,这一点对本地 AI 生态的普及意义重大。如果你有一张 4GB / 8GB 的显卡却一直没跑过大模型,AirLLM 值得 clone 下来跑一跑,也能在 Discord 社区 里看看其他用户是怎么用的。


资源备份(夸克网盘)

完整源代码已同步备份到夸克网盘,可直接下载:

  • 夸克网盘分享链接:https://pan.quark.cn/s/f07260e96b53(永久有效,无需提取码)

参考链接

  • 仓库地址:https://github.com/lyogavin/airllm
  • 夸克网盘备份:https://pan.quark.cn/s/f07260e96b53
  • 许可证:Apache 2.0

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询