工具
AirLLM 更新:支持 Qwen3.8-27B 与 Kimi K3,可在 4GB 显存下运行超大规模模型
AirLLM 发布更新,新增多款模型支持,宣称可在单卡 4GB 显存下运行 70B 模型,12GB 运行 DeepSee…
2026.08.20 · 周四约 3 分钟阅读
AirLLM 是一个主打"极低显存推理"的开源工具,通过分层流式加载(layer streaming)技术,使得 70B 级别的稠密模型能够在单张 4GB 显存的 GPU 显卡上运行,无需量化、蒸馏或剪枝。近日该项目在沉寂约两年后公布了新一轮更新,覆盖了 Qwen3.8-27B、Kimi K3 等多个最新模型,并引入 FP8 支持。
核心更新概览
- Qwen3.8-27B 支持:Qwen 最新稠密视觉语言模型,采用 Gated DeltaNet + Gated Attention 架构,原生支持视觉输入。在单张 RTX 3090 上端到端实测仅需 3.33GB VRAM,依赖 transformers 5.8 及以上版本。
- Kimi K3(2.8T 参数)支持:号称目前最大的开源模型,通过单卡运行仅需 3.72GB VRAM,在 RTX 6000 Ada 上端到端实测。K3 的 MoE 架构使得 AirLLM 只需逐 expert 流式加载 token 实际路由到的专家,显著降低显存占用。
- v3.0 版本:新增 FP8 模型支持,DeepSeek-V3(671B)可在约 12GB 显存下运行,Qwen3-235B 约 3GB 即可运行,统一通过单一 AutoModel 接口加载。
Kimi K3 部署要求
在 AirLLM 中部署 Kimi K3 需要满足以下三项条件:
- 安装
compressed-tensors与flash-attn,K3 模型代码强制要求使用 flash attention; - 使用 CUDA 12 版本的 PyTorch,因为目前尚无 CUDA 13 的预编译 flash-attn wheel;
- 锁定
transformers 4.56.x版本,K3 的 remote code 无法在 5.x 上加载。
支持的模型范围
v3.0 起,AirLLM 在单一接口下覆盖了目前主流的开源模型系列,包括 Qwen3、Llama 3.x/4、DeepSeek V2/V3、Phi-4、Gemma 等,并通过 FP8 支持进一步降低显存门槛。
性能数据参考
- 405B Llama 3.1:8GB 显存可运行;
- DeepSeek-V3(671B):约 12GB 显存可运行;
- Kimi K3(2.8T):约 3.72GB 显存可运行(单专家流式加载)。
上述数据均来自社区帖子的开发者实测分享,原始项目链接与评论区反馈可在 Reddit r/LocalLLaMA 帖子中查看。
