桃子桃子快讯
返回首页
工具

AirLLM 更新:支持 Qwen3.8-27B 与 Kimi K3,可在 4GB 显存下运行超大规模模型

AirLLM 发布更新,新增多款模型支持,宣称可在单卡 4GB 显存下运行 70B 模型,12GB 运行 DeepSee…

2026.08.20 · 周四3 分钟阅读

AirLLM 是一个主打"极低显存推理"的开源工具,通过分层流式加载(layer streaming)技术,使得 70B 级别的稠密模型能够在单张 4GB 显存的 GPU 显卡上运行,无需量化、蒸馏或剪枝。近日该项目在沉寂约两年后公布了新一轮更新,覆盖了 Qwen3.8-27B、Kimi K3 等多个最新模型,并引入 FP8 支持。

核心更新概览

  • Qwen3.8-27B 支持:Qwen 最新稠密视觉语言模型,采用 Gated DeltaNet + Gated Attention 架构,原生支持视觉输入。在单张 RTX 3090 上端到端实测仅需 3.33GB VRAM,依赖 transformers 5.8 及以上版本。
  • Kimi K3(2.8T 参数)支持:号称目前最大的开源模型,通过单卡运行仅需 3.72GB VRAM,在 RTX 6000 Ada 上端到端实测。K3 的 MoE 架构使得 AirLLM 只需逐 expert 流式加载 token 实际路由到的专家,显著降低显存占用。
  • v3.0 版本:新增 FP8 模型支持,DeepSeek-V3(671B)可在约 12GB 显存下运行,Qwen3-235B 约 3GB 即可运行,统一通过单一 AutoModel 接口加载。

Kimi K3 部署要求

在 AirLLM 中部署 Kimi K3 需要满足以下三项条件:

  • 安装 compressed-tensorsflash-attn,K3 模型代码强制要求使用 flash attention;
  • 使用 CUDA 12 版本的 PyTorch,因为目前尚无 CUDA 13 的预编译 flash-attn wheel;
  • 锁定 transformers 4.56.x 版本,K3 的 remote code 无法在 5.x 上加载。

支持的模型范围

v3.0 起,AirLLM 在单一接口下覆盖了目前主流的开源模型系列,包括 Qwen3、Llama 3.x/4、DeepSeek V2/V3、Phi-4、Gemma 等,并通过 FP8 支持进一步降低显存门槛。

性能数据参考

  • 405B Llama 3.1:8GB 显存可运行;
  • DeepSeek-V3(671B):约 12GB 显存可运行;
  • Kimi K3(2.8T):约 3.72GB 显存可运行(单专家流式加载)。

上述数据均来自社区帖子的开发者实测分享,原始项目链接与评论区反馈可在 Reddit r/LocalLLaMA 帖子中查看。

信源