工具
社区展示 90GB 显存 LoRA 直训 284B 模型方案
开发者 woct0rdho 在 r/LocalLLaMA 更新低显存 LoRA 训练进展,可在 90 GiB 显存下微调…
2026.07.29 · 周三约 2 分钟阅读
社区开发者 woct0rdho 在 Reddit r/LocalLLaMA 板块更新了其低显存 LoRA 微调进展:无需 CPU 卸载,仅靠 90 GiB 显存即可在 GGUF 量化格式的基模型上直接训练 284B-A13B 架构的模型。在 Strix Halo 平台上,单步训练耗时约 19 秒。作者已将相关脚本开源,希望进一步打通 GGUF 与 PyTorch 生态的整合。
训练方案要点
- 目标模型:标题中称为「DeepSeek-V4-Flash」,参数量 284B-A13B(总参 284B,激活 13B),但其 GitHub 仓库 transformers5-qwen3.5-recipe 的命名显示实际训练脚本基于 Qwen3.5 系列。
- 核心思路:让 LoRA 训练直接作用于 GGUF 量化基模型,避免先反量化到 FP16/BF16 再训练的传统路径,从而显著压低显存占用。
- 硬件门槛:单卡 90 GiB VRAM,无需 CPU offloading,对中小型工作站更友好。
速度与内核实现
- 在 AMD Strix Halo(锐龙 AI Max 系列)上的训练速度约为 19 s/it。
- 滑动注意力(sliding attention)、CSA、HCA 等注意力机制变体均由作者以「vibe-coded」方式编写的 Triton 内核实现,作者称其速度优于他所了解的其他实现。
后续方向
- 作者希望把 GGUF 接入 PyTorch 生态的工作进一步开放,让非训练类的模型「手术」更易获得,例如 Heretic 这类消偏工具。
- 他同时指出,对带 mHC(一种记忆/状态机制)的模型做 abliteration(消偏)仍是未解决的难题,并给出了 Hugging Face 上的相关讨论链接。
参考链接
- GitHub 仓库:github.com/woct0rdho/transformers5-qwen3.5-recipe
- 原帖:Reddit r/LocalLLaMA
