桃子桃子快讯
返回首页
工具

4070 Ti 跑 35B MoE 实测:Ornith-1.5-A3B 推理约 55 tok/s

社区用户在 RTX 4070 Ti 上以 Q4_K_M 量化运行 Ornith-1.5-35B-A3B MoE 模型,将…

2026.08.20 · 周四3 分钟阅读

Reddit 用户 Seraphym87 在 r/LocalLLaMA 分享了一套在单张 RTX 4070 Ti(12 GB)上运行 Ornith-1.5-35B-A3B(Q4_K_M 量化)的实测方案。模型基于 qwen3_5_moe 架构,总参数约 36B、激活约 3B,原生上下文 256K,Q4 量化后约 20 GB。作者通过 llama.cpp 的 --n-cpu-moe 把大部分专家卸载到 CPU/内存,腾出约 1 GB 显存余量给 KV cache,使其勉强容纳在 12 GB 显存内。

测试环境

  • GPU:NVIDIA RTX 4070 Ti(12 GB GDDR6X)
  • CPU:Intel i9-13900KF(8P + 16E,24C/32T)
  • 内存:32 GB DDR5-6000
  • 系统:Windows 11,驱动 566.xx(2025 年 12 月)
  • 运行时:llama.cpp b10470 + CUDA 12.4(官方 Windows 预编译版)

模型采用 Q4_K_M 量化(≈20 GB),关闭 mmproj 以节省显存,并启用 flash attention(-fa on)与 q8_0 KV cache。

速度实测

在「Aquarium Prompt」等中等长 prompt 下:

  • Prefill(prompt 处理):约 650–700 tok/s
  • 生成(持续输出):约 50–56 tok/s
  • MTP draft 接受率:约 42–48%,平均 draft 长度 ≈1.9

llama-bench 在隔离环境(极短上下文、KV 不增长)下的数据如下:

n_cpu_moetg128(生成)pp2048(prefill)
2664.9 ± 0.2 t/s571 ± 23 t/s
2764.3 ± 0.4 t/s482 ± 26 t/s
2862.6 ± 0.2 t/s461 ± 31 t/s

可见把更多专家留在 CPU 会略微拉低 prefill 速度,但生成端影响有限,n_cpu_moe 从 26 提到 28 仅损失约 2–3%。

实用取舍

作者明确指出,这一做法的代价是上下文窗口被压缩到 32K(参数 -c 32768),相比原模型支持的 256K 缩水明显,属于在「显存不够」前提下的折中方案。对于预算有限、没有多卡或整机服务器的用户,这套参数提供了一条把 35B 级 MoE 模型跑起来的参考路径。

社区讨论中也有用户提醒,Q4 量化 + 大量 CPU 卸载会显著降低长上下文表现;如果跑分仅用于日常短问答或代码补全,50+ tok/s 的生成速度基本可用。

信源