工具
4070 Ti 跑 35B MoE 实测:Ornith-1.5-A3B 推理约 55 tok/s
社区用户在 RTX 4070 Ti 上以 Q4_K_M 量化运行 Ornith-1.5-35B-A3B MoE 模型,将…
2026.08.20 · 周四约 3 分钟阅读
Reddit 用户 Seraphym87 在 r/LocalLLaMA 分享了一套在单张 RTX 4070 Ti(12 GB)上运行 Ornith-1.5-35B-A3B(Q4_K_M 量化)的实测方案。模型基于 qwen3_5_moe 架构,总参数约 36B、激活约 3B,原生上下文 256K,Q4 量化后约 20 GB。作者通过 llama.cpp 的 --n-cpu-moe 把大部分专家卸载到 CPU/内存,腾出约 1 GB 显存余量给 KV cache,使其勉强容纳在 12 GB 显存内。
测试环境
- GPU:NVIDIA RTX 4070 Ti(12 GB GDDR6X)
- CPU:Intel i9-13900KF(8P + 16E,24C/32T)
- 内存:32 GB DDR5-6000
- 系统:Windows 11,驱动 566.xx(2025 年 12 月)
- 运行时:llama.cpp b10470 + CUDA 12.4(官方 Windows 预编译版)
模型采用 Q4_K_M 量化(≈20 GB),关闭 mmproj 以节省显存,并启用 flash attention(-fa on)与 q8_0 KV cache。
速度实测
在「Aquarium Prompt」等中等长 prompt 下:
- Prefill(prompt 处理):约 650–700 tok/s
- 生成(持续输出):约 50–56 tok/s
- MTP draft 接受率:约 42–48%,平均 draft 长度 ≈1.9
llama-bench 在隔离环境(极短上下文、KV 不增长)下的数据如下:
| n_cpu_moe | tg128(生成) | pp2048(prefill) |
|---|---|---|
| 26 | 64.9 ± 0.2 t/s | 571 ± 23 t/s |
| 27 | 64.3 ± 0.4 t/s | 482 ± 26 t/s |
| 28 | 62.6 ± 0.2 t/s | 461 ± 31 t/s |
可见把更多专家留在 CPU 会略微拉低 prefill 速度,但生成端影响有限,n_cpu_moe 从 26 提到 28 仅损失约 2–3%。
实用取舍
作者明确指出,这一做法的代价是上下文窗口被压缩到 32K(参数 -c 32768),相比原模型支持的 256K 缩水明显,属于在「显存不够」前提下的折中方案。对于预算有限、没有多卡或整机服务器的用户,这套参数提供了一条把 35B 级 MoE 模型跑起来的参考路径。
社区讨论中也有用户提醒,Q4 量化 + 大量 CPU 卸载会显著降低长上下文表现;如果跑分仅用于日常短问答或代码补全,50+ tok/s 的生成速度基本可用。
