桃子桃子快讯
返回首页
开源

Qwen3-Next 80B 已在中端 Android 手机实现本地推理

Reddit 用户实测在 12GB 内存手机上以约 3.5 tok/s 运行 Qwen3-Next 80B 模型,但细节…

2026.08.31 · 周一2 分钟阅读

近日,Reddit 用户 u/dai_app 在 r/LocalLLaMA 板块发帖称,已在一台售价约 400–500 美元、配备 12GB 内存的中端 Android 手机上,成功本地运行通义千问 Qwen3-Next 系列总参数约 80GB 的模型权重,并实现约 3.5 token/s 的推理速度。发帖者明确表示无意为任何项目做推广,纯粹展示该方案在中端手机上的可行性。

运行对象与配置

帖文所述模型名为「Qwen 3.8 Flash Next(80gb)」,从命名与权重规模来看,应指阿里近期开源的 Qwen3-Next-80B 系列。该模型采用 MoE 架构,虽然总参数量在 80B 量级,但实际激活参数仅约 30 亿,因此完整权重可以装入 12GB 左右的内存空间。

发帖者表示实现了约 3.5 token/s 的生成速度,依赖「一些优化」以及对模型稠密部分进行低量化,但未披露具体使用何种推理框架(如 llama.cpp、MLX、ollama 等)、量化精度(如 Q4、Q3 等)、上下文长度等关键参数。

性能意义与局限

3.5 token/s 对于实时对话交互来说仍偏慢,难以满足流畅聊天场景的需求,但其作为一次技术演示,传递出几点值得关注的信号:

  • 80B 级别的 MoE 大模型完整权重已可在消费级手机内存中加载;
  • 配合低量化与针对性优化,移动设备本地运行大模型具备一定可行性;
  • 激活参数较小是 MoE 架构在端侧推理中的关键优势。

信息可信度提示

需要指出的是,该帖仅为单一用户的自述,缺乏可复现的测试条件说明,也未提供任何基准测试、对比数据或截图验证。3.5 token/s 的测量方法、是否启用了投机解码或缓存复用、推理时的功耗与发热情况等均未交代。读者在引用这一数字时宜保持审慎,将其视作一次定性演示,而非可横向比较的性能基准。

信源