桃子桃子快讯
返回首页
工具

矿卡解锁 A100 级算力:CMP 170HX 张量核心被破解

网友通过指令级实测发现 CMP 170HX 张量核心存在 256 周期硬编码限流,解锁后算力从 6.3 TFLOPS 提…

2026.08.22 · 周六3 分钟阅读

近日,一位 Reddit 用户在 r/LocalLLaMA 发布了一项针对 NVIDIA CMP 170HX 矿卡的实测发现:这款被阉割张量核心的「矿渣」实际上内含完整的 A100 硅片,仅被一段硬编码指令级限流锁住了性能。解锁后,其 BF16 张量算力从 6.3 TFLOPS 跃升至 193 TFLOPS,单卡即可在 LLM 预填充性能上击败双卡 RTX 3090 组合。

关键发现:256 周期硬编码限流

作者在获得 CMP 170HX 后发现,该卡虽搭载 A100 同款 GA100 核心,且 VRAM 可通过解锁恢复至 64 GB,但张量核心却被「削弱」,导致 BF16 算力仅 6.3 TFLOPS,与 RTX 3090 的水平相当。通过逐条 MMA 指令的精确测量,作者定位到一个完全硬编码的 256 周期停顿(stall)——在 3500 次采样中方差为零,这在物理层面是不可能出现的,因此必定是寄存器写入的值。

解锁后,每条 MMA 指令的延迟从 256.0 周期降至 24.0 周期(作为对比,状态正常的 RTX 3090 约为 32.9 周期)。由此带来的张量吞吐从 6.3 TFLOPS 提升到 193 TFLOPS,达到 A100 单 SM 满血规格的约 95%。

实测推理性能

在 llama.cpp 的 pp512 标准测试中,解锁后的 170HX 跑出 3468 tok/s,相比解锁前的 599.6 tok/s 提升约 5.8 倍。在更贴近生产场景的 vLLM 测试中,使用 Qwen3-27B-FP8 模型进行推理时,单张解锁 170HX 的预填充速度超越作者自有的双卡 RTX 3090 张量并行组合,而整卡功耗仅为 197 W(双 3090 组合为 454 W)。

社区中的两条「过时建议」

作者指出,关于 170HX 在 AI 推理中的表现,社区中广泛流传的两条建议实际上已经不成立:

  • 「170HX 的张量核心被砍,不适合 AI 推理」——在解锁后其张量性能已接近满血 A100。
  • 「170HX 的 FP16 表现与 RTX 3090 相当」——同样基于被锁定的限流值,并不能反映硬件真实能力。

验证方法

为方便社区复现,作者附带了一个周期精确探针程序,可在约 10 秒内完成验证。该探针对功率限制免疫,可在已有负载运行的同时安全执行,对希望确认手中 170HX 是否已正确解锁的用户具有实用价值。

信源