HexStellar 称不改模型即可降低 GPU 推理能耗约 52%
巴西-美国初创 HexStellar 声称在不改动模型的前提下,将单次推理能耗从 506.7 焦耳降至 243.8 焦耳…
总部位于巴西与美国的初创公司 HexStellar 近日表示,其在 GPU 推理能效优化方面取得了一项「不改模型即可生效」的成果:在封闭测量环境下,单次完成请求的能耗从 506.7 焦耳下降到 243.8 焦耳,降幅达 51.9%,同时单位小时内完成的请求数翻倍以上,显存占用保持不变。HexStellar 创始人 Brayon Pieske 在与媒体 StartupFortune 的对话中披露了上述数据,并表示公司已于 2026 年 6 月提交了三份临时专利申请,目前仍处于早期客户接入阶段。
起因:碳数据平台上的「副作用」
Pieske 介绍,HexStellar 原本在做 Trust Carbon 碳数据基础设施。2025 年间,团队频繁被客户问及「如何让视觉 AI 在离线手机端运行并兼顾电池续航」,在排查过程中意识到其自研的底层架构带来了一项意料之外的能效收益。经过数月验证后,团队决定将其产品化,并在公开任何数字前先行提交专利。
测量方法:先「打掉」自己的数字
- 设计可经审计的测量协议,在同一物理硬件、相同条件下对比改造前后的能耗与吞吐。
- 同时公布「几乎无差异」的场景,避免选择性披露。
- 在多个独立模型族上分别验证,逐一发布,每个包均通过同一协议。
Pieske 表示,正是这种「先试图否定自己」的流程让结果经历了数月才面世;公司在已验证的成果中也只公开最保守的底线数据,更强的结果仅在 NDA 客户评估时提供。
跨架构表现:并非单一模型或硬件的「窍门」
Pieske 称,最初团队以为效果只会出现在特定系统上,但在不同架构与平台上观察到一致表现后,才确认该方法并非绑定于单一模型或机型。目前已在服务器及 AI 工作负载(含 LLM)上跑通,跨模型族保持相近量级的收益。
定位:不要求改模型、不要求改精度
- 目标用户已经在生产环境中运行的模型行为保持不变。
- 不需要团队缩小模型或降低精度来换取能效。
- 集成方式保持简单,无需重写现有推理管线。
对数据中心的实际意义
Pieske 认为,该方案对已经购置硬件的数据中心影响最为直接:相同机架上可运行更多推理任务,摊薄单卡 CapEx,并推迟下一轮 GPU 采购节奏。他将这一效果概括为「一笔物理层面的改进同时触及三本预算」——少消耗的电费、已购显卡释放出的容量、以及不再需要立刻买的新卡。
后续节奏:仍以保守数字建立可信度
公司目前处于「最终审计阶段」,对已运行的实验按同一标准复跑,按包逐步发布。Pieske 表示,团队刻意暂不公开最重磅的数据,先用保守结果建立外界信任,避免被视为营销炒作;早期接入仅面向少数合作伙伴,采用「现场集成、现场测量、客户留存数据」的方式推进。
