桃子桃子快讯
返回首页
工具

是石科技 Meta-Infer 推理引擎:通过软优化让 PCIe 显卡吞吐提升近 7 倍

是石科技发布 Meta-Infer 推理引擎,针对 PCIe 架构显卡进行内核补齐、通信重构等纯软件优化,在多款开源模型…

2026.09.24 · 周四4 分钟阅读

是石科技(METASTONE)近日介绍了其自研的 Meta-Infer 高效推理引擎。该引擎面向不在主流框架官方验证矩阵中的「长尾」PCIe 架构显卡,通过纯软件手段进行内核补齐、算子与通信重构、并行与容量调优、缓存复用四类优化,试图弥合硬件与框架之间的性能鸿沟。文中所引数据均为厂商自测结果,尚未见独立验证。

优化思路:把硬件潜力从软件层释放出来

Meta-Infer 的优化分为「算模协同」与「通算重构」两个阶段。厂商指出,许多 PCIe 显卡在社区默认部署方案下,会出现算子自动回退到低效通用实现、集合通信沿用 NVLink 调优参数、显存与并行配置沿用其他硬件默认值等问题,导致官方宣传性能难以完全发挥。

具体手段包括:

  • 对齐硬件与框架间的元数据定义,修正页尺寸,解锁原生高性能算子路径;
  • 替换不适配硬件的旧计算内核,扩展通信快路径生效阈值;
  • 对注意力、投影等关键算子做算子融合,将计算与集合通信做时间重叠;
  • 针对 Prefill、Decode 阶段差异化配置张量并行与上下文并行;
  • 提供风险感知的缓存复用机制,削减长文本与视频生成场景的重复计算。

主要测试结果(厂商自测)

以下数据均为是石科技官方提供,测试环境与对照配置见原文。

  • DeepSeek-V4.1-Flash:8 卡 PCIe 环境下,输入吞吐从基线 1932 tok/s 提升至 13274 tok/s,整体提升约 6.87 倍,并支持 1M 超长上下文;
  • DeepSeek-V4-Flash:输入吞吐从 14546 tok/s 提升至 22584 tok/s,提升 1.55 倍;
  • GLM-5.3(NVFP4 无损量化版):输入吞吐从 3236.78 tok/s 提升至 6222.72 tok/s,提升 1.92 倍;P95 首 Token 时延从 141.6 秒降至 46.6 秒;上下文支持上限从 27 万 Token 扩展到 105 万 Token;
  • MiniMax H3 视频生成模型:15 秒参考图生视频端到端速度提升 2.48 倍;单机 8 卡整机文生视频最高吞吐达到基线 5.33 倍,参考图生视频达到 4.98 倍。

与 B300 的横向对比

厂商将 8 卡 PCIe 整机与单台 B300 进行配对比较(被测方按 SGLang cookbook 推荐参数配置):

  • 文本推理:B300 输入吞吐约为该 8 卡整机的 4.9–5.6 倍(DeepSeek-V4-Flash);
  • GLM-5.3:B300 约为该整机的 3.5–4.7 倍;
  • 视频生成:统一整机口径下,文生视频 296 条/时 vs B300 439 条/时(约 67%),参考图生视频 131 条/时 vs B300 225 条/时(约 58%)。在「Ours Cache + LoRA」方案下,约 1.5 台 6000D 可对应 1 台 B300 的文生视频吞吐,参考图生视频约 1.7 台。

国产 GPU 上的验证

Meta-Infer 同样在国产 GPU 上完成验证。厂商以拆分 Shared Expert 与 Routed Expert 并行提交为例,在 35 组同配置配对测试中带来约 11.26% 的吞吐提升,强调对国产算力而言,「能跑起来」同样只是第一步。

需要注意的几点

  • 本文由量子位「获授权刊载」,所有 benchmark 数据均来自是石科技,尚未见第三方独立复现;
  • 引用的模型版本(如 DeepSeek-V4 系列、GLM-5.3、MiniMax H3)并非当前已发布的稳定版本,测试条件与硬件型号细节以原文为准;
  • 若读者计划据此做采购或部署决策,建议结合自身业务负载独立压测后再行评估。
信源