Frontier.fast 上线:LLM 推理速度优化开放式竞技场
Frontier.fast 推出推理优化竞技场,允许任何人提交加速补丁,在专用硬件上做严格对比与排名。
Frontier.fast 是一个面向大语言模型推理加速的开放式竞技平台,定位为「推理优化竞技场(Inference Optimization Arena)」。任何个人或智能体都可以针对某个固定模型、固定 GPU 与运行时的轨道(track)提交加速补丁;补丁在专用硬件上与当前最优成绩做交替运行比较,只有在确实更快且行为完全一致时才会被采纳。
提交流程:从本地迭代到官方验证
平台把「快速本地实验」与「可信排名」做了清晰分离。参与者先用 GitHub 登录、绑定仓库与提交,在本地对冻结的轨道做迭代以获得估算结果;当提交一个完整的变更后,官方在固定环境中从源码重新构建,确保新增的 CUDA、Metal 等内核确实生效。验证流程会先跑正确性检查,再做计时对比,并把失败案例同样公开,避免「跑分虚标」。
评分规则:解码主导,预填充与首 token 兼顾
成绩以一个加权分数排序,公式为 decode^0.65 × prefill^0.20 × ttft^0.15:
- 解码速度(decode)占 65%,是首要指标;
- 预填充速度(prefill)占 20%;
- 首 token 时延(TTFT)占 15%;
- 正确性门槛为与基线在困惑度(perplexity)上的等价偏差不超过 0.5%。
任何一项不达标都视为无效提交,提升幅度不设上限,每条记录都会链接到获得该成绩的提交 commit,保证可追溯、可复现。
硬件与现状
赛道运行在专用 GPU 机器上,目前披露的设备包括 NVIDIA DGX Spark GB10 与 AMD Radeon AI PRO R9700,并会随平台扩展持续增加。提交本身永久免费,但硬件与运维需要资金支持。平台上线时显示「尚无已验证记录」,多条主流模型与运行时轨道仍处于「加载中」状态,首批成绩尚未出炉。
对开发者与开源生态的意义
对关注推理性能的开源社区而言,这种带硬性硬件约束与正确性校验的公开排名,填补了以往「博客晒数字、难以复现」的空白。它鼓励以提交 commit 而非 PR 描述来证明加速效果,并要求行为等价,避免在量化或近似优化中悄悄损失模型能力。随着更多硬件与模型轨道上线,有望成为推理侧工程优化的参考基准之一。
