桃子桃子快讯
返回首页
研究论文

LoopLynx:面向 LLM 推理的可扩展 FPGA 数据流架构

研究团队提出 LoopLynx 架构,在 FPGA 上加速 LLM 推理:双 FPGA 配置相对 NVIDIA A100…

2026.07.28 · 周二2 分钟阅读

LoopLynx 是一项面向大语言模型(LLM)推理的 FPGA 加速架构,由研究团队于 2025 年 4 月 13 日在 arXiv 发布,论文编号为 2504.09561,主题分类为硬件架构(cs.AR)。该工作提出了一种可扩展的数据流架构,目标是在 FPGA 上高效运行 LLM 推理,并缓解单设备资源受限的瓶颈。

核心设计:混合时空架构

LoopLynx 采用混合时空(spatial-temporal)架构。论文将计算密集型算子实现为大型数据流核(dataflow kernel),借助空间架构的高并行度获得高吞吐量;同时在时间维度上对这些核进行组织与复用,进一步压榨 FPGA 的峰值性能。这一设计试图兼顾空间架构的并行优势与时间架构的资源复用能力。

多 FPGA 分布式扩展

为突破单芯片资源限制,研究者进一步设计了多 FPGA 分布式架构。该方案通过充分重叠和隐藏数据传输,使分布式加速器得以被完全利用,从而支持跨设备的模型并行。论文称,LoopLynx 可以有效扩展至多设备,应对大规模 LLM 推理需求。

性能评估

团队在 GPT-2 模型上对 LoopLynx 进行了评测,主要结论如下:

  • 在单 FPGA 配置下,LoopLynx 的性能与现有最优的单 FPGA 加速方案相当;
  • 在双 FPGA 配置下,相比 NVIDIA A100,推理延迟获得 2.52 倍加速,同时能耗仅为 A100 的 48.1%。

意义与局限

这一工作为 FPGA 加速 LLM 推理提供了新思路,并在能效比维度展现出可观优势。但需要指出的是,评测目前仅基于 GPT-2 这一相对早期的模型,且属于研究阶段,距离工业级部署仍有距离。对于关注绿色推理、定制硬件方案与异构计算的开发者及研究者而言,LoopLynx 仍是一个值得跟进的方向。后续工作能否扩展到更大规模 LLM、并与专用 GPU/ASIC 方案形成对比,将决定其实际影响力。

信源