arXiv 新文:面向异构边缘设备的可迁移 LLM 延迟预测框架
论文将推理请求建模为硬件-运行时-模型-提示配置,分 prefill 与 decode 阶段,通过门控模型融合静态描述符…
近日发表于 arXiv 的论文《Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices》提出了一套面向部署的 LLM 推理延迟预测框架,旨在解决大模型在异构边缘设备上落地时延迟难以预估的问题。研究指出,边缘端 LLM 推理延迟受到模型架构、提示行为、运行时后端、硬件利用率、动态电压频率调节(DVFS)以及热变化等多重因素影响,单纯依赖静态描述符难以刻画真实表现。
框架核心思路
论文将每一次推理请求表示为一个「硬件-运行时-模型-提示」四元组配置,并把推理过程拆分为 prefill(预填充)与 decode(解码)两个阶段分别建模。在此基础上,框架通过一个门控预测模型(gated prediction model)自适应地融合静态描述符与来自设备的动态硬件遥测数据,从而在静态基线之上引入运行时感知能力。
主要实验结果
研究团队在 Pixel 系列手机、Jetson Nano、Orange Pi 5 Pro 以及 RTX 3090 级 GPU 平台上对框架进行了评估:
- Pixel 8:相比仅使用静态特征的基线,总延迟 R² 从 0.953 提升到 0.960,解码阶段延迟 R² 从 0.957 提升到 0.973。
- Pixel 8 Pro:预填充阶段延迟 R² 由 -1.383 大幅提升到 0.966。
- 跨设备迁移:在经过轻量校准后,从 Pixel 8 Pro 迁移到 Pixel 8 时,总延迟 R² 由 -0.974 提升到 0.940,解码阶段 R² 由 -1.085 提升到 0.927。
异构平台的延迟差异
论文还在不同硬件上对同一 SmolLM2 模型族做了剖面对比,结果显示延迟高度依赖设备与运行时:同一模型在 Orange Pi 5 Pro 上仅达到 8.42 tokens/s,而在 RTX 3090 级 GPU 上可达 64.38 tokens/s,两者差距接近一个数量级,进一步说明了运行时感知预测的必要性。
意义与局限
研究认为,结合运行时感知与轻量校准的延迟预测方法,可以在减少剖面(profiling)成本的同时,为异构边缘平台上的 LLM 选型与部署提供更可靠的依据。但该工作聚焦于边缘部署场景,且实验设备以中低端移动与嵌入式平台为主,对大规模数据中心 GPU 的适用性仍有待进一步验证。
