工具
轻量 LLM 推理引擎 PicoLM 发布 v1.0-rc2,覆盖从 DOS 到 iPhone 1 的极端平台
C99 编写的小型 LLM 推理引擎 PicoLM 更新到 v1.0-rc2,支持 Llama-2、GPT-2、Qwen…
2026.09.24 · 周四约 2 分钟阅读
PicoLM 是一个用 C99 编写的小型大语言模型推理引擎,近日作者在 Hacker News 发布了 v1.0-rc2 版本(代号「Yura Kana」)。该引擎强调 CPU 端的 SIMD 加速与跨平台可移植性,覆盖了从 DOS、经典 macOS(OS X 10.4)到现代操作系统的一系列平台,目标是在保持可移植性的前提下提供尽可能快的文本生成速度。
支持的模型与架构
v1.0-rc2 当前支持以下模型架构:
- Llama-2
- GPT-2
- Qwen 3.6 / 3.8(含 MoE 变体)
- Gemma-3n
作者表示,引擎的核心代码用纯 C99 编写,以牺牲一定的抽象为代价换取更广泛的平台兼容性。
极端的跨平台覆盖
PicoLM 把「跨平台」做到了较为罕见的程度。根据发布说明,v1.0-rc2 的已测试平台列表进一步扩张,其中包括:
- 经典 Unix 系统:Digital Unix(Tru64)
- 移动设备:iPhone 1
- 老旧 PC 环境:DOS
- 现代桌面:macOS、Linux、Windows
作者特别提到,在整个开发过程中持续进行回归测试,目的就是「永远不丢掉可移植性」。
加速后端与性能现状
在计算加速方面,PicoLM 提供:
- CPU SIMD 加速路径,并配套测试与正确性验证
- NVIDIA CUDA 后端
- AMD HIP 后端
- 加速版 IMMA 内核
- 新增的 Vulkan 后端(仍在完善中)
作者坦承,prompt 处理(prefill)速度仍有较大优化空间,但当前文本生成(decode)速度已经「相当快」。
社区反响与定位
本次 Show HN 发布在 Hacker News 上仅获得 1 个得分、0 条评论,影响力十分有限。整体来看,PicoLM 仍属于个人维护的轻量级项目,其亮点集中在极端平台覆盖与纯 C99 实现上,而非性能极限或生态规模。对于需要在老旧或受限硬件上跑通 LLM 推理的开发者而言,它提供了少见的工程参考价值;对于主流应用与生产环境而言,则暂时缺乏直接竞争力。
