桃子桃子快讯
返回首页
模型发布

边缘模型 Needle 2 发布:14MB 体量主打低端手机与物联网

Cactus 发布第二代边缘大模型 Needle 2,14MB 大小、4500 万参数,主打手机、可穿戴与 IoT 设备…

2026.08.11 · 周二3 分钟阅读

Cactus 公司近日发布第二代轻量级大模型 Needle 2,整个模型仅为 14MB 的单一二进制文件,全会话运行只需 28MB 内存,瞄准的是手机、可穿戴设备、智能家居与小型机器人等资源受限的边缘场景。

模型规格与端侧性能

Needle 2 参数量为 4500 万,采用 2bit 压缩。在不同硬件上的解码速度大致如下:

  • 树莓派 5:约 500 tokens/sec
  • Meta Quest 3S、Apple Vision Pro 等 VR 设备:400–1500 tokens/sec
  • 三星 A 系列等 200 美元以下手机:300–700 tokens/sec

作为对比,同等宽深度的传统 Transformer 每 token 需消耗 164 MFLOP,即使压缩到 Needle 的参数量仍需 87 MFLOP,而 Needle 2 仅需 70 MFLOP。Cactus 表示,这意味着 Needle 2 比当前最小的高性能 LLM 每 token 节省 7 至 85 倍的能耗,更适合常驻运行的端侧助手。

架构与基准对比

Needle 2 基于 Cactus 团队发表的「Simple Attention Networks」论文(arXiv:2607.18363)。其核心思路是:当智能体能力被结构化为带类型参数的函数时,核心问题只是把自然语言映射到对应函数与参数值,这既不需要世界知识,也不需要开放生成,因此 4500 万参数已足够。

在工具调用与移动设备使用基准上,Needle 2 与 LFM2.5 230M、Apple Foundation Model 等主流小型模型表现相当,但体积仅后者的 1/5 到 1/70。需要注意的是,对比模型使用 f16 精度,而 Needle 2 使用 2bit 压缩。

边缘部署的真实场景

Cactus 指出,目前业界所说的「边缘 AI」通常指 Mac、PC 等算力较强的设备,但这仅占全球 210 亿台联网 IoT 设备中的 15 亿。新兴市场的大多数手机售价在 200 美元以下,没有专用 NPU,仅配备入门级 GPU。这些场景包括:

  • 廉价安卓手机
  • 树莓派与各类微控制器
  • 可穿戴设备
  • Reachy Mini 等小型机器人
  • 智能家居联网设备

Needle 2 的新特性

相比上一代,Needle 2 将能力扩展到结构化抽取:可以将 schema 作为工具直接传入,模型返回结构化输出。例如:

  • 用 enum 字段把 Needle 当作文本分类模型
  • 提供抽取关键字段的 schema,让 Needle 充当摘要模型
  • 模型不支持自由生成式解码,仅做结构化映射

此外,开发者可在 Mac 或 PC 上使用官方 Python 包(GitHub: cactus-compute/needle)对 Needle 进行微调,配合自动化数据生成管道,训练时间从几分钟到几小时不等。每个响应还会附带基于「Cactus Hybrid」技术的置信度评分:超过设定阈值则在本地执行,低于阈值则升级到云端或更大的模型处理,从而在端侧实现分级推理。

信源