Cactus 发布 14MB 端侧智能体模型 Needle 2
Cactus 推出 Needle 2,仅 14MB、4500 万参数 2bit 量化,可在手机、VR 设备与 IoT 端…
Cactus 团队近日推出 Needle 2,这是一款面向手机、可穿戴设备、智能家居与小型机器人的超轻量端侧大语言模型。整个模型为单个 14MB 二进制文件,运行时仅占用 28MB 内存,采用 4500 万参数配合 2bit 量化压缩,专门用于工具调用、设备操控与结构化抽取等任务。
性能与覆盖设备
Needle 2 在不同档位的边缘设备上均能保持较高推理速度:
- Raspberry Pi 5:解码速度约 500 tokens/sec
- Meta Quest 3S、Apple Vision Pro 等 VR 设备:400–1500 tokens/sec
- 售价 200 美元以下的三星 A 系列手机:300–700 tokens/sec
Cactus 表示,在工具调用与移动设备操控基准测试中,Needle 2 与 LFM2.5 230M、Apple Foundation Model 等同体量小模型表现相当,而模型体积仅为后者的 1/5 至 1/70。需指出的是,对比模型采用 f16 精度,Needle 2 以 2bit 精度运行。
架构与能效
Needle 基于 Cactus 团队提出的「Simple Attention Networks」(简单注意力网络)架构,相关论文已发布于 arXiv(编号 2607.18363)。官方给出的数据是:同等宽度与深度下传统 Transformer 每 token 消耗 164 MFLOPs,即便压缩到 Needle 的参数量仍需 87 MFLOPs,而 Needle 每 token 仅消耗 70 MFLOPs。
Cactus 强调,边缘 AI 长期以来主要指 Mac、PC 上的运行场景,但这在全球约 210 亿台联网 IoT 设备中只占约 15 亿;新兴市场大量出货的手机售价低于 200 美元、不配备 NPU、GPU 性能有限。对于这些设备上的「始终在线」助手而言,能耗预算极为紧张,每 MFLOP 都对应毫瓦时电量,而 Needle 2 每 token 消耗的 MFLOPs 比现有最小的高性能 LLM 还要少 7 到 85 倍。
能力定位与微调方式
Cactus 的研究将面向消费设备的智能拆解为带类型参数的函数,认为此时唯一困难的部分是把一句自然语言映射到正确的函数与参数;这一步不需要世界知识,也不需要开放式生成,因此 4500 万参数已足够。Needle 2 还支持结构化抽取,即以 schema 代替工具定义并由模型返回结构化结果,因此也可作为文本分类或摘要模型使用,但不支持自由文本生成。
用户可通过官方 Python 包在 Mac 或 PC 上对 Needle 进行微调,配套有自动化数据生成流水线,开发者只需提供少量样本,即可在数分钟到数小时内完成针对自有工具词汇的微调。模型每次响应还会附带基于「Cactus Hybrid」技术学得的置信度分数,开发者可据此决定本地直接执行,还是升级到云端或更大模型处理。Cactus 提到,将 Needle 2 与私有化部署的 DeepSeek-V4-Flash 结合,可在企业级任务上以极低成本取得较好效果,并表示可协助完成该方案的部署。
