Cactus Hybrid:给 Gemma 4 加装置信度探针,端云协同仅回退 15–35% 查询
Cactus 团队为 Gemma 4 E2B 增加 68k 参数探针层输出置信度,仅将 15–35% 难查询回退至 Ge…
Cactus 团队近期发布名为 Cactus Hybrid 的开源方案,针对 Gemma 4 E2B 这类端侧小模型易出错、云端大模型成本高的矛盾,提出基于「置信度探针」的端云协同路由思路:模型在每条回复中附带 0 到 1 的置信度分数,高置信度本地接受,低置信度再回退到云端大模型。官方数据显示,仅将 15–35% 的查询回退给 Gemini 3.1 Flash-Lite,整体表现即可在多数基准上追平该云端模型。
不同基准的回退比例
- ChartQA:15–20%
- LibriSpeech:25–30%
- MMBench、GigaSpeech、MMAU:30–35%
- MMLU-Pro:45–55%
探针设计:读隐状态而非解析文本
过去混合应用依赖两种「自知」信号:让模型用文字自评打分(团队认为不可靠,且需解析自然语言),或用 token 熵做启发式(团队测试下来接近随机)。Cactus 改从模型内部隐藏状态入手:先在 Gemma 4 上做机制研究,发现不同层隐藏状态对「自我认知」携带有效信号。
最终方案是一层仅 68k 参数的探针:
- LayerNorm + 低秩投影 + 注意力池化 + 小 MLP 头
- 在解码过程中读取一个中间层,输出 p(wrong)
- 置信度 = 1 − p(wrong),以结构化字段返回,而非从回答文本中解析
跨模态一致的有效性
在覆盖文本、视觉、音频的 12 个 hold-out 基准上,该探针平均 AUROC 达到 0.814,而 token 熵仅为 0.549。更值得注意的是,探针训练数据中完全不包含音频,但在四个音频基准上仍取得 0.79–0.88 的 AUROC,而熵在这些基准上几乎接近随机(0.32–0.52)。团队认为这说明探针读取的是一种模态无关的正确性信号,而非对训练数据的简单记忆。
开源与部署
Cactus 已在 HuggingFace 发布全部权重,代码以 MIT 协议开源(Gemma 权重仍受 Gemma 协议约束)。目前已支持以下推理框架:
- Transformers
- MLX
- Llama.cpp(需打补丁编译,后续计划上游合并)
- Cactus
Ollama、vLLM、SGLang 等适配在进行中。
现存局限
- 探针仅支持单序列解码,且只覆盖前 1024 个生成 token
- 路由策略最适合「按任务」而非「按步骤」回退;在多步流程中表现最佳
- 团队仍在推进分层路由:先尝试端侧,再 DeepSeek v4 Flash,最后才考虑 Fable / GPT5.5 / Gemini / Muse / Grok 等更强模型
- 探针对每个模型是「定制化」的,每发布一个新模型权重会同步推出对应版本
该方案对希望降低云端推理成本、又不愿牺牲太多质量的端侧 LLM 应用开发具有参考价值;其「从隐藏状态读取置信度」的设计思路也可被其他小模型借鉴。作者表示将持续更新权重与代码,欢迎社区反馈改进方向。
