桃子桃子快讯
返回首页
开源

Cactus Hybrid:给 Gemma 4 加装置信度探针,端云协同仅回退 15–35% 查询

Cactus 团队为 Gemma 4 E2B 增加 68k 参数探针层输出置信度,仅将 15–35% 难查询回退至 Ge…

2026.07.23 · 周四3 分钟阅读

Cactus 团队近期发布名为 Cactus Hybrid 的开源方案,针对 Gemma 4 E2B 这类端侧小模型易出错、云端大模型成本高的矛盾,提出基于「置信度探针」的端云协同路由思路:模型在每条回复中附带 0 到 1 的置信度分数,高置信度本地接受,低置信度再回退到云端大模型。官方数据显示,仅将 15–35% 的查询回退给 Gemini 3.1 Flash-Lite,整体表现即可在多数基准上追平该云端模型。

不同基准的回退比例

  • ChartQA:15–20%
  • LibriSpeech:25–30%
  • MMBench、GigaSpeech、MMAU:30–35%
  • MMLU-Pro:45–55%

探针设计:读隐状态而非解析文本

过去混合应用依赖两种「自知」信号:让模型用文字自评打分(团队认为不可靠,且需解析自然语言),或用 token 熵做启发式(团队测试下来接近随机)。Cactus 改从模型内部隐藏状态入手:先在 Gemma 4 上做机制研究,发现不同层隐藏状态对「自我认知」携带有效信号。

最终方案是一层仅 68k 参数的探针:

  • LayerNorm + 低秩投影 + 注意力池化 + 小 MLP 头
  • 在解码过程中读取一个中间层,输出 p(wrong)
  • 置信度 = 1 − p(wrong),以结构化字段返回,而非从回答文本中解析

跨模态一致的有效性

在覆盖文本、视觉、音频的 12 个 hold-out 基准上,该探针平均 AUROC 达到 0.814,而 token 熵仅为 0.549。更值得注意的是,探针训练数据中完全不包含音频,但在四个音频基准上仍取得 0.79–0.88 的 AUROC,而熵在这些基准上几乎接近随机(0.32–0.52)。团队认为这说明探针读取的是一种模态无关的正确性信号,而非对训练数据的简单记忆。

开源与部署

Cactus 已在 HuggingFace 发布全部权重,代码以 MIT 协议开源(Gemma 权重仍受 Gemma 协议约束)。目前已支持以下推理框架:

  • Transformers
  • MLX
  • Llama.cpp(需打补丁编译,后续计划上游合并)
  • Cactus

Ollama、vLLM、SGLang 等适配在进行中。

现存局限

  • 探针仅支持单序列解码,且只覆盖前 1024 个生成 token
  • 路由策略最适合「按任务」而非「按步骤」回退;在多步流程中表现最佳
  • 团队仍在推进分层路由:先尝试端侧,再 DeepSeek v4 Flash,最后才考虑 Fable / GPT5.5 / Gemini / Muse / Grok 等更强模型
  • 探针对每个模型是「定制化」的,每发布一个新模型权重会同步推出对应版本

该方案对希望降低云端推理成本、又不愿牺牲太多质量的端侧 LLM 应用开发具有参考价值;其「从隐藏状态读取置信度」的设计思路也可被其他小模型借鉴。作者表示将持续更新权重与代码,欢迎社区反馈改进方向。

信源