HALLUCINATIOFF:面向 LLM 输出的递归式中间件
一款早期开源中间件,通过多维读数与「二阶观察」检测 LLM 回复的语义漂移与前提缺陷,当前仅在 20 个合成用例上达到…
一款名为 HALLUCINATIOFF 的开源中间件试图在 LLM 与用户之间增加一道「监管层」:它不训练模型、不修改权重,而是在回复抵达用户前对其进行多维评估,并据此决定直接发出、带谨慎提示发出、改写、要求补充上下文、降低强度、转介、暂停或拦截。该项目借鉴自所谓「SIIPP」(Sistema Integral de Intervención Psicofísica)这一临床身体实践框架,强调「二阶观察」——即不仅判断回复是否前后一致(一阶),还要观察判断标准本身是否变得不稳定(二阶)。
核心机制:8 项结构化读数
HALLUCINATIOFF 将候选回复拆解为 8 项结构化读数,每项输出一个 0–1 的分数,再汇成一个综合指标 Ω,最终由操作矩阵映射到具体动作。8 项读数分别为:
- SC:上下文充分性
- CI:内部一致性
- V_ext:外部可验证性
- AE:入口歧义度
- NI:不确定性水平
- RR:回复风险
- DS:语义漂移(v0.2 引入)
- IP:前提质疑(v0.3 引入)
Ω 计算器采用「带交互惩罚项的动态权重」,并由操作矩阵给出 8 种可选动作。
版本与能力现状
项目目前公开三个版本:
- v0.1:6 项基础读数,作者报告在 20 个合成用例上达到 95% 准确率;
- v0.2:新增语义漂移(DS)读数,无公开基准;
- v0.3:新增前提质疑(IP)读数,无公开基准。
在工程实现层面,读数引擎依赖「正则与计数启发式」,语义漂移通过关键词相似度与话题检测实现,前提质疑基于「个体化框架检测」。所谓的「二阶元观察器」目前仍停留在规格层面,尚未实现。
基准与局限
作者明确承认:v0.1 的基准仅含 20 个合成用例,且只覆盖 6 项读数,「不证明可用于生产,只验证 6 读数架构在构造用例上不会拖累表现」。唯一的失败案例是第 2 例(事实性幻觉)——外部可验证性 V_ext 给出虚高的 0.7,系统错误地选择直接发出而非带谨慎提示。
项目同时列出三件尚未解决的事:
- 需要真实的多轮对话数据,并人工标注其中的语义漂移;
- 需要把「相位耦合」「吸引子」等概念用动力系统语言形式化,落到 embedding 序列上;
- 需要真正实现二阶元观察器,即让系统观察自身一致性判断的方差。
评价
HALLUCINATIOFF 的概念框架(多阶观察、心理物理学启发)有一定新意,但就当前公开版本而言,它更像是一个早期个人项目:检测手段以正则与关键词相似度为主,基准仅 20 个合成用例,二阶元观察器尚未落地,也没有任何大厂或第三方背书。对于希望降低 LLM 输出风险的工程团队来说,更稳妥的选择仍是经过大规模真实数据验证的现成方案;该项目可作为思路参考,但短期内不建议用于生产链路的关键节点。
