Fireworks AI 用 Anthropic J-Lens 探针检测开源模型内部表征
Fireworks AI 在 Kimi K3 与 Qwen 3.5-9B 两款开源模型上测试 Anthropic 的 J…
AI 基础设施公司 Fireworks AI 在 X 平台发布消息称,其团队使用 Anthropic 提出的 J-Lens 探针(J-Lens probe),对两款开源模型——Kimi K3 与 Qwen 3.5-9B 进行了内部状态观测实验。实验结果显示,这两个模型在首个 token 输出之前,内部表征中就已经「准备好了」与后续生成内容对应的词汇信息。Fireworks AI 表示已将相关研究整理成文并附上了链接,但未在推文中披露更多技术细节。
什么是 J-Lens 探针
J-Lens 是 Anthropic 提出的针对大语言模型内部表征的诊断工具。与传统只看模型输入输出行为的方法不同,J-Lens 通过读取模型隐藏层(hidden states)的激活向量,反推模型在生成过程中「预想到了哪些词汇」。这一思路来自机械可解释性(mechanistic interpretability)方向,旨在从模型「大脑内部」观察其推理准备过程,而不仅仅依赖输出文本反推意图。
在开源模型上复现的发现
Fireworks AI 此次并非 J-Lens 工具的提出者,但其在两款主流中文系开源模型上做了实测:
- 模型对象:Kimi K3(Moonshot)与 Qwen 3.5-9B(阿里通义千问系列)。
- 实验方式:观察模型在解码阶段的内部激活,关注首个 token 出现前的表征分布。
- 主要结论:在内容真正落到页面之前,模型的内部状态已经隐式「写入」了后续可能使用的关键词汇。
这一观察支持了一个此前主要来自闭源模型研究的假设——大模型并非在生成时才开始「构思」,而是早在第一个可见字符之前,词汇层面的计划就已在隐藏层中成型。
意义与局限
对开发者与可解释性研究者而言,J-Lens 类工具在开源权重模型上可用,意味着此类内部探查不再局限于少数闭源系统。但本次披露信息仍较简短,缺少具体的层号、对照实验、量化指标等关键细节,结论的普适边界尚不清晰。Fireworks AI 将完整研究报告以链接形式附在原帖中,感兴趣的读者可前往查阅。
