开源
InternLM 开源 Intern-Decision 4B / 0.8B 结构化决策模型
书生 InternLM 发布基于 Qwen3.5-4B 微调的多模态结构化决策模型,支持一次前向返回多字段答案分布。
2026.09.26 · 周六约 2 分钟阅读
InternLM 在 Hugging Face 开源了两个结构化决策模型 Intern-Decision-4B 与 Intern-Decision-0.8B,均属于多模态版本。其中 4B 版本以 Qwen3.5-4B 为基座进行微调,可在一次前向传播中针对给定状态、问题 schema 以及可选图像,为每个字段输出候选答案的概率分布,定位偏向「结构化候选打分」而非开放式文本生成。
模型定位与输入输出
Intern-Decision 系列面向的是结构化决策场景,使用方式与传统 Chat 模型不同:
- 输入:共享 state(状态)、命名问题 schema、可选图像。
- 输出:对 schema 中每个问题返回一个答案分布,以类型化 JSON 返回。
- 不调用
generate(),不采样自由文本,也不把 gold answer 写入 prompt。
这一设计适合问卷式、表单式决策任务,例如给定一组候选选项,模型只需给出每项的相对概率,不需要生成完整回答。
推理流程
模型在推理时遵循一套固定流程来保证打分结果可复现:
- 保留问题与选项的原始顺序,将每个问题的选项映射到单 token 符号(A–Z、a–z、0–9)。
- 按照 checkpoint 自带的对话模板和空 thinking block,渲染系统提示、state、决策 schema,并在 assistant JSON 骨架里为每个字段放置一个
<decision>占位符。 - 在 Hugging Face 上执行一次因果语言模型前向传播,从每个占位符「前一个位置」的 logits 读取决策目标。
- 仅对该字段允许的候选符号 logits 做 softmax,再叠加 checkpoint 自带的概率校准。
- 将符号映射回原始选项值,得到类型化 JSON 答案。
资源与后续关注点
目前 Intern-Decision-4B 已开放 Demo、Model Weights 与 GitHub 仓库链接,Intern-Decision-0.8B 的详细页面也已上线 Hugging Face。由于面向的是结构化打分而非通用对话,benchmark 数据、跨任务泛化能力以及与现有工具(如 LLM-as-a-Judge、分类器)之间的效果对比,是后续值得关注的重点。
