桃子桃子快讯
←返回首页
开源

Valen:面向决策的多模态开源小模型发布

Valen 团队开源多模态决策模型,采用 Qwen 0.8B/2B 骨干,输入文本、图像或视频后输出候选决策概率,附训练…

2026.09.25 · 周五约 3 分钟阅读

Valen(万澜)是一个面向「决策任务」的多模态开源小模型,主打把图像、视频与文本一起喂给模型,直接输出候选选项的概率分布,而不生成答案文本。该项目已在 Hacker News 社区发布,并在 Hugging Face 上提供模型权重,整体代码采用 Apache 2.0 协议开源。

模型架构与设计

Valen 并非从零训练一个大模型,而是基于 Qwen 系列的小尺寸骨干(0.8B 与 2B 两档)构建。在骨干之上,团队加入了一个共享的「决策头」,用于对候选答案进行打分。项目还引入了 RLCD 训练方式,把 SFT 与强化学习阶段串联起来。代码库同时提供了数据处理、训练、推理与评测脚本,并支持在自有数据上继续微调。需要注意的是,原文将骨干型号写作「Qwen3.5-0.8B/2B」,与目前公开的 Qwen 命名(Qwen2.5 与 Qwen3 系列)对不上,具体对应关系还需到仓库核实。

演示与对比

官方放出了多个 Demo 来展示 Valen 的行为。在一个推箱子类关卡中,Valen-Preview-0923 用 9 次决策、累计 1.13 秒延迟完成;用作对照的 27B 同代模型在「思考模式」下耗时 198.05 秒仍未解开,关闭思考模式则直接失败。在模糊图像测试中,清晰图下决策置信度约 91.6%,加最高强度高斯模糊后降至 19.2%,直观展示了模型对画面细节的依赖。并行跑四个游戏时,单步耗时 122–128 毫秒,四个任务在 1.24 秒内全部完成。

评测与数据

项目附带 General 与 Sokoban 两套评测。General 用 5,000 条来自多个 VQA 数据集的问题,Sokoban 用 500 道由 100 关单步推箱子样本组成的题集。仓库同时开源了 General 100k 训练集、General 5k 评测集,以及 Sokoban 的训练与评测数据,方便复现。从公开图示看,Valen 2B 的 RL 检点在小模型同档对比中表现出「更低延迟、更高准确率」的倾向,但具体数值需要到 Figure 与技术说明中读取。

快速上手

使用流程相对简洁:先安装 requirements 中列出的依赖,再用 hf download 拉取 Valen-Preview-0923 检点与对应的 Qwen 2B 基础模型;接着用 python -m valen.train 训练、valen.inference 推理、valen.evaluate 跑评测。仓库还附带了 data/smoke 小样本,可以快速验证流水线是否跑通。数据格式为 JSONL,每条记录包含一个 request(含图像或多模态消息)、若干 questions(候选打分项)以及 targets(目标概率),整体接口偏结构化「打分」而非对话生成。

小结

Valen 的定位不是通用对话或生成模型,而是给软件系统提供一个「看得懂图、选得出答案」的小型决策接口,主打推理延迟与决策置信度的可控性。对在做 Agent、自动化操作、游戏 AI 或具身决策方向、希望跑在本地小模型上的开发者来说,这是一个值得关注的项目;但对其规模与覆盖场景仍需保持合理预期。

信源