开源
TinyJev:596M 参数的离线决策模型发布
基于 Qwen3-0.6B-Base 的 0.6B 参数模型,专注分类与打分而非文本生成,MIT 开源。
2026.09.23 · 周三约 3 分钟阅读
TinyJev 是一个 596M 参数(约 1.2 GB)的开源决策模型,基于 Qwen3-0.6B-Base 与 Jared Palmer 的 Kev 项目构建。它不生成文本,而是对用户给定的选项返回概率与置信度,适合在本地对结构化输入进行分类、打分或路由判断。模型权重已发布至 Hugging Face 与 ModelScope,Python 包同步上线 PyPI,采用 MIT 许可证。
核心能力
TinyJev 提供三种问题类型,均通过单次前向推理完成:
- choice(多选一):在 2–255 个命名选项中返回每个选项的概率分布,可附带描述。
- noul(真假判断):对给定命题返回一个「为真」的概率,用于布尔类决策。
- score(有序打分):将状态映射到用户定义的有序量表上,如「calm / frustrated / very angry」。
所有输出都附带校准后的置信度,用户可以设定阈值来决定是否交给人工处理,因此适合用于自动化分流等场景。
运行与性能
模型完全在本地运行,支持两条推理路径:
- MLX 路径:适用于 Apple Silicon,加载时可对主干进行 8-bit 或 4-bit 量化。
- PyTorch 路径:覆盖其他平台。
项目方在基础款 M1 上做了实测:每次推理约 110 ms,远低于 0.1 秒的演示基准。8-bit 量化可减半内存、速度略快,且在保留集上的得分与全精度一致;4-bit 进一步压缩,但精度损失约 2 个百分点。
典型用法
官方示例展示了三个落地场景:
- 客服工单分诊:对一条工单同时提问「哪个团队处理」「是否升级」「客户愤怒程度」,三道题共享同一上下文但互不可见。
- 前置安全过滤:在大模型调用前,对输入做 prompt injection 与凭据泄露检测,两个判断一次完成、无需联网。
- 模型路由:先评估请求难度,再决定走小模型还是前沿模型,简单任务不进入昂贵的推理链路。
此外,项目还提供本地 HTTP 服务,兼容 System One 请求格式,绑定 loopback、无鉴权,适合作为内部组件使用。
项目状态与后续
当前发布的 tinyjev-0.6b 已完成,权重、PyPI 包与本地服务均已就绪。官方表示下一步计划训练一个约 0.15B 参数的更小版本。模型底层基于 Qwen3-0.6B-Base(Apache-2.0),训练数据与评估套件来自 Kev(Apache-2.0),类型化决策接口的设计思路则借鉴了 TypeSafe 的 Jev。
