桃子桃子快讯
←返回首页
开源

Mica v0.1 4B 开源决策模型:8GB 显卡可跑,训练成本不足 30 美元

基于 Qwen3.5-4B 的 LoRA 微调决策模型,专为 agent 循环中的判别/路由设计,Apache-2.0…

2026.09.26 · 周六约 5 分钟阅读

开发者 akivet 在 Reddit 公布了 Mica v0.1 4B,这是一个面向 agent 循环的轻量级开源决策模型,采用 Apache-2.0 协议。它专门用于在智能体工作流中回答「是否执行」「选择哪个分支」「打分」之类的判别问题,不生成自由文本,只输出校准后的概率分布。该模型基于 Qwen3.5-4B,通过 rank-16 LoRA 对全部 32 层(含 attention 和 Gated DeltaNet)进行微调后合并而成,因此可直接当作普通 Qwen3.5-4B 检查点使用。整个训练加上全部实验,花费的租用 GPU 时间(RTX 3090)不足 30 美元。

模型能力与接口

Mica 的输入是一个状态描述、一道问题以及允许的选项集合,输出是每个选项的校准概率,支持以下三种模式:

  • 是/否(yes/no)
  • 在 2 至 255 个选项中做选择
  • 2 至 10 档的评分

它运行一次 prefill 后直接读取答案位置的 option label logits,不做文本生成。接口上兼容 TypeSafe 的 /v1/systemone 格式,因此为 Jev 编写的调用代码可以直接对接 Mica。该模型以 GGUF 形式发布,配合 llama.cpp 服务端使用直读 logits 的推理路径,在 RTX 3090 上单请求中位延迟如下:

  • Mica Q4_K_M:47 ms
  • Mica BF16:54 ms
  • Kev 4B:76 ms
  • JevK5 4B:99 ms
  • Nimble 9B:132 ms

量化版本 Q5_K_M 仅 3.5 GB,可在 8 GB 显存的 GPU 上运行,且在作者校准集上与 BF16 无可测量的精度损失。

训练数据与基准成绩

训练集包含约 3.4 万条原始决策样本,扩增后得到 77,732 条训练行、约 3470 万 token,英文与韩语约各半,覆盖编码 agent、代码评审、计算机使用、用户请求、文档、策略规则、日期与数量、路由、状态追踪、游戏和通识共 12 个领域。训练采用普通交叉熵损失,对已验证答案进行一个 epoch 的训练,并使用统一的全局温度参数做概率校准。

在冻结训练数据后保留的 7,328 条 held-out 决策上(英文子集),各模型成绩为:

  • Jev 1.13(闭源 API):74.1
  • Mica 4B:67.0
  • JevK5 4B:61.0
  • Kev 4B:57.0
  • Qwen3.5-4B 基座(同读法):55.0

在统一 prompt 与读法下,多个公开集的对比(Mica / Jev 1.13 / JevK5 / Kev 4B)为:

  • JevBench hard(公开 111 题):69.5 / 74.3 / 76.2 / 52.4
  • SemIf:94.4 / 98.4 / 86.1 / 89.3
  • Kev transfer v9:69.2 / 82.0 / 70.5 / 73.5
  • MMLU-Pro(10k 题):53.0 / 82.3 / 53.5 / 49.7

在通过 JevBench 官方 runner 与 llama.cpp 服务端跑的密封评测中,Mica 在 public hard 档得 64.9,作者已提交官方密封复跑。

抗注入与校准表现

作者重点强调了 Mica 在「in-data prompt injection」上的鲁棒性:在状态描述里插入一条提示、要求判别者故意选错时,Mica 仍有 69% 的正确率(无提示时为 81%),而 Jev 跌至 18%,Kev 为 31%。在概率校准方面,held-out 集上 Mica 输出 ≥0.9 时的实际错误率仅 2.5%,整体 ECE 为 5.4%。

已知局限

作者也坦率列出了 Mica 的不足:

  • 知识密集型题较弱,MMLU-Pro 上仅为 53,远低于 Jev 的 82,毕竟 4B 判别模型不是百科全书。
  • 长篇英文策略文档是其公开集上的最弱项。
  • 状态内的提示仍有影响——一条指向正确答案的提示可将准确率抬到 89%。
  • 难以区分可逆与不可逆操作,例如「删除文件」与「把文件移到回收站」在「是否先确认」一项上都得到约 0.8 的概率。
  • 在更难的推理题上判断正确但置信度不如 Jev(某排序题中给出 0.55 对比 Jev 的 0.96),使用者应据此调整阈值。

获取方式

README 中提供一行 Docker 启动命令与 curl 调用示例。作者表示最希望改进的方向是「行动还是反问用户」这类含糊场景的判别。

信源