桃子桃子快讯
←返回首页
开源

4B 决策模型 Mica v0.1 开源,方块任务大幅领先 Kev 4B

开发者发布 Mica v0.1 4B 决策模型,在俄罗斯方块三个种子下清行数显著超越 Kev 4B,权重与代码已开源。

2026.09.26 · 周六约 3 分钟阅读

一名开发者在 Reddit 的 r/LocalLLaMA 板块公布了自研 4B 参数决策模型 Mica v0.1-4B,并将其与同规模基线模型 Kev 4B 在俄罗斯方块任务上做了同条件对比。结果显示 Mica 在所有三个测试种子上都明显领先,且已同步释放权重与代码。

项目背景与规模

作者将 Mica 定义为「决策模型」,而非典型文本生成模型:它只读取一次输入,并直接从 logits 中选择动作,而不进行文本输出或链式思考。训练与全部实验都在租来的 RTX 3090 上完成,总花费约 30 美元,是一个典型的轻量化个人项目。

实验设置

  • 模型规模:均为 4B 参数(Mica v0.1 vs Kev 4B)。
  • 硬件:单张 RTX 3090。
  • 输入:每回合给两个模型相同的棋盘状态与 4 个候选落点,每个候选附带简短描述(清行数、孔洞、堆叠高度)。
  • 决策方式:模型直接选择 1 个落点,没有搜索或前瞻。
  • 棋盘与种子:使用相同的俄罗斯方块游戏与相同的方块序列,跑了三个不同种子。

关键结果

三个种子下两位模型的清行数对比:

  • Seed 7:Mica 33 行 vs Kev 27 行
  • Seed 11:Mica 97 行 vs Kev 17 行
  • Seed 23:Mica 93 行 vs Kev 11 行

Kev 在三个种子中均「顶满」(top out,即无法继续落子),而 Mica 在 Seed 11 与 Seed 23 中撑过了全部 250 个方块未死亡。此外,在「是否选中当前最优落点」这一指标上,Mica 的命中率约为 75%,Kev 约为 50%。作者还贴出一段 Seed 11 的演示视频,截取前 100 个方块:Kev 在第 86 个方块时顶满,而此时 Mica 已清 37 行仍在继续。视频中的概率条直接来自 Mica 的 logits。

资源与复现

局限与意义

该工作属于个人业余项目的范畴,训练成本极低、评测任务单一(仅俄罗斯方块),对通用 AI 行业格局影响有限。但对关注小规模决策模型、轻量训练流水线和本地部署的社区而言,它提供了一个可复现的开源样例:完整的权重、代码与多种子对比数据均已公开,方便他人验证或在此基础上扩展任务。

信源