开源
4B 决策模型 Mica v0.1 开源,方块任务大幅领先 Kev 4B
开发者发布 Mica v0.1 4B 决策模型,在俄罗斯方块三个种子下清行数显著超越 Kev 4B,权重与代码已开源。
2026.09.26 · 周六约 3 分钟阅读
一名开发者在 Reddit 的 r/LocalLLaMA 板块公布了自研 4B 参数决策模型 Mica v0.1-4B,并将其与同规模基线模型 Kev 4B 在俄罗斯方块任务上做了同条件对比。结果显示 Mica 在所有三个测试种子上都明显领先,且已同步释放权重与代码。
项目背景与规模
作者将 Mica 定义为「决策模型」,而非典型文本生成模型:它只读取一次输入,并直接从 logits 中选择动作,而不进行文本输出或链式思考。训练与全部实验都在租来的 RTX 3090 上完成,总花费约 30 美元,是一个典型的轻量化个人项目。
实验设置
- 模型规模:均为 4B 参数(Mica v0.1 vs Kev 4B)。
- 硬件:单张 RTX 3090。
- 输入:每回合给两个模型相同的棋盘状态与 4 个候选落点,每个候选附带简短描述(清行数、孔洞、堆叠高度)。
- 决策方式:模型直接选择 1 个落点,没有搜索或前瞻。
- 棋盘与种子:使用相同的俄罗斯方块游戏与相同的方块序列,跑了三个不同种子。
关键结果
三个种子下两位模型的清行数对比:
- Seed 7:Mica 33 行 vs Kev 27 行
- Seed 11:Mica 97 行 vs Kev 17 行
- Seed 23:Mica 93 行 vs Kev 11 行
Kev 在三个种子中均「顶满」(top out,即无法继续落子),而 Mica 在 Seed 11 与 Seed 23 中撑过了全部 250 个方块未死亡。此外,在「是否选中当前最优落点」这一指标上,Mica 的命中率约为 75%,Kev 约为 50%。作者还贴出一段 Seed 11 的演示视频,截取前 100 个方块:Kev 在第 86 个方块时顶满,而此时 Mica 已清 37 行仍在继续。视频中的概率条直接来自 Mica 的 logits。
资源与复现
局限与意义
该工作属于个人业余项目的范畴,训练成本极低、评测任务单一(仅俄罗斯方块),对通用 AI 行业格局影响有限。但对关注小规模决策模型、轻量训练流水线和本地部署的社区而言,它提供了一个可复现的开源样例:完整的权重、代码与多种子对比数据均已公开,方便他人验证或在此基础上扩展任务。
