研究论文
Reddit 推出 FlightSimulatorBench:小尺寸 MoE 模型创意编码横评
r/LocalLLaMA 用户用单题提示测试多款本地小模型生成 HTML 飞行模拟器的能力,给出推理参数与失败重试机制。
2026.07.22 · 周三约 3 分钟阅读
一名 Reddit 用户在 r/LocalLLaMA 板块发布了名为 FlightSimulatorBench 的单题基准,通过让模型一次性生成「包含山脉、云层和无限程序化地形的飞行模拟器」HTML 文件,对比多款本地可运行的小尺寸 MoE 模型在创意编码任务上的表现。测试在 48GB 内存的 Mac 上进行,推理框架为 oMLX,硬件由 Pi 提供。
参测模型与量化方式
本次横评覆盖以下模型(均来自作者在 Hugging Face 上整理的 48GB Mac 本地 SOTA 集合):
- Qwen3.6-27B(4bit 量化)
- Qwen3.6-MoE(6bit 与 4bit 两种量化)
- HuiHui-Qwen3.6-MoE(6bit,去对齐版)
- Ornith-1.0-35B(6bit)
- Gemma-4-26B(6bit)
- Agents-A1(6bit)
部分模型名称在主流开源社区中尚未见公开权重,例如 Qwen3.6 与 Gemma-4-26B,读者参考时需注意其真实性与可复现性。
推理参数设置
不同模型族使用了差异化的采样参数:
- Qwen3.6 与 HuiHui 去对齐版:temperature 0.6、top_p 0.95、top_k 20、min_p 0.01、repeat_penalty 1.05
- Ornith-1.0-35B:temperature 1.0、top_p 1.0、top_k 40、min_p 0.01、repeat_penalty 1.05
- Gemma-4:temperature 1.0、top_p 1.0、top_k 64、min_p 0.01、repeat_penalty 1.1
- Agents-A1:temperature 0.85、top_p 0.95、top_k 20、min_p 0.01、repeat_penalty 1.05
测试方法
所有模型均采用单条提示词「Create a beautiful, relaxing flight simulator in a single html file with mountains, clouds, and endless procedural terrain」一次性生成 HTML 文件。若生成结果无法运行,则丢弃输出、重启 Pi 会话并让模型重新开始,每个模型最多尝试 3 次。
结果呈现与局限
原帖以 GIF 形式展示各模型的渲染效果,但未提供量化的成功率、可运行比例、代码长度或功能完成度等可比较指标。基准仅有一道题目,评测面较窄,难以据此判断模型综合能力。该帖子更接近社区玩家的兴趣分享,而非可复现的学术评测。
