桃子桃子快讯
返回首页
研究论文

Reddit 推出 FlightSimulatorBench:小尺寸 MoE 模型创意编码横评

r/LocalLLaMA 用户用单题提示测试多款本地小模型生成 HTML 飞行模拟器的能力,给出推理参数与失败重试机制。

2026.07.22 · 周三3 分钟阅读

一名 Reddit 用户在 r/LocalLLaMA 板块发布了名为 FlightSimulatorBench 的单题基准,通过让模型一次性生成「包含山脉、云层和无限程序化地形的飞行模拟器」HTML 文件,对比多款本地可运行的小尺寸 MoE 模型在创意编码任务上的表现。测试在 48GB 内存的 Mac 上进行,推理框架为 oMLX,硬件由 Pi 提供。

参测模型与量化方式

本次横评覆盖以下模型(均来自作者在 Hugging Face 上整理的 48GB Mac 本地 SOTA 集合):

  • Qwen3.6-27B(4bit 量化)
  • Qwen3.6-MoE(6bit 与 4bit 两种量化)
  • HuiHui-Qwen3.6-MoE(6bit,去对齐版)
  • Ornith-1.0-35B(6bit)
  • Gemma-4-26B(6bit)
  • Agents-A1(6bit)

部分模型名称在主流开源社区中尚未见公开权重,例如 Qwen3.6 与 Gemma-4-26B,读者参考时需注意其真实性与可复现性。

推理参数设置

不同模型族使用了差异化的采样参数:

  • Qwen3.6 与 HuiHui 去对齐版:temperature 0.6、top_p 0.95、top_k 20、min_p 0.01、repeat_penalty 1.05
  • Ornith-1.0-35B:temperature 1.0、top_p 1.0、top_k 40、min_p 0.01、repeat_penalty 1.05
  • Gemma-4:temperature 1.0、top_p 1.0、top_k 64、min_p 0.01、repeat_penalty 1.1
  • Agents-A1:temperature 0.85、top_p 0.95、top_k 20、min_p 0.01、repeat_penalty 1.05

测试方法

所有模型均采用单条提示词「Create a beautiful, relaxing flight simulator in a single html file with mountains, clouds, and endless procedural terrain」一次性生成 HTML 文件。若生成结果无法运行,则丢弃输出、重启 Pi 会话并让模型重新开始,每个模型最多尝试 3 次。

结果呈现与局限

原帖以 GIF 形式展示各模型的渲染效果,但未提供量化的成功率、可运行比例、代码长度或功能完成度等可比较指标。基准仅有一道题目,评测面较窄,难以据此判断模型综合能力。该帖子更接近社区玩家的兴趣分享,而非可复现的学术评测。

信源