AssBench:用单一复杂提示对比多款 LLM 的实际生成能力
作者推出 AssBench,以一项难以记忆答案的复杂 3D 生成任务横向对比多款主流模型,初步观察显示小模型也能接近前沿…
近期,独立作者 LLM 在 assbench.com 上线了一个名为 AssBench 的 LLM 端到端评测项目,主张用「一项任务、多个模型、多个时间点」的横向对比方式,更真实地衡量模型在复杂约束下的世界知识与推理能力。项目目前已收录 Anthropic、OpenAI、Google、xAI 等厂商共 19 条提交记录。
评测思路:拒绝可背诵的题目
AssBench 的核心论点是,传统 LLM 基准多以存在已久的谜题和游戏为题,存在被训练数据记忆的可能;而 AssBench 选择的题目在公开互联网上没有可直接复制的答案,需要模型在几何、光照、材质、交互与性能之间做权衡,因此更难通过记忆来「作弊」。
作者将任务抽象为:在限定库版本下生成一个自包含的 HTML 文件,使用 Three.js 完成一个具有明确几何、材质、交互与性能约束的 3D 场景,并在固定像素容器中稳定运行。该任务同时考察空间推理、约束整合与对自身输出质量的判断能力。
关键观察:小模型也能接近前沿
在已经提交的样本中,作者指出部分体积约小一个数量级的模型,其输出与前沿模型非常接近,个别情况下甚至更好。manifest 中显示,多数提交都使用了相关厂商的「最高档」推理设置,而 Claude Haiku 4.5 仍以默认设置一次跑通并得到可接受的结果。
由此延伸出一个对工程实践有参考价值的判断:模型规模有用,但并非对所有任务都必要。当任务是空间推理与受限环境下的代码组织时,结构更紧凑、专长更聚焦的小模型有机会以更低成本、更高速度给出可用结果;当前沿模型的额外开销并未带来明显收益时,它不一定是更经济的选择。
当前状态与局限
AssBench 为每条提交记录了模型 ID、推理设置、日期以及是否一次跑通,并计划在评审完成后按真实感、交互、物理与可靠性四个维度进行评分,总分 40 分。但截至文章发布,所有分数仍为 null,没有可引用的排行榜。
作者也坦承该基准覆盖范围较窄,仅反映特定类型的智能;对于真正需要大规模世界知识的任务,前沿模型仍然不可替代。对开发者而言,该项目目前更像是一种方法学示范——展示如何用统一、可复现的方式在多个模型间做成本与质量的对比,而不是一个权威排名。
