OpenUI 发布 LLM 生成 UI 基准:30 模型横评
OpenUI 发布生成式 UI 基准,横评 30 个模型的结构有效性与成本,并在 6 个模型上对比 OpenUI、A2U…
OpenUI 近日发布了一份面向「大模型生成 UI」能力的横向基准,覆盖 30 个模型的结构有效性(structural validity)与单任务成本,并在 6 个主流模型上对 OpenUI、A2UI、json-render 三种生成格式做了对比。基准共执行 1,104 次单屏渲染,结果显示 OpenUI 在渲染成功率与结构性正确率上均领先 A2UI 与 json-render。
30 模型横评:谁最准、谁最便宜
基准以「结构有效性 vs 单任务成本」构建帕累托前沿。结构有效性最高的模型集中在 99% 区间,且多数来自头部厂商:
- Grok 4.6(xAI):99.5%,单任务 $0.0185
- GPT-5.6 Sol(OpenAI):99.5%,$0.0476
- Claude Opus 4.8(Anthropic):98.9%,$0.0493
- Gemini 3.7 Flash(Google):98.9%,$0.0100
- Claude Sonnet 5(Anthropic):98.4%,$0.0202
- Kimi K3(Moonshot):96.2%,$0.0333
中段模型包括 Qwen3.8 2.4T(Alibaba,91.8%)、GLM-5.3(Zhipu,90.8%)、DeepSeek V4 Flash(DeepSeek,85.8%)。性价比方面,DeepSeek V4 Flash 与 Inkling Small(Thinking Machines)每任务成本均低于 $0.005,但结构性正确率随之下降。基准尾部模型如 Granite 4.1 8B(IBM,14.7%)、LFM 2.5 2.6B(Liquid,3.3%)则已基本不具备可用性。
三种格式对比:OpenUI 渲染最稳
在 6 模型 × 3 格式的子集中,OpenUI 渲染率 99.9%,仅 1 / 1,104 屏出现空白;A2UI 渲染率 96.6%,有 37 屏空白;json-render 渲染率 99.6%,4 屏空白。结构性有效率上,OpenUI 平均 96.9%,同样高于 A2UI 与 json-render。
按模型看格式差异:
- Claude Opus 4.8 在 OpenUI 与 json-render 上均达到 100% 渲染,A2UI 也实现 99.5% 结构有效,是跨格式最稳的模型。
- Gemini 3.7 Flash 在 json-render 上拿到 92.9% 结构有效,为该格式最高。
- Qwen3.8 2.4T 在 A2UI 上渲染率仅 91.3%(168/184),是六模型中最低。
成本与 token 效率
基准同时报告了单屏 46 次通过的「cost per pass」。OpenUI 整体成本约为 A2UI 的 1/2、json-render 的 2/3,token 用量也更少。最便宜的组合是 Gemini 3.7 Flash + json-render($0.85/屏)与 Gemini 3.7 Flash + OpenUI($0.42/屏);最贵的是 GPT-5.6 Sol + A2UI($6.84/屏)。
基准还引入了一个 sanitizer 模型对生成结果做行级增量修复,整体 88% 的破损行可在生成过程中被就地修补,进一步压低重试成本。完整数据以 JSON、CSV 与 agent Markdown 形式开放下载。
