桃子桃子快讯
返回首页
工具

每日更新的 LLM 性价比榜单:基于价值前沿的选型工具

开发者基于 Artificial Analysis 智能指数与 API 价格,搭建每日自动更新的性价比工具,自动识别「价…

2026.09.24 · 周四3 分钟阅读

AI 模型评测机构 Artificial Analysis 的智能指数(Intelligence Index)已成为衡量大语言模型能力的重要参考。一名开发者基于其开放 API 构建了一个名为「Best LLM for every budget」的交互式工具,每日自动更新所有主流模型的「性能 vs 价格」对比,并自动识别「价值前沿」上的最优模型,为不同预算的开发者提供选型参考。

核心思路:价值前沿(Value Frontier)

工具的核心是绘制「性价比前沿曲线」:横轴为混合 API 价格(输入输出 3:1 加权、每百万 token 美元计价、对数刻度),纵轴为 Artificial Analysis 智能指数。曲线上的每一个点代表「在同价位下没有更聪明的模型」,即再便宜就打不过、再贵也不划算的最优选择;曲线下方的所有点都处于「被支配」状态——存在更便宜的替代品同时表现相当或更好。

两种使用方式

工具提供两种视图:

  • 散点图视图:横轴为对数刻度的混合 API 价格,纵轴为智能指数。默认仅显示每个模型的最佳变体(推理 effort 最高、得分最高),得分低于 30 的模型默认隐藏,可通过筛选器扩展范围。
  • 预算速查表:按价格分桶列出每个预算档位的「最优选择」与「次优备选」,帮助开发者在给定预算内快速锁定目标模型。

附加数据维度

页面还提供以下模块:

  • Raw capability:完全忽略价格的纯能力排名。
  • What changed:与上一次抓取相比的新增、移除或重新评分 / 重新定价模型。
  • All figures:完整数据表,可按列排序,包含 Intelligence、Coding、Math 三项得分,以及输入价、输出价、生成速度(tokens/s)与首 token 延迟(TTFT)等字段。

使用说明与局限性

作者在「How to read this」中明确了几点:

  • 混合价格采用 3:1 输入输出比例,不包含缓存输入折扣、批处理价与极速模式价格。
  • **「One row per model」**模式仅保留每个模型中得分最高的变体;取消勾选后可查看 low、medium、high、xhigh、max 等不同推理 effort 的全部变体。
  • **「Min score」**过滤项会从图表与前沿计算中隐藏低于该分数的模型,避免低价但能力极弱的旧模型锚定曲线。
  • 得分基线会变:Artificial Analysis 每次版本更新都会重新基线化智能指数,因此不同日期页面的得分不能直接横向对比,需以同日页面为准。

数据来源与开源

数据来自 Artificial Analysis 免费 API,由 GitHub Actions 定时任务每日抓取,代码与数据完全开源,仓库地址为 github.com/terryds/bestvaluemodel。开发者可自行部署或基于此模板做二次分析。

信源