桃子桃子快讯
返回首页
行业动态

AI 应用别再按 token 计价:定价应回归价值单元

评论指出 AI 应用层不应沿用模型层 token 计价,应按可识别的价值单元或业务结果定价,避免把基础设施成本结构直接传…

2026.08.27 · 周四5 分钟阅读

随着 ChatGPT 引爆生成式 AI 浪潮,大量应用层产品沿用了模型层 API 的 token 计价方式。但行业评论认为,将 token 作为应用层计费单位会把基础设施成本结构原样搬进客户关系,并把产品价值锚定在一个成本持续下降的计量单位上。正确的做法,是按客户能够识别的价值单元(如完成的工作量或业务结果)来定价。

从模型层到应用层:定价逻辑应该分开

2020 年 OpenAI 推出 API 时,按模型推理所消耗的计算量以 token 计费是合理的基础设施计费方式。然而 ChatGPT 问世后,涌现出大量将模型与专有数据、工具、编排和工作流结合、直接替客户完成工作的应用产品。当这类应用继续用 token 计价时,等于把基础设施的成本结构原样带进了面向客户的关系里,并让产品价值锚定在一个成本不断下降的计量单位上。

作者主张,公司应该在「能够可靠计量、归因和捍卫」的最高价值层级定价:

  • 卖模型访问权,按 token 计费
  • 把模型转化为有用工作,按可识别的价值单元计费(通常用 credits / 积分)
  • 直接交付可清晰归因的业务结果,按结果计费

把这一层做错往往很难扭转。token 价格会训练客户把应用与裸算力直接比较,从而放弃数据、工作流和编排带来的溢价空间;客户也将暴露在无法预测的技术复杂度下,厂商则被锁定在微薄利润中。如果 credits 只是「成本加成版的 token」,用内部货币掩盖了基础设施计量,并没有真正解决问题。

中间地带最难:应用层究竟在卖什么

栈的两端相对清晰:模型厂商卖推理,可以用 token 计量;少数应用交付足够可观测、可归因的结果,可直接按结果计费。真正困难的是中间地带——绝大多数 AI 应用都生活在这里。

文中举例:

  • 一个客户调研 agent 卖的不是搜索和模型调用,而是完成的客户简报
  • 一个编码 agent 卖的不是生成的 token,而是落地实施的改动
  • 一个数据平台卖的不是算力,而是完成的查询、流水线或 agent 运行

应用的任务,就是把这层复杂度抽象掉。因为每个品类的价值打包方式不同,不存在统一的 AI 应用计价单位:语音 AI 可能以分钟起步、再向「解决的对话」过渡;Copilot 可能以席位起步、再叠加基于用量(agent 工作带来成本和价值波动)的计费。

客户问 token 时,真正想要的是什么

作者指出,客户询问 token 时通常想要两件事:可比性和成本分配。

第一,可比性。token 看似让买家能把一个专用应用和通用模型 API 或自建方案放在一起比较,但这种比较往往是「假精度」。不同应用组合了不同的模型、数据、工具和自动化程度,token A 流经产品 A 与 token A 流经产品 B,产生的不是同一种工作。

第二,成本分配。财务和 IT 团队需要把 AI 支出追溯到部门、项目、客户或发票,往往要在不断增长的应用组合中完成。要求他们对每个产品分别预测 token 用量,等于让产品原本要隐藏的复杂度重新出现。

一个支持团队的 leader 容易估算公司要处理多少通对话,但很难预测上下文长度、检索量、重试、推理时间或输出 token。原本简单的 ROI 计算,会变成针对每个 AI 应用的算力预测练习。

更合理的做法是:暴露足够的底层使用细节以建立信任,但不要让底层用量成为商业计费单位。向客户展示完成了什么工作、容量去了哪里、为什么某些任务消耗更多,让财务和 IT 拿到做预算和分摊所需的报表。作者强调:「透明度不要求计费表和成本表必须是同一个。」

在竞争激烈或技术复杂度高的市场,公司可能仍需提供 token 透传计费,尤其针对特别昂贵或波动剧烈的模型调用,但这应当是混合模型的明确组成部分,而非默认的价值表达方式。

Credits 的关键:看 credit 买到的是什么

对于 AI 栈中广泛存在的中间层,credits 可以是打包波动性工作的有效方式。但 credit 是一种「货币」而非「价值单位」,关键在于 credit 买到的是什么:

  • 弱 credit 系统只是把 token 计数换成一个不透明的内部货币,掩盖了计量单位但没有改进它
  • 强 credit 系统映射到客户可识别的工作,可能使用几个直观的「工作量分级」:修一个小 bug 比多文件特性便宜;摘要合同一条条款比审阅整份协议便宜;丰富一条记录比跑多步客户调研工作流便宜

好的 credit 系统要做到三件事:

  • 抽象基础设施复杂度:客户买的是工作,不是原料
  • 解释相对工作量:简单工作消耗少,标准工作消耗可预期,复杂工作消耗更多
  • 提供商业灵活性:一个池子可以覆盖多种工作负载、agent 或自动化,由采购统一管理一份合同

作者在 50 位技术类 AI 买家的调研中发现,27 人偏好与可识别工作挂钩的 credits,仅 14 人偏好 token 计价。最终的检验标准是「可理解性」:买家通常在知道自己的工作量之前并不清楚自己的算力消耗。当客户能用自己的语言描述他们买了什么,定价才算落在了正确的层级。

信源