桃子桃子快讯
返回首页
行业动态

Agent 成 AI 最大客户:token 消耗半年涨 14 倍,是人类的 5.2 倍

OpenRouter 数据显示,2026 年 2 月以来 Agent 类 token 用量增长 14 倍,远超人类的 2…

2026.08.25 · 周二5 分钟阅读

2026 年 2 月 6 日,被 OpenRouter 联合创始人兼 COO Chris Clark 称为「人类最后一次在 token 消耗上跑赢 AI」的日子——那天,人类用户在 OpenRouter 上消耗的 token 首次被智能体(Agent)追平。仅半年后,差距迅速拉开:截至 8 月 10 日,Agent 类 token 用量从约 0.51 万亿暴涨到 7.3 万亿,增长 14 倍;同期人类用户的用量也增长到 1.4 万亿,但增幅只有 2.8 倍。Agent 用量已是人类的约 5.2 倍,曲线落差之大,让业内人士感叹「像是隔了十年,可其实只是半年」。

数据从哪来:按行为而非身份区分人与 Agent

OpenRouter 是目前全球最大的模型网关之一,对接约 70 家模型供应商,一周处理约 28 万亿 token,约占全球推理量的 1%,其中一半来自美国。要从这 1% 的流量里区分人和 Agent,OpenRouter 不看身份,只看行为:通过追踪每个 API key 的调用模式——工具调用频率、两次响应之间的间隔、一轮对话的回合数等共 7 项信号,加权打分后将流量划分为 Agentic、Mixed、Human 三档。

这一方法的核心依据是节奏差异:人类用 AI 时一问一歇,需要阅读、思考、打字;Agent 则几乎不间断地循环调用工具、执行回合,「节奏一看就不是碳基生物」。OpenRouter 自己也承认这是一套估算模型,但方向被认为不会出错。

一个 Agent 任务,顶一百次聊天

人与 Agent 的 token 鸿沟,本质上来自用法的不同。人类用户典型的交互是:打开对话框、敲一段提示词、等一段回答、复制走、关掉。整个过程通常不超过十句话,账面 token 量级在数千。

Agent 的工作方式完全不同。给定一个目标后,它会自行读文件、调工具、写结果、修改、再读、再改,围绕同一份上下文持续增量读写,可能跑上数十甚至上百轮模型调用和工具调用。OpenAI 的企业数据印证了这一点:用得最深的 10% 的公司,每名活跃用户产出的 token 是典型公司的 8.3 倍——半年前这个差距还只有 2.6 倍,三倍以上的鸿沟来自配套(插件、技能、流程),而非模型本身。

缓存拉低单价,但乘法改写了账单

面对 14 倍的用量增长,业内关注的不只是烧钱,而是成本结构本身。Agent 请求天然多轮,平均每次请求中近 70% 的 token 来自缓存提示,而缓存定价远低于全价输入:首次需要把代码规范、操作手册、工具清单等大段上下文完整灌入并支付全价,之后每一轮只做增量更新,命中缓存部分仅按正常输入价的小部分计费。a16z 按总量口径统计认为缓存 token 占比超过 85%。

单价虽然下来了,用量却在狂飙。Uber CTO Praveen Neppalli Naga 今年早些时候透露,公司工程师仅四个月就烧完了全年的 Claude Code 预算,他本人一场两小时的演示就花掉 1200 美元。EY 给出的另一组参照是:同样一次客服交互,成本从 2023 年的约 0.04 美元升至 2026 年的约 1.20 美元,涨幅 30 倍——不是模型变贵,而是客户那一句提问背后,Agent 已经查工单、调库存、翻记录,折腾十几个回合才吐出一句回复。高盛则估算,Agent AI 可能把 2030 年的 token 消耗推高到当前的 24 倍。

此外,缓存虽便宜却耗内存。Agent 长时间运行时,整段上下文要靠高带宽内存(HBM)一直托住,这也是近期 HBM 紧俏的重要驱动力之一。

省钱的分水岭不在模型,在用法

面对陡峭的成本曲线,「换个更便宜的模型」不是真正的答案。同一模型,当作搜索框用,一天可能只消耗数千 token;接上自己的文件、工具和一条能持续运行的流程后,一天几千万 token 也不稀奇。差距在于是否把它放进「真正的活」里。OpenAI 的同一组统计显示,头部公司的活跃用户每周有 21% 在用插件,典型公司只有 9%;技能采用率则是 19% 对 3%,OpenAI 内部该数字高达 95%。把常做的事打包成可复用的技能,让 Agent 不必每次从零摸索,是节省 token 最直接的方式。

token 花得再多,也得有人验收

Agent 流量暴涨并不意味着 AI 已完全自主。大量任务仍由人发起,中间常卡着人工审批。但审批机制未必能跟上节奏:有开发者提到,服务的客户在采购、发送、签字每一步都要求绕回人工;也有人发现自己的 Agent 删掉了广告账户里的 18 个视频,一整天才被发现——不是模型犯了多离谱的错,而是根本没人去看那一步。

token 花销可以在半年里翻 14 倍,验收的人手却翻不了这么多。分析、调研、初稿、方案等重复执行的动作可能会过剩,真正稀缺的,是验证、判断,以及决定什么值得被做。AI 已经成为 token 的主要消费方,但到今天为止,它还不能替人签字。

信源