开发者推出聚焦token效率的AI基准30 Seconds Bench
一位开发者发布以token消耗为核心评分维度的新AI基准,通过双模型协作猜词游戏评估大模型解释效率。
一位开发者近日在GitHub发布了名为「30 Seconds Bench」的AI基准测试项目,以「30秒猜词」游戏为蓝本,引入了一种较为小众的评测维度——让两个模型协作完成秘密词汇的解释与猜测,并以最少token消耗作为评分核心。
为什么要再做一个新的基准
主流AI基准(如SWE-Bench、MATH、GPQA等)主要衡量模型在代码、数学、科学等领域的综合能力。作者指出,社区中也存在一些带有强烈个人色彩的小型基准,例如让模型通过文字描述猜出滑板招式(skatebench),或让AI经营一个自动售货机公司(vendingbench)。这类「看起来荒诞」的基准虽然不直接衡量AI整体进步速度,却能让人意外发现模型能力的边界,是一种值得鼓励的探索方向。
从个人痛点出发的设计:token焦虑
项目灵感来自作者本人的真实使用体验:AI订阅太多、账单难以控制。作者由此设想,是否可以设计一个让模型「少说话」的基准——不仅评估答案是否正确,还评估输出token的数量。
为了让token粒度可见,项目采用流式输出方式,让猜测模型在解释模型每输出一个token后即可决定「猜测一个词」或「沉默等待更多token」,从而引入了「实时决策」的动态博弈过程。作者表示,这种逐token的评测在现有公开基准中较为少见。
游戏机制:解释者、猜测者与极简提示
30 Seconds Bench采用成对模型协作机制:
- 解释者获得秘密词汇后逐token流出解释,且禁止直接说出、拼出或翻译目标词;
- 猜测者在每个token到达时决定「猜测一个词」或「pass等待更多」。
为保持基准本身精简,解释者侧的系统提示仅有数十字,要求「立刻开始解释、不提及目标词」。作者最初尝试极简提示,但首版测试中多款模型会直接泄漏答案,例如在解释开头输出「Bombastic: 目标词的解释……」。猜测者侧则改用工具调用(tool-call)方式让模型返回猜测或pass,规避了模型在自由文本中夹杂解释性语句的问题。
模型与词汇选择
参与基准的开源模型(按文中所列)包括:
- moonshotai/Kimi-K3
- zai-org/GLM-5.2
- MiniMaxAI/MiniMax-M3
- XiaomiMiMo/MiMo-V2.5
- mistralai/Mistral-Medium-3.5-128B
- google/gemma-4-31B-it
- openai/gpt-oss-120b
词汇部分取自一份Kaggle英文词频数据集,从排名约80,000处挑选10个有趣词汇,包括 amalgamate、bamboozle、bombastic、rehydration、judiciously、accelerometers、underestimating、flatscreen、cosmonaut、baronet。
已知局限
作者在文末坦承该基准存在若干局限:一是不同模型的tokenizer并不一致,1 token ≠ 1 token,基准实际上同时部分评估了各模型tokenizer的压缩效率;二是文章发布时并未附上完整的模型对比排名,读者需前往GitHub仓库查看最新结果;三是工具调用让部分模型(例如Mistral系列)出现误用工具名作为猜测词的现象,反而推高了token消耗。
总体而言,30 Seconds Bench 是一次带有强烈个人色彩的小型基准实验,展示了「token效率」作为评测维度在AI评估中的可能性,但其影响力目前主要局限在小型爱好者社区。
