工具
FoodTruck Bench:让 AI 当 30 天餐车老板,谁更会做生意?
第三方基准 FoodTruck Bench 用 30 天餐车经营模拟测试 38 个 AI 模型,GPT-5.5、GPT-…
2026.07.25 · 周六约 3 分钟阅读
FoodTruck Bench 是一项面向 AI 智能体的「商业决策」基准测试:在美国奥斯汀的虚拟餐车场景里,模型需要在 30 天内连续做出选址、菜单、定价、库存和雇人等决策,每一步都直接影响后续现金流。该基准共纳入 38 个模型,提供 34 个智能体工具和 6 个可选地点,并通过 5 次同条件重复运行取中位数,以减少随机性。
基准的设计思路
传统测试如 MMLU、HumanEval、SWE-bench 衡量的是「模型知道什么」,而 FoodTruck Bench 关注的是「模型能不能在不确定中持续做出像样的决策」。它不是一道有多选题,而是一连串会互相耦合的选择:跳过一天采购就没有原料、定价过高会失去顾客、雇错员工会拉低产能,且每一天的后果都会滚入下一天。
当前榜单:GPT 与 Claude 领先
在净财富(Net Worth)维度上排名前列的模型包括:
- #1 GPT-5.5:净财富 61,408 美元,ROI +2970%,利润率 65%,30 天营收 93,959 美元。
- #2 GPT-5.6 Sol:净财富 53,229 美元,ROI +2561%,利润率 65%,单次 API 成本约 13.44 美元(约为 GPT-5.5 的一半)。
- #3 Claude Opus 4.6:净财富 49,519 美元,ROI +2376%,利润率 61%,但单次成本最高,达 36.04 美元。
- #4 Grok 4.5:净财富 34,586 美元,ROI +1629%,相比上一代 Grok 4.3 提升 24%,食材浪费下降 78%。
- 其他上榜模型还包括 GPT-5.2、Grok 4.3、DeepSeek V4 Pro、Nex N2 Pro、Gemma 4 31B、Kimi K3 等。
从「性价比」看(每 1 美元 API 成本创造的净财富),MiMo V2.5 Pro 以 9,253 美元位列第一;Grok 4.5、Grok 4.3、DeepSeek V4 Pro 紧随其后。
几个值得关注的现象
- Gemini 3 Flash 被标注为「未上榜」,原因是开启扩展思考后会在 Day 0 陷入无限决策循环,无法完成 30 天模拟。
- 在 38 个模型中,最终有 22 个「存活」、16 个「破产」。
- GPT-5.6 Luna 虽然每次运行仅需约 2.20 美元即可盈利,但净财富仅 13,540 美元,输给了 Qwen 3.6、MiMo 和 DeepSeek,显示「便宜」不等于「能打」。
- Kimi K3 作为一款 2.8T 参数的代码强项模型,虽然餐车出餐量超过 GPT-5.6 Sol,但利润低 57%,被作者解读为「优化了错误的目标」。
局限与注意
需指出的是,FoodTruck Bench 由第三方独立维护,榜单中部分模型名(如 GPT-5.5、GPT-5.6 Sol/Luna、DeepSeek V4 Pro)和发布日期(标注为 2026 年)相比当前主流厂商的公开版本存在超前,数据的可复现性与口径仍需进一步核实。但作为一项面向「长链路智能体决策」的实验性评测,它的题目设计——选址、定价、库存、人员、财务一锅端——对评估模型在真实商业场景下的稳健性,仍是一次有参考价值的尝试。
