Tura:用宏命令把 MCP 交互回合砍掉 75%,token 节省最高 77.5%
开源代理运行时 Tura 通过单一宏工具与「反向推理」,在 DeepSWE 任务上比 Codex CLI 少用最多 77…
在 Hacker News 的 Show HN 板块,一个名为 Tura 的开源代理运行时(agent runtime harness)亮相。开发者宣称,它能在 MCP 类编程代理交互中,将大模型回合(turn)削减 75% 以上,并把 token 消耗最高压到 77.5%,同时在 DeepSWE v1.1 长程任务基准上跑出比 Codex CLI 更高的成功率。
项目定位与核心思路
Tura 不是新模型,而是一个围绕现有 LLM 的执行调度层。它针对的是 ReAct 类代理架构中常见的「回合开销」:每调用一次工具,模型都要重新进入一次,重复携带系统提示与不断膨胀的上下文。Tura 的做法是把原本需要 5 个回合的任务,编译成一张由运行时托管的命令图(command graph),让确定性执行在同一回合内完成,无需再来一轮模型调用。
单一宏工具:command_run
传统编码代理一般会向模型暴露几十个小工具,于是出现「检查—等待—打补丁—等待—编译—等待—测试—等待」的循环。Tura 把这些动作合并成一个宏工具 command_run,让代理一次构建出多步执行树,并在同一回合里跑完。
以一次典型的 Rust 项目修改为例:
- 传统工具调用代理:
- Turn 1:
rg搜索 TODO、command_run、handler - Turn 2:应用补丁修改 handler.rs
- Turn 3:
cargo build - Turn 4:
cargo test - Turn 5:
cargo clippy
- Turn 1:
- Tura 宏命令:
- 一个回合内串起上述全部步骤,包括
apply_patch与多步 shell 命令
- 一个回合内串起上述全部步骤,包括
开发者强调,这里节省的是「对话开销」而非工程纪律;同一组命令仍按顺序执行,差异在于不再让模型为每个步骤单独走一轮。
基准与数字
公开的对比在 20 个 DeepSWE v1.1 任务、5 个改写任务、2 个独立评审的设计任务上展开,每个任务每个配置跑 3 次,共 270 次会话。关键结果:
- Tura Balanced:80.0% 成功率(比 Codex CLI 高 16.7 个百分点),回合少 35.8%,token 少 31.1%
- Tura Direct:65.0% 成功率(与 Codex CLI 的 63.3% 相当),回合少 69.1%,token 少 77.5%
- Codex CLI 基线:63.3% 成功率
开发者明确指出,目前没有消融实验证明 command_run 这一项设计单独带来全部收益;同时也承认,跨 Anthropic/Claude、Google/Gemini、OpenAI 兼容接口、本地模型、UI 延迟、跨操作系统等维度的对比仍属于公开路线图中的已知证据缺口。
「反向推理」机制
Tura 还引入了一种被称为「Backward Reasoning」的策略。它的观察是:LLM 本质上是对文本 token 概率做统计归纳,因此更容易产出「常见但平庸」的代码与逻辑。常规代理的推理方向是从 $s_1$(当前状态)正向推到 $s_n$(用户目标),Tura 则先让模型统计估计 $s_{n-1}$,再由 $s_{n-1}$ 反推 $s_{n-2}$,以此跳出「最常见的写法」。文中以石头剪刀布的均匀随机选择为例说明:当真正需要 1/3 均匀分布时,必须借助外部随机源,而不是假设模型输出概率均匀。
现状与边界
Tura 以开源项目形式发布,提供 GUI 与 TUI 两套界面,均支持多会话并发与 HTML 富文本渲染。作为 Show HN 出品的工具,它的数字来自项目方自公布制品而非第三方审计;对于希望复现或扩展到更多模型的开发者,官方建议直接查阅随附的完整 benchmark 报告与源码。
