多步骤 MCP 的 token 损耗,可能主要来自每一步的模型重入

查看 18|回复 0
作者:yohjisakamoto   
很多 MCP 演示只有一次工具调用;真实任务更像:创建项目 → 读取项目 ID → 导入素材 → 把 clip ID 交给下一步 → 导出 → 交付。
普通 agent 每完成一步,都要把结果带回模型,再让模型把 ID 填进下一次调用。Tura 的 command_run Macro 想解决的是这段“交接”:一次描述依赖图,前一步成功产生的变量给后一步在运行时解析;没有依赖的命令可以一起执行。
公开的电商广告工作流里,两边都通过同样 5 项检查、交付相同结果。Tura Direct 用 3 次模型请求,对照为 11 次;总 token 是 56,372 对 262,915 (少 78.6%)。有意思的是 MCP 调用不是更少,而是 11 对 9:省下的是把累计上下文反复送回模型的成本,不是少干活。
依赖链更长时,Macro 内每保留一次交接,就少一次模型重入,所以这部分节省会累积;但不是所有任务都严格线性,缓存、重试和任务结构都会影响结果。
完整 trace 、基准边界和变量继承规则:
https://turaai.net/blog#what-we-learned-from-the-mcp-workflow-benchmark
源码:
https://github.com/Tura-AI/tura
说明:本文分享 Tura-AI 的工作,欢迎讨论这个思路在你们的 MCP 工作流里是否有效。之前看 deep swe 说 https://github.com/swe-agent/mini-swe-agent 比 codex 和 claude code 在 debug 中的 token 消耗和成功率都要好,我今天自己跑了一下,用 gpt5.6 sol 开 high 基本 token 开销比 codex 少 50%,成功率也高 15%左右。下面是我跑的测试数据:
https://turaai.net/benchmark
本来是想给我的宏命令做消融试验,但是单独只是改执行,不改提示词,token 消耗其实只减少了 16%左右,成功率提高 11%左右。
下面是 deepswe 官方的解释:
https://deepswe.datacurve.ai/blog/deepswe
简而言之如果光 debug mini swe agent 好像明显好过模型厂商的官方 agent harness 。
您需要登录后才可以回帖 登录 | 立即注册

返回顶部