研究论文
技能表示如何影响智能体路由:Tinycloud 多模态视频智能体的案例研究
arXiv 新论文以 Tinycloud 多模态视频智能体为案例,揭示系统提示中技能的暴露方式会影响规划器选择,局部暴露…
2026.08.24 · 周一约 2 分钟阅读
一项来自 arXiv 的最新预印本论文以生产级多模态视频智能体 Tinycloud 为案例,研究了智能体系统中「技能表示」对 LLM 规划器选择技能的影响。作者指出,技能路由在生产场景下既要发现,也要排序;而在小规模下,规划器往往直接在上下文(in-context)中挑选系统提示里暴露的技能,这可以视为大规模嵌入检索在小 N 情境中的对应物。
两种技能表示
论文将 Tinycloud 中的技能划分为两类:
- tool-skills:封装单一外部 API 或系统工具,作为原子词汇使用;
- workflow-skills:编排多个 tool-skills 调用并结合模板渲染,最终产出某个具名交付物。
两种暴露方式
系统在提示中通过两种界面暴露这些技能:
- inlined-body 界面:包含完整指令、脚本和模板,用于自动加载(autoloaded)技能;
- one-line listing:仅列出单行描述,用于按需加载(on-demand)技能。
六任务消融实验
作者设计了一个六任务的选技能消融实验,比较三种暴露策略:
- all-on:全部自动加载;
- default:生产环境默认配置(部分自动加载 + 部分按需列出);
- all-off:全部按需列出。
结果显示,all-on 在所有任务上均能选中正确技能;all-off 会拖慢执行并出现难以发现的失败;而生产默认配置在某个任务上出现误路由——原因是某个自动加载的 tool-skill 的词汇信号与按需列出的 workflow-skill 发生冲突,把规划器的注意力「拉走」了。
核心结论
论文的主要观点是:在提示中暴露技能并非单调有利,局部暴露可能制造词汇竞争,反而抑制正确选择。作者强调这是一项案例研究而非基准测试,并把这一小规模观察与近期大规模基于检索的技能路由工作联系起来,为智能体系统中提示工程与检索机制的衔接提供了新的实证依据。
