桃子桃子快讯
返回首页
研究论文

Cohere 发布 Agentic Task Ecosystem:69 万工具仅 2.6% 能独立完成任务

Cohere Labs 发布覆盖 69 万余个 AI 智能体工具的数据集,测试显示仅 2.6% 能独立完成职业任务。

2026.09.04 · 周五3 分钟阅读

AI 智能体(agent)能否真正「干活」,一直是行业关注的核心问题。日前,Cohere Labs 正式发布 Agentic Task Ecosystem——一个面向 AI 智能体工具生态的大型数据集,收录了超过 69 万个为智能体设计的工具。测试结果显示,在「能否独立完成一项职业任务」的严苛标准下,仅有约 2.6% 的工具通过评估,这一比例远低于外界对智能体落地能力的普遍预期。

数据集概况

Agentic Task Ecosystem 由 Cohere Labs 构建,旨在系统化刻画当前 AI 智能体可调用的工具生态全貌:

  • 规模:收录超过 69 万个工具条目,覆盖多种类型与行业场景。
  • 定位:以「职业任务完成度」为评估锚点,而非简单的工具描述或 API 列举。
  • 用途:既可作为研究社区衡量智能体能力的基准,也可供开发者评估自身工具集成的真实可用性。

与传统的工具列表或 API 目录不同,该数据集将每个工具与具体的「职业任务」挂钩,试图回答「这个工具到底能不能替人把活干完」这一问题。

测试结果:仅 2.6% 通过

在评估方法上,研究团队对每个工具进行独立测试:判断其是否能在不借助额外人工干预的前提下,自主完成某项对应的职业任务。结果并不乐观:

  • 通过率:约 2.6% 的工具能独立完成任务。
  • 含义:绝大多数被归类为「可被 AI 智能体调用」的工具,距离真正替代人类执行任务仍有显著距离。
  • 启示:工具的「存在」与「可用」之间存在巨大鸿沟,工具覆盖度不等于任务完成度。

这一结果与近期业界对「agentic AI 是否已具备生产力」的讨论形成呼应:工具生态看似丰富,但在端到端任务执行层面,多数工具仍存在能力缺口。

对智能体行业的参考价值

Agentic Task Ecosystem 的发布,为行业提供了一个可量化的参考基准:

  • 对企业:在部署 AI 智能体替代或辅助岗位任务前,可借助该数据集识别哪些场景真正具备可行性,避免高估自动化潜力。
  • 对开发者:明确哪些类型的工具更容易通过测试,从而在工具设计、接口规范和错误处理上做针对性优化。
  • 对研究社区:为后续智能体能力评估、工具调用规划(tool-use planning)研究提供了大规模实证数据。

Cohere Labs 将数据集开放给社区使用,未来若公布完整论文与详细方法论,有望进一步推动智能体评估标准的统一。

结语

69 万工具、2.6% 通过率——这两个数字之间的落差,正是当前 AI 智能体从「能调用」走向「能干活」必须跨越的现实差距。Agentic Task Ecosystem 的价值不在于唱衰智能体,而在于用数据让行业回归理性:真正的自动化,仍需更扎实的工具能力与更严谨的评估体系来支撑。

信源