百度文心助手任务 Agent 登顶 PinchBench v2 智能体榜单
百度文心助手任务 Agent 以 94.6% 最高分在 PinchBench v2 评测中排名第一,超越 Claude、…
百度文心助手任务 Agent 以最高分 94.6%、平均分 94.4% 的成绩,在 PinchBench v2 全球工程向 AI 智能体评测榜单中位列第一,超过 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问 Qwen3.7-max(92.5%)、Claude Opus 4.8(90.5%)和 OpenAI GPT-5.6-luna(88.7%)等模型,成为首个以正式产品身份获得该榜单总榜第一的国产智能体系统。
PinchBench v2:面向端到端任务的智能体评测
PinchBench 由 Kilo AI 推出、OpenClaw 社区维护,与 MMLU、GPQA 等传统大模型基准有所不同。传统基准侧重考察模型的知识储备,PinchBench 则更关注智能体完成端到端任务并交付可验证结果的能力。
- 包含 23 个真实工作场景、147 项任务,涵盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别
- 共完成 617 次测试运行
- 评分采用「自动化校验 + LLM 评审」双轨机制,全程零人工干预
- 本次共有 59 个模型参评,文心助手任务 Agent 排名第一
此外,PinchBench 同时衡量模型与 Agent 框架的综合能力。同一个底座模型搭配不同 Agent 框架,最终得分会有明显差异,因此榜单成绩更能反映模型与系统工程的协同水平,而非单纯的模型参数比拼。百度 AI 搜索团队已在 GitHub 开源了完整评测流程,147 个任务的执行快照、交付物与 LLM 评审打分理由均已公开。
任务示例:金融、安全与法律三类复杂场景
文心助手任务 Agent 在多个复杂场景中均取得满分表现,以下为三个典型任务:
- 财报分析:根据公开信息计算 GitLab Q3 2025 财季非 GAAP 运营利润率(约 18%)与公司指引的差距(约 500 个基点),并将结论写入指定文件。文件创建、指标定位、实际值与指引值提取、基点计算四个维度均获满分 1.0。
- 安全工程:分析一个 Node.js 应用的多项 CVE 漏洞并分级修复。Agent 准确将 express RCE 与 JWT bypass 识别为 P0,将 PostgreSQL SQL 注入定为 P1 并结合 PCI DSS 上下文给出说明,将仅影响构建阶段的依赖漏洞降级为 P2/P3,最终制定五批次修复计划。LLM 评审结论为「所有维度表现卓越」。
- 合同法律分析:读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要。Agent 识别出客户方 12 项风险、供应商 10 项风险、5 项共享风险,并完整输出六期分期付款的现金流前置问题与 IP 转让产权间隙,四个评分维度均满分 1.0。
百度视角:搜索基因与多智能体框架
文心助手任务 Agent 基于百度搜索「猎户座」AI 引擎的多智能体框架构建。百度将搜索引擎视为早期 Agent 形态的雏形——接收意图、拆解任务、调用工具、验证结果,这套链路已运行二十余年。工具从索引爬虫升级为代码执行环境、文件处理器与实时 API,输出从蓝链列表进化为结构化报告与可运行代码。
百度方面表示,文心助手任务 Agent 将模型任务评估得分提升至 94% 以上,说明优秀的系统架构与工程实现能够显著释放模型潜力;同一个底层模型搭配该 Agent 框架,任务完成率会更高。目前,该 Agent 核心技术已应用于百度 App 与文心助手产品。
说明:上述评测结果与任务示例源自百度方面提供的内容,PinchBench v2 榜单的独立验证与第三方复现情况,读者可参考其开源评测仓库进一步核实。
