百度文心助手任务Agent登顶PinchBench v2,超越Claude和GPT拿下智能体评测冠军
百度文心助手任务Agent在PinchBench v2榜单上以94.6%的最高分、94.4%的平均分夺得第一,超越Anthropic Claude Opus 4.8、OpenAI GPT-5.6-luna等国际模型。这不是单纯考“知识问答”,而是测试智能体能否自主完成真实工作场景中的完整任务链,并交付可验证的成果。这背后是模型能力与Agent系统工程协同作战的结果。

2026年7月17日,百度文心助手任务Agent以94.6%最高分、94.4%平均分的成绩,登顶全球工程向AI智能体评测榜单 PinchBench v2。这是首个以正式产品身份拿下PinchBench总榜第一的国产智能体系统。
在59个参评模型中,文心助手任务Agent排名第一,领先Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。

一个真正考核“执行力”的榜单
PinchBench由Kilo AI推出,OpenClaw社区维护。它和MMLU、GPQA这类传统大模型基准评测最大的区别在于:传统评测考的是“模型知不知道这个知识点”,而PinchBench考的是“智能体能不能把整件事从头到尾做完,并交付一个可以验证的结果”。
当前版本包含 23个真实工作场景、147项任务,覆盖数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理七大类别,共完成了617次测试运行。评分采用“自动化校验 + LLM评审”的双轨机制,全程零人工干预——杜绝了人为打分的主观偏差。

更关键的是,PinchBench衡量的不是单一大模型的能力,而是 模型与Agent框架的综合配合。即使底层用的同一个模型,搭载不同的Agent框架,最终得分也可能相差很大。文心助手任务Agent能登顶,说明百度在模型能力和系统工程两个层面的协同能力都达到了业界顶尖。
百度AI搜索团队已在GitHub上开源了完整评测流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147个任务的执行快照、交付物、LLM Judge打分理由全部公开,任何人都可以一条一条复现验证。
从“动动嘴”到“迈开腿”:这些任务演示了文心助手的真功夫
案例一:金融数据分析——自主检索财报,计算利润率差异
任务要求:“GitLab Q3 2025财季的实际利润率与指引之间差了多少个基点?”——不给任何数据文件,Agent需要自己找到GitLab的财报原文或电话会议记录,定位相关指引,算出非GAAP运营利润率约为18%、超出指引约500个基点,最后把结论写进指定文件。
评测从 文件创建、指标定位、实际值与指引值提取、基点计算、结论输出 五个维度自动化打分,全部满分1.0。
案例二:安全工程分析——识别漏洞并制定修复计划
任务要求:分析一个Node.js应用的多个CVE漏洞,按优先级分级并制定修复计划。评测要求Agent识别出express RCE和JWT bypass两个CRITICAL级漏洞为P0(其中JWT bypass因存在活跃利用记录需特别标注);将PostgreSQL SQL注入定为P1,并关联PCI DSS支付路径给出上下文;将仅影响构建阶段的依赖漏洞降级为P2/P3;最后制定五批次的修复计划,附上具体部署窗口(4月12日紧急热修、4月14日P1批次)。
LLM评审结论是“所有维度表现卓越”,满分1.0。
案例三:合同法律分析——提取关键信息、识别风险
任务要求:读取一份软件服务协议,提取关键日期、梳理双方义务、识别风险点、生成财务摘要。这种任务过去需要律师助理花几个小时。文心助手任务Agent的输出识别了客户方12项风险、供应商10项风险、5项共享风险;付款结构六期分期的现金流前置问题、IP转让条件的产权间隙,全部准确标注——四个评测维度全部满分1.0。
日常办公场景:一句话搞定复杂任务链
复杂任务能搞定,日常办公更不在话下。例如:扔给文心助手一份职业数据表,然后说“统一表头格式,新建汇总sheet,按职业大类做汇总表和Top10/Bottom10榜单,生成图表对比各职业大类就业人数。”
这是一条内部有依赖关系的任务链:先统一格式,再新建sheet,再汇总,再排序,再生成图表——任何一步出错后续都无法进行。文心助手任务Agent自主拆解步骤,一次性跑完。

或者你只给一个模糊需求:“我这周末想从北京去青岛玩两天solo trip。”不给任何额外信息。Agent自主检索交通、住宿、景点实时数据,排出完整行程、预算清单和避坑指南,交付一份可以直接截图出发的攻略。

关键要点
- 榜单定位不同:PinchBench测试的是智能体完成复杂工作流的能力,而非简单的问答知识,更贴近实际应用场景。
- 文心助手的优势:本次夺冠体现的是百度在模型能力与Agent框架(系统工程)两方面的协同实力,而非单纯大模型排名。
- 对开发者的启示:未来AI编程和自动化工具的核心竞争力,在于能否将大模型与任务拆解、工具调用、结果验证等环节有机结合,实现“动动嘴”到“迈开腿”的跨越。
- 透明度高:百度已开源完整评测流程和所有任务执行记录,可供复现验证,这在行业评测中较为少见。
百度文心助手任务Agent在国际权威榜单中超越Claude、GPT等竞品,拿下全球智能体冠军。其核心优势在于依托百度20多年的意图理解积累,通过多智能体框架将任务评估得分提升至94%以上。本文解析这一技术突破背后的逻辑,以及它对开发者意味着什么。
定时任务:让AI成为你的“自动员工”
如果你不想每次重复问AI同样的问题,可以将高脑力、重复性的劳动交给它自动完成。比如设置一个定时任务:「每周一晚上十点,帮我汇总近一周的高质量AI领域论文,用投研报告风格的HTML给我」。

这样,7×24小时全天候运行,用户无需时刻在场,AI就能按时交付成果。
为什么是百度?
答案其实很直接:百度在意图理解这条赛道上已经深耕了20多年。
文心助手任务Agent的核心,是依托百度搜索猎户座AI引擎的多智能体框架构建的。从底层架构来看,搜索引擎本身就是最早的Agent雏形——接收意图、拆解任务、调用工具、验证结果。这条完整链路,百度已经跑了二十余年。
过去,工具集是索引爬虫;现在,升级成了代码执行环境、文件处理器和实时API接口。输出从蓝色链接列表变成了结构化报告和可运行的代码。但底层逻辑一脉相承:理解用户意图,然后按步骤执行并交付结果。
文心助手任务Agent将模型任务评估得分提升至94%以上,这证明了优秀的系统架构与工程实现能够显著释放模型潜力。换句话说,同一个底层模型,换上文心助手任务Agent的框架,任务完成率就会更高。在Agent时代,框架工程能力的重要性正在超过单纯的模型参数比拼。
目前,文心助手任务Agent核心技术已全面应用于百度App及文心助手。你可以登录 chat.baidu.com,点选「任务」按钮,即可体验。
本文由百度提供,量子位获授权转载,观点归原作者所有。

- 全球首款720°连续后空翻机器狗来了!宇泛智能携“灵猫”双馆联袂首秀WAIC2026-07-18
- Halliday发布第二代AI眼镜Halliday G2,AI功能走向“实时参与会议”2026-07-22
- 天立启鸣发布教育AGI白皮书:破解教育“不可能三角”2026-07-22
- 懂你、能交付、专业操作:金山办公田然给出AI办公助理的三项标准2026-07-22