0
| 本文作者: 徐咪 | 2026-07-22 15:18 |
2026 年 7 月 17 日,百度文心助手任務 Agent,以最高分 94.6%、平均分 94.4% 的成績,登頂全球工程向 AI 智能體評測榜單 PinchBench v2。成為首個以正式產品身份獲得 PinchBench 總榜第一的國產智能體系統。
在 59 個參評模型中,文心助手任務 Agent 排名第一,領先 Anthropic Claude Opus 4.8-fast(93.5%)、阿里通義千問 Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。

這個榜單,測的是最難作假的能力
PinchBench 由 Kilo AI 推出,OpenClaw 社區維護。它和 MMLU、GPQA 這類傳統大模型基準的區別很直接:傳統基準考「模型知不知道」,PinchBench 考「智能體能不能把整件事做完并交付可驗證的結果」。
當前版本包含 23 個真實工作場景、147 項任務,覆蓋數據分析、研究寫作、代碼開發、辦公自動化、文檔處理、網頁操作、多媒體處理七大類別,共完成 617 次測試運行。評分采用「自動化校驗 + LLM 評審」雙軌機制,全程零人工干預。
更關鍵的是,PinchBench 用于衡量模型與 Agent 框架的綜合能力。即便是同一底座模型,搭載不同 Agent 框架,最終評測得分也會存在較大差距。這也說明,文心助手任務 Agent 取得榜首成績,代表的是模型能力與系統工程協同打造的綜合實力第一。
百度 AI 搜索團隊在 GitHub 上開源了完整評測流程(github.com/Baidu-AI-Search/PinchBench-Evaluation),147 個任務的執行快照、交付物、LLM Judge 打分理由全量公開,任何人都可以逐條復現。
讓 AI 從「動動嘴」,到「邁開腿」
比如其中一個任務是:「GitLab Q3 2025 財季的實際利潤率與指引之間差了多少個基點?」沒有給任何數據文件,Agent 需要自主檢索 GitLab 財報原文或電話會議記錄,定位相關指引,計算出非 GAAP 運營利潤率約 18%、超出指引約 500 個基點,并將結論寫入指定文件。
五個自動化評分維度——文件創建、指標定位、實際值與指引值提取、基點計算結論——全部滿分 1.0。
另一個任務考的是安全工程:分析一個 Node.js 應用的多個 CVE 漏洞,按優先級分級并制定修復計劃。評測要求 Agent 識別 express RCE 和 JWT bypass 兩個 CRITICAL 級漏洞為 P0,其中 JWT bypass 因存在活躍利用記錄需要特別標注;將 PostgreSQL SQL 注入定為 P1 并結合 PCI DSS 支付路徑給出上下文;將僅影響構建階段的依賴漏洞降級為 P2/P3;制定五批次修復計劃,附具體部署窗口(4 月 12 日緊急熱修、4 月 14 日 P1 批次)。
LLM 評審的評審結論是「所有維度表現卓越」,得分滿分 1.0。
還有一個合同法律分析的 case,任務是讀取一份軟件服務協議,提取關鍵日期、梳理雙方義務、識別風險點、生成財務摘要。這種任務過去需要律師助理花幾個小時。文心助手任務 Agent 的輸出結果,識別了客戶方 12 項風險、供應商 10 項風險、5 項共享風險,付款結構六期分期的現金流前置問題、IP 轉讓條件的產權間隙,全部做到了——最終評分四個維度都是滿分 1.0。
上面這些復雜的任務文心助手任務 Agent 都不在話下,更不用說普通用戶的日常辦公需求。
比如,你扔給文心助手一份職業數據表,然后說「統一表頭格式,新建匯總 sheet,按職業大類做匯總表和 Top10/Bottom10 榜單,生成圖表對比各職業大類就業人數。」
這是一條有內部依賴關系的任務鏈,任何一步出錯后面就沒法接。文心助手任務 Agent 自主拆解,一次性跑完。
或者你給不了這么詳細的指令,想搖個盲盒:「我這周末想從北京去青島玩兩天 solo trip。」沒有給任何別的信息。Agent 自主檢索了交通、住宿、景點實時數據,排出完整行程、預算清單和避坑指南,交付一份可以直接截圖出發的攻略。
或者你不想每次都要問 AI,讓它幫你完成重復性又高腦力的勞動,可以設置定時任務,如「每周一晚上十點,幫我匯總近一周的高質量 AI 領域論文,用投研報告風格的 HTML 給我」。
7×24 小時,用戶無需時刻在場。
為什么是百度做出來了?
答案其實很簡單:百度是一家在意圖理解上花了 20 多年的公司。
文心助手任務 Agent 依托百度搜索獵戶座 AI 引擎的多智能體框架構建。
從架構邏輯來看,搜索引擎本身就是最早的 Agent 雛形——接收意圖、拆解任務、調用工具、驗證結果,這條鏈路百度已經跑了二十余年。
工具集從索引爬蟲升級成了代碼執行環境、文件處理器和實時 API 接口,輸出從藍鏈列表變成了結構化報告和可運行代碼,但底層邏輯一脈相承。
文心助手任務 Agent 將模型任務評估得分提升至 94% 以上,證明優秀的系統架構與工程實現能夠顯著釋放模型潛力。
也就是說,同一個底層模型,換上文心助手任務 Agent 的框架,任務完成率會更高。Agent 時代,框架工程能力的重要性正在超過單純的模型參數比拼。
目前,文心助手任務 Agent 核心技術已全面應用于百度 App 及文心助手,可登錄 chat.baidu.com ,點選「任務」,即可體驗。