百度文心助手任務Agent登頂知名大模型榜單PinchBench v2
日前,百度文心助手任務 Agent(Orion Mission Mode)以94.6%的綜合成功率、94.4%的平均得分,在全球工程AI智能體評測榜單 PinchBench v2 中榮登榜首。

在147項真實任務的綜合評測中,文心助手任務 Agent 超越眾多海內外主流大模型。 此次 PinchBench v2 榜單以148項真實企業自動化任務為核心測試標準,覆蓋創意內容、寫作、數據分析、研究知識、代碼運維等多維場景。榜單數據顯示,文心助手任務 Agent 在創意內容、寫作內容等多個賽道獲得領先的評測認證,工具調用、多步驟任務自主規劃與長程任務執行能力表現突出。此次評測流程,百度 AI 搜索團隊以 Orion Mission Mode 的名稱,在GitHub 上開源。
據悉,文心助手任務 Agent 依託百度搜索二十餘年技術積累與百度搜索獵戶座 AI 引擎的多智能體框架能力,為智能體應用開發提供了自主可控、高性能的國產化底層模型底座。目前,該核心技術已全面應用於百度 APP 及文心助手。

















