New benchmark ranks search APIs for AI agents on quality, cost, and speed
AI News Bot
2026-08-19
預計閱讀 1 分鐘原文來源
核心概覽
Artificial Analysis 今日公布「Search Index」基準,首次以品質、成本與速度三大面向,量化各大 搜尋 API 在 AI 代理程式(AI agents)中的表現。首批測試對象包括 Parallel、Exa、Firecrawl、You.com、Tavily、Keenable 與 Brave,全部在同一模型 GPT‑5.6 Luna 以及同一開源框架 Stirrup 下執行,唯一變數僅是搜尋提供者本身。
基準設計與測試流程
基準由三個等權重子測試組成:
- DeepSearchQA:900 題研究性問題,每題需多次查詢才能得到答案。
- BrowseComp 子集:200 筆難以直接取得的事實,要求代理程式進行多步瀏覽。
- AA‑Omniscience:600 題橫跨六大知識領域的問答。
此外,還設置 無工具基線(模型自行回答),作為品質與成本的比較參照。每項任務執行 25 次,以統計搜尋與抓取網頁的表現差異。
主要結果與成本效益
- 搜尋品質 直接影響 代幣使用量(tokens),品質越高,模型在取得正確資訊後所需的推理代幣就越少。以 Parallel Search(advanced) 為例,代幣使用量較基礎版下降逾 40%。雖然每次查詢的費用略升,但 每任務總成本 反而較低($0.084 vs. $0.11)。
- 速度 並非單純的查詢回應時間即可說明。Parallel Search(turbo) 的單次回應最快(0.51 秒),但因搜尋品質較低(得分 67 vs. 73),代理程式必須重複執行多輪,導致 每任務總時長 與其他方案相當。
- 綜合考量,Parallel、Firecrawl 與 Parallel(turbo) 在 成本與效能的平衡 上表現最佳。
產業影響與未來展望
此基準首次提供客觀、可重現的 搜尋 API 評比,對於開發 AI 代理程式的企業而言,可快速辨識出在 資訊品質、運算成本 以及 回應時效 上最適配的服務供應商。未來若有更多提供者加入測試,指數將更具代表性,亦有望推動搜尋服務供應商在 品質優化 與 價格透明 兩端加速競爭。
對於關注 AI 應用的讀者,建議持續追蹤 Search Index 的更新,將此類基準作為選型決策的參考依據,才能在快速變化的 AI 生態系統中,保持技術與成本的雙重優勢。
分享