Perplexity 發布 WANDR 評估 Agent 研究能力 episode artwork

EPISODE · Jul 15, 2026 · 3 MIN

Perplexity 發布 WANDR 評估 Agent 研究能力

from EasyVibeCoding Podcast · host Aravind Srinivas

Perplexity 發布 WANDR 評估 Agent 研究能力。 Perplexity 開源其內部基準測試 WANDR,該基準由 500 個研究任務組成,圖表展示了其在任務成員數、每成員記錄數、每任務記錄數及層級深度上的多樣化分佈,用以評估 AI 代理的廣度與深度研究能力。 Perplexity 執行長 Aravind Srinivas 指出,Perplexity 內部高度依賴嚴謹的評估指標與基準測試;他也表示 Perplexity 在成本與效能的權衡上表現最佳。此次開源的「WANDR」(Wide ANd Deep Research)基準測試,正是該公司用來衡量 Agent 在處理複雜研究任務時,能否同時兼顧「廣度搜尋」與「深度驗證」的核心工具。 WANDR 的核心設計理念 WANDR 專為解決知識型工作中的複雜任務而設計,例如市場分析、盡職調查、文獻回顧與產品比較。這些任務通常要求 Agent 必須具備兩項關鍵能力: 廣度(Wide):必須搜尋足夠廣泛的範圍,以找出所有符合條件的實體。 深度(Deep):必須針對每個實體進行足夠深入的調查,並以具體證據支持每一項主張。 此圖表展示了 WANDR 基準測試中 500 個研究任務在寬度(所需成員數)與深度(每個成員所需記錄數)維度上的分佈,並依三種難度級別進行標記比較。 WANDR 包含 500 項真實的研究任務,並透過階層式、可獨立驗證的記錄結構來評分。與傳統依賴「標準答案」的測試不同,WANDR 採取「證據驗證」機制,會重新抓取 Agent 所引用的網頁,並檢查該網頁內容是否確實支持其提出的主張,這使得該工具能處理隨時間變化的事實。 技術架構與執行流程 WANDR 的評估流程具備高度的自動化與可解釋性,其 pipeline 同時兼具訓練資料生產工廠的功能。開發者可透過以下步驟進行部署與測試: 這張流程圖詳細說明了 WANDR 任務從種子生成、編寫、審核到最終篩選的四個階段建構過程。 確保環境已安裝 Python 3.12、uv 以及 Docker。 複製專案並同步環境: `bash git clone https://github.com/perplexityai/wandr.git cd wandr uv --no-config sync --locked ` 建立環境變數檔案 .env 並填入相關 API Key。 執行環境檢查: `bash ./scripts/wandr check ` 執行快速測試(Smoke Test): `bash ./scripts/wandr smoke-local ` 注意:smoke-local 仍會呼叫付費的 OpenAI 與 Perplexity API,執行前請確認 API Key 與費用。 評估指標與實際影響 根據 Perplexity 的測試結果,目前市場上的系統在處理「廣度與深度」兼具的任務時仍有很大進步空間。在 500 項任務的評測中,Perplexity 的「Search as Code」(SaC)系統在 Soft F1 分數上取得 0.363 的領先,而 Anthropic 則以 0.249 位居第二。 根據 WANDR 基準測試結果,Perplexity (PPLX) 在成本與性能的資源權衡邊界上表現最佳,其 Soft F1 與 Hard F1 分數均顯著超越 Anthropic、OpenAI、Gemini 等競爭對手。 WANDR 不僅提供單一的排行榜分數,其詳細的診斷報告能精確指出 Agent 在發現、資料豐富化、實體識別或證據建構等哪個環節失敗。此外,該工具的結構化設計也為強化學習(Reinforcement Learning)提供了潛在路徑,訓練者可以利用記錄層級的判斷來給予部分獎勵,引導 Agent 學會規劃覆蓋範圍並主動偵測缺失的資訊分支。詳細的技術報告與工具原始碼已公開於 GitHub 專案頁面。 此圖表比較了 PPLX、OpenAI、Anthropic、Parallel、Exa 與 Gemini 在不同成本、中位數延遲及總 Token 消耗量下的 Hard F1 分數表現。 在 WANDR 基準測試中,Perplexity (PPLX) 在成本與性能(精準率與召回率)的權衡前沿上,展現出最佳的深寬度研究能力。原文:https://easyvibecoding.app/curated/2500-perplexity-launches-wandr-agent-benchmark

Episode metadata supplied by the publisher feed · Published Jul 15, 2026

Embed this episode

Ready to play

Perplexity 發布 WANDR 評估 Agent 研究能力

0:00 3:11

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 3 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on July 15, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!