EPISODE · Jun 9, 2026 · 6 MIN
@polynoamial:大規模測試時運算(Test-Time Compute)的影響 tl;dr: 隨著大型語言模型(LLM)能力日益增強,基準測試(benchmark)的效能表…
from EasyVibeCoding Podcast · host Noam Brown
大規模測試時運算(Test-Time Compute)的影響 tl;dr: 隨著大型語言模型(LLM)能力日益增強,基準測試(benchmark)的效能表現越來越取決於「測試時運算」(test-time compute)。事實上,我們可能根本不知道現代大型語言模型的效能上限在哪裡,因為要測量它實在太昂貴了。我們應該改變大型語言模型的評估方式,透過測量效能與 token 數量、成本或時間的關係,將這些因素納入考量。 在 GPT-5.5 發布當天,最初的反應是質疑。基準測試數據確實有所提升,但幅度並不大: 展開數據表GPT-5.5GPT-5.4GPT-5.5 ProGPT-5.4 ProClaude Opus 4.7Gemini 3.1 ProTerminal-Bench 2.082.7%75.1%--69.4%68.5%Expert-SWE (Internal)73.1%68.5%----GDPval (wins or ties)84.9%83.0%82.3%82.0%80.3%67.3%OSWorld-Verified78.7%75.0%--78.0%-Toolathlon55.6%54.6%---48.8%BrowseComp84.4%82.7%90.1%89.3%79.3%85.9%FrontierMath Tier 1-351.7%47.6%52.4%50.0%43.8%36.9%FrontierMath Tier 435.4%27.1%39.6%38.0%22.9%16.7%CyberGym81.8%79.0%--73.1%- 然而,在短短幾個小時內,當人們有時間深入體驗該模型後,很明顯它與 GPT-5.4 相比有著跳躍式的進步。經典的「基準測試網格」顯然沒有反映出全貌。這是為什麼呢? 當我們將 GPT-5.5 與 5.4 進行比較,並以 token 數量作為橫軸時,原因就變得清晰了: 展開數據表(1)CyberGym模型 · ScoreGPT-5.5 · 81.8%GPT-5.4 · 79.0%展開數據表(2)Capture-the-Flags challenge tasks (Internal)項目數值起始(3600, 17%)最佳(50000, 88%)結束(50000, 88%)起始(6000, 10%)最佳(138000, 84%)結束(138000, 84%) GPT-5.5 的評估基準並非與 5.4 使用相同的 token 預算(或美元預算)。一旦我們控制了測試時運算變數,5.5 看起來就比 5.4 強大得多。 我經常在討論這個議題時被問到:為什麼我們不直接使用一個能不斷增加測試時運算直到效能達到高原期(plateau)的 harness 來進行評估?問題在於,根據經驗,這個高原期非常遙遠。有時在實際的預算範圍內,我們甚至根本觀察不到高原期的出現。以下是 @karpathy 的自動化研究實驗,即便經過數百次實驗,效能仍在持續提升: 展開數據表起始(Exp 0)最佳(Exp 630)結束(Exp 630)Running best0.86240.85340.8534 這是 @AISecurityInst 的網路安全評估,Mythos 和 GPT-5.5 的效能即使在超過 1 億個 token 後,依然在快速提升: 展開數據表起始結束Mythos Preview (new) (best attempt)032GPT-5.5-Cyber (best attempt)027Mythos Preview (new) 10x100M025GPT-5.5-Cyber 10x100M023GPT-5.5 10x100M022Mythos Preview (early) 10x100M022Claude Opus 4.6 10x100M017GPT-5.4 10x100M014Claude Opus 4.7 10x100M013Codex-5.3-Codex 5x100M011Claude Opus 4.5 5x100M011GPT-5.1-Codex 5x100M09Claude Sonnet 4.5 5x100M09Claude Sonnet 3.7 10x10M06GPT-4o 10x10M02 請注意,對於更強大的模型,隨著時間推移,效能提升的幅度也更顯著。看起來,隨著模型變得更強,它們在處理更長遠目標時也變得更有效率。效能高原點被推得更遠,甚至可能完全消失。 基於這個原因,我認為評估模型的正確方式是繪製「效能 vs. 測試時運算」的圖表,並以 token 數量、成本或實際執行時間(wall-clock time)作為橫軸。一些基準測試已經朝這個方向發展。例如,ARC-AGI 就測量了分數與成本的關係。 展開數據表項目數值GPT-5.5 (xHigh)($1.4, 85%)GPT-5.4 Pro (xHigh)($6.0, 85%)Gemini 3.1 Pro (Preview)($0.9, 77%)Claude 4.7 (Max)($5.0, 76%)GPT-5.2 (Refine.)($30.0, 73%)GPT-5.5 (Medium)($1.0, 71%),Claude Opus 4.6 (120KMedium)($2.0, 69%)GPT-5.4 (Medium)($0.7, 61%)Claude Sonnet 4.6 (High)($2.0, 61%)GPT-5.2 Pro (High)($15.0, 54%)GPT-5.2 (High)($1.5, 53%)GPT-5.2 Pro (Medium)($8.0, 39%)GPT-5.5 (Low)($0.4, 34%)GPT-5.4 (Low)($0.3, 29%)Grok 4 (Refine.)($30.0, 29%)GPT-5.2 (Medium)($1.0, 27%),Opus 4.5 (Thinking16K)($0.9, 23%)GPT-5 Pro($8.0, 19%)Claude Sonnet 4.5 (Thinking 32K)($0.9, 14%)Claude Opus 4 (Thinking 16K)($2.0, 9%)o3 (High)($1.0, 6%)o3-Pro (Medium)($5.0, 1%)GPT-4.5($2.0, 1%) 另一個合理的選擇是設定明確的 token/時間/成本預算,並將其告知模型。這就像人類在 SAT 或國際數學奧林匹亞競賽中受評估的方式一樣。 每個橫軸都有其權衡之處。不同模型之間的 token 並無法直接比較,因為分詞器(tokenizer)、速度和每個 token 的成本各不相同。美元成本取決於實作細節,例如批次處理(batching)和硬體利用率,因此成本與延遲(latency)之間可以進行權衡。最後,實際執行時間是一個不完美的測量指標,因為像 best-of-N 這種多 Agent 技術可以在不顯著增加延遲的情況下擴展測試時運算。儘管如此,這些曲線中的任何一條都比單一標量數值更能提供資訊。 --- 對 AI 準備度(AI Preparedness)的影響 在發布前沿模型之前,實驗室通常會評估網路安全、生物安全以及其他濫用風險。如果模型跨越了能力門檻,發布可能會被推遲,直到緩解措施到位。但如果能力是推論運算的函數,那麼我們應該在什麼樣的推論預算下進行安全評估呢? 在實務上,大多數模型發布的安全評估並沒有考慮投入該模型的推論量。Gemini 3 Deep Think 的發布及其引發的強烈抗議就是一個很好的例子。 當 Gemini 3 Deep Think 發布時,其基準測試分數遠高於先前的模型。然而,隨之發布的卻沒有任何評估其風險的模型卡(model card)。 展開數據表(1)ARC-AGI-2ARC-AGI-2Gemini 3 Deep Think (Feb 2026)84.6%Gemini 3 Pro Preview (Thinking High)31.1%Claude Opus 4.6 (Thinking Max)68.8%GPT-5.2 (Thinking xhigh)52.9%展開數據表(2)Humanity's Last ExamHumanity's Last ExamGemini 3 Deep Think (Feb 2026)48.4%Gemini 3 Pro Preview (Thinking High)37.5%Claude Opus 4.6 (Thinking Max)40.0%GPT-5.2 (Thinking xhigh)34.5%展開數據表(3)MMMU-ProMMMU-ProGemini 3 Deep Think (Feb 2026)81.5%Gemini 3 Pro Preview (Thinking High)81.…
Embed this episode
Ready to play
@polynoamial:大規模測試時運算(Test-Time Compute)的影響 tl;dr: 隨著大型語言模型(LLM)能力日益增強,基準測試(benchmark)的效能表…
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.