Context rot:這項研究證明了你那百萬 token 的 context window 正在欺騙你 episode artwork

EPISODE · Jul 13, 2026 · 7 MIN

Context rot:這項研究證明了你那百萬 token 的 context window 正在欺騙你

from EasyVibeCoding Podcast · host Carnage

Context rot:這項研究證明了你那百萬 token 的 context window 正在欺騙你 大多數開發者將 context window 視為一個水桶。貼上更多內容、獲得更多資訊,填滿那百萬個 token,模型就能對所有內容進行推理。 事實並非如此。而且這項數據在最新的模型上也同樣適用,而不僅僅是去年的舊模型。 這一切始於 Chroma。2025 年年中,他們針對此議題進行了規模最大的對照研究——涵蓋 18 個前沿模型,進行了 194,000 次測試呼叫。 結果顯示,隨著輸入內容變長,每一個模型的效能都會下降。他們的研究分析非常值得完整閱讀。 當時測試的是 Claude 4 和 GPT-4.1。一年後,在 Opus 4.8、GPT-5.5 和 Gemini 3 上,這種效應雖然減弱了,但從未消失。其機制是結構性的。 本文將拆解這項研究的發現、目前的數據、為什麼更大的 window 無法解決問題,以及你本週應該做出哪些改變。 這是真實的數據,沒有理論空談。 --- 第 1 部分 - 在 Demo 中表現驚人,在生產環境卻崩潰的現象 想像一個研究型 Agent。它運行在一個擁有 1M-token window 的前沿模型上,被餵入了所有資料——逐字稿、筆記、整份風格指南。 每次呼叫大約會消耗 320,000 個 token。內部的 Demo 完美無缺。每個人都印象深刻,於是你將其上線。 在生產環境運行兩週後,模式出現了。長篇逐字稿中間的關鍵事實開始遺失。 Agent 引用了錯誤季度的財報。引用了錯誤的來源。歸因錯誤。而且每次都表現得信心滿滿。 你檢查了 Prompt 是否有 Bug。結果並沒有。window 足夠大,模型很強大,但輸出結果依然錯誤。 這不是一個可以透過修補程式解決的 Bug。這就是 context rot(上下文腐敗),而 Chroma 是第一個精確量化這種情況有多嚴重的團隊。 展開畫面重點圖中標題為「PART 1」與「Crushes the demo, dies in production」,副標題為「320,000 TOKENS PER CALL - AND THE FACTS GO MISSING」。 畫面呈現一個三個階段的流程圖: 第一階段(標籤為「demo」):內容為「Internal eval」,描述為「Full transcripts, notes, style guide. Flawless.」。 第二階段(標籤為「ship」):內容為「Two weeks live」,描述為「Facts from the middle start disappearing」。 第三階段(標籤為「bug?」):內容為「Wrong quarter. Wrong source.」,描述為「Confident every time. No prompt bug to find.」。 底部文字為:「the window was big enough. the model was strong. the output was still wrong.」 --- 第 2 部分 - 每個人都在吹捧的基準測試其實是個騙局 這是 AI 行銷不想讓你面對的真相。每一個百萬 token 的發布會都揮舞著同一個基準測試:大海撈針(needle in a haystack)。 在巨大的文字區塊中隱藏一個句子,要求模型找到它。模型的得分接近完美。這就是為什麼實驗室喜歡展示它。 但看看它是如何構建的。那根「針」是「在舊金山最棒的事就是去多洛雷斯公園(Dolores Park)」,而問題是「在舊金山最棒的事是什麼」。 問題和答案共享相同的詞彙。這只是一個詞彙匹配,僅此而已。 模型只是定位了看起來像問題的 token。這證明了一件事:它可以在輸入中找到一個事實。 但這完全無法證明它具備跨越該輸入進行推理的能力。而推理正是真實 Agent 的全部工作。 因此,Chroma 重建了測試,要求模型進行真正的理解,而不是關鍵字匹配。這就是那 18 個模型全部敗下陣來的地方。 展開畫面重點標題:PART 2 The benchmark everyone brags about is a trick NEEDLE IN A HAYSTACK - A LEXICAL MATCH, NOTHING MORE 方框內容: ...essays about startups and painting and how to do great work... the best thing to do in San Francisco is go to Dolores Park... ...more unrelated text filling the context window... QUESTION what's the best thing to do in San Francisco? MODEL just matches the words. never had to reason. 底部文字: it proves the model can find a fact. it proves nothing about understanding it. 畫面重點:此圖透過一個簡單的範例,指出當前流行的「大海撈針」測試(Needle In A Haystack)本質上只是在進行詞彙匹配(Lexical Match)。圖中展示模型僅是從長文本中提取出與問題關鍵字對應的片段,而非真正理解內容,因此無法作為模型具備推理能力的證明。 --- 第 3 部分 - 當模型必須思考而非匹配時會發生什麼 這就是讓它們崩潰的版本。答案不再是逐字匹配,而是需要一個小小的推論。 問題:「哪個角色去過赫爾辛基?」文字中的「針」:「Yuki 住在 Kiasma 美術館隔壁。」 要回答這個問題,模型必須知道 Kiasma 位於赫爾辛基,然後將兩者連結起來。人類可以不假思索地做到,但模型卻無法掌握。 在短長度下,它們表現得很好。但隨著 context 增加,這 18 個模型的準確度都急劇下降。 這裡有一個關鍵點,徹底粉碎了「這只是個難題」的藉口:Chroma 保持問題不變,僅改變周圍文字的長度。 同樣的問題。同樣的答案。周圍更多的 token。更差的表現。 這就是 context rot 的定義:隨著 window 被填滿,即使任務從未改變,模型也會變得更笨。 展開畫面重點圖表標題為「PART 3 Make it think, not match」,副標題為「SAME QUESTION, MORE TOKENS AROUND IT, WORSE ANSWER」。 圖表分為左右兩個區塊: 左側綠色區塊「SHORT CONTEXT」: - 問題:「Which character has been to Helsinki?」 - 提示(needle):Yuki lives next to the Kiasma museum. - 結果:✓ model connects Kiasma → Helsinki 右側紅色區塊「SAME TASK, LONGER INPUT」: - 說明:identical question. identical answer. just more text wrapped around it. - 結果:X accuracy drops across all 18 models 底部註解:the task never changed. only the length did. that's context rot in one line. --- 第 4 部分 - 應該終結爭論的數據 這裡不再是憑感覺,而是規格問題。有三個發現經受住了生產環境的考驗。 第一,每個模型的效能都隨長度下降。沒有模型能在其宣稱的 window 範圍內保持穩定。 1M-token 的模型在超過約 200,000 個 token 後,表現就不再像 1M-token 模型了。200K 的模型在 80,000 到 100,000 個 token 時就開始崩潰。 第二,Prompt 的中間部分是「死亡地帶」。將關鍵事實放在 20 份文件 context 的開頭或結尾,準確度依然很高。 將其放在第 5 到第 15 個位置——也就是中間——大多數模型的準確度會下降 30 個百分點以上。 這就是舊有的「迷失在中間(lost in the middle)」效應,但比 2023 年史丹佛大學的數據顯示的還要嚴重。它並沒有隨著規模擴大而改善。…

Episode metadata supplied by the publisher feed · Published Jul 13, 2026

Embed this episode

Ready to play

Context rot:這項研究證明了你那百萬 token 的 context window 正在欺騙你

0:00 7:07

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 7 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on July 13, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!