EPISODE · May 1, 2026 · 5 MIN
@dotey:Demis Hassabis:AGI 還缺什麼,Agent 到底行不行,下一個科學突破長什麼樣 Demis Hassabis 是 Google DeepM…
from EasyVibeCoding Podcast · host 宝玉
Demis Hassabis:AGI 還缺什麼,Agent 到底行不行,下一個科學突破長什麼樣 Demis Hassabis 是 Google DeepMind 的 CEO,也是 Isomorphic Labs 的 CEO。他在棋手神童和遊戲開發者的身份之外,拿了認知神經科學的博士學位,研究海馬體和記憶的工作方式。2024 年,他因為 AlphaFold 的工作獲得諾貝爾化學獎。 這次他做客 Y Combinator 的 How to Build the Future 直播,和 YC CEO Garry Tan 聊了四十分鐘。幾個核心話題:當前 AI 範式距離 AGI 還差什麼、Agent 的真實水平、AI 在科學領域的突破模式,以及給深科技創業者的建議。 原始影片:https://www.youtube.com/watch?v=JNyuX1zoOgU 原始標題:Demis Hassabis: Agents, AGI & The Next Big Scientific Breakthrough 要點速覽 Hassabis 認為當前範式(預訓練 + RLHF + 思維鏈)會是 AGI 架構的一部分,但有 50% 的機率還需要一兩個尚未發現的關鍵突破,持續學習、長程推理和記憶是三個未解問題。 百萬 token 上下文視窗聽起來很大,但處理即時影片時只夠錄 20 分鐘,當前把所有東西塞進上下文視窗的做法是「用膠帶糊住的臨時方案」。 AlphaGo 和 AlphaZero 時代的技術(蒙地卡羅樹搜尋等)正在被重新引入當代基礎模型,Hassabis 認為未來幾年的進步將大量來自這些舊想法的規模化應用。 他用下棋來測試 Gemini 的推理能力,發現模型會識別出一步是錯棋,找不到更好選擇後又回去走那步錯棋,這種「缺乏自省」是當前推理系統的核心缺陷。 創造力的真正測試是能否從一段高層描述中發明圍棋這個遊戲本身,AlphaGo 下出 Move 37 級別的創造力還遠遠不夠。 完整虛擬細胞大約還需要 10 年,關鍵瓶頸是無法在不殺死細胞的情況下對活細胞進行奈米級解析度成像。 他給創業者的建議:如果你的 AGI 時間線是 2030 年,深科技創業通常需要 10 年,那 AGI 會在你旅程的中途出現,你的商業計畫必須把這個因素算進去。 【1】AGI 還缺一兩塊拼圖,機率 50/50 Garry Tan 開場問:當前的 AI 範式,大規模預訓練、RLHF、思維鏈,這些東西裡已經包含了多少 AGI 的最終架構?還有什麼根本性的缺失? Hassabis 的回答比較謹慎。他說當前這些組件「幾乎可以確定」會是 AGI 最終架構的一部分,走到今天這一步已經證明了太多東西,不可能突然發現這是一條死路。但在已有的東西之上,可能還需要一兩個大想法。 他列出了三個未解問題:持續學習(continual learning,即模型在部署後持續從新經驗中學習的能力)、長程推理,以及記憶的某些方面。這些問題也許能靠現有技術的漸進式創新解決,也許需要全新的方法。 他給出了一個有意思的機率判斷:50/50。一半機率是現有技術足夠,另一半機率是還缺一兩個關鍵突破。Google DeepMind 兩邊都在押注。 【2】記憶:百萬 token 上下文其實不夠用 話題自然轉到了記憶和上下文視窗。Garry Tan 提到現在的系統每次處理都是無狀態的,持續學習缺失的情況下,大家都在用「夢境循環」(定期批次更新)這類臨時方案。 Hassabis 對這個話題有獨特的發言權。他的博士研究就是海馬體如何將新知識優雅地整合進已有的知識庫。大腦在睡眠(特別是 REM 快速動眼期)中回放重要的經歷片段來鞏固學習,DeepMind 最早的 Atari 遊戲 AI 程式 DQN 就借鑒了這個機制,用「經驗回放」(experience replay)反覆重放成功的遊戲軌跡來加速學習。 我們現在的做法有點像用膠帶糊住,就是把所有東西都塞進上下文視窗。 (“We're kind of using duct tape right now—shove it all in the context window.”) 他接著解釋為什麼這個方案不夠好。百萬 token 上下文視窗聽起來很大,人類的工作記憶平均只有 7 個數字左右,而 AI 有百萬甚至千萬級別的上下文。但問題是,我們把所有東西都扔進去了,不管重要不重要、對不對。更關鍵的是,如果你要處理即時影片流,天真地錄入所有 token 的話,百萬 token 其實只夠 20 分鐘。如果你想讓系統理解你一兩個月的生活,遠遠不夠。 即使儲存空間無限,找到當下決策真正需要的那條資訊,這個搜尋成本也是不可忽視的。Hassabis 認為記憶領域還有很大的創新空間。 【3】AlphaGo 的技術遺產正在復活 Garry Tan 追問 DeepMind 在強化學習方面的歷史積累,AlphaGo、AlphaZero、MuZero 這些系統背後的哲學在今天建構 Gemini 時發揮了多大作用。 Hassabis 說強化學習的重要性「在起伏中輪迴」。DeepMind 從創立第一天起就在做 Agent,Atari 遊戲 AI 和 AlphaGo 說到底都是 Agent 系統,能自主設定目標、做決策、制定計畫。當時選擇遊戲領域是為了讓問題可控,然後逐步挑戰更複雜的遊戲,比如 AlphaGo 之後又做了星海爭霸(AlphaStar)。 過去幾年的核心問題是:能否把這些模型從遊戲推廣到語言和世界模型?而今天所有前沿模型的思維模式和思維鏈推理,其實都可以追溯到 AlphaGo 時代開拓的路徑。 他透露了一個值得關注的資訊:Google DeepMind 正在重新審視當年的一些舊想法,包括蒙地卡羅樹搜尋(Monte Carlo tree search)等方法,在當今基礎模型的規模上重新應用。他認為未來幾年 AI 的很多進步將來自於 AlphaGo 和 AlphaZero 時代的想法與現代基礎模型的結合。 【4】小模型在快速變聰明 Garry Tan 觀察到蒸餾技術讓小模型越來越接近前沿模型的能力,Flash 模型大約能達到前沿模型 95% 的水平,成本只有十分之一。他問蒸餾有沒有極限。 Hassabis 說這是 Google DeepMind 的核心優勢之一。他們當然要建最大的模型來推動能力邊界,但快速把這些能力壓縮到更小模型中是他們的強項。Google 有十幾個十億使用者級的產品,搜尋的 AI 概覽和 AI 模式、Gemini 應用、YouTube、Maps,每一個都需要 AI 服務。幾十億使用者需要極快、極高效、低延遲的服務,這種商業壓力反過來成了技術進步的引擎。 關於蒸餾的理論極限,他說目前沒有看到任何資訊密度的硬性天花板。他們的工作假設是:前沿模型發布半年到一年後,同等能力就會出現在邊緣級小模型上。 他還提到了一個架構設想:未來可能是高效的本地模型處理日常任務(比如音訊和影片流),只在特定情況下才呼叫雲端的前沿模型。這種「本地 + 雲端」的分層架構對隱私和安全特別有意義,尤其是考慮到家用機器人等場景。 【5】Gemini 下棋暴露的推理缺陷 Garry Tan 接著問推理能力:模型能做出很厲害的思維鏈推理,但在聰明大學生不會犯的錯誤上翻車。 Hassabis 認為當前的思維範式還很粗糙,有很大的創新空間。比如可以監控思維鏈的進展、在推理過程中途介入糾正。他經常覺得這些系統在「過度思考」,陷入某種循環。 他舉了一個具體的例子。他有時會用 Gemini 下棋,所有前沿基礎模型在遊戲上都表現很差,但這恰好提供了一個有趣的觀察視窗。因為棋局的規則是確定的,他能很快判斷模型的思維鏈是否在走彎路。 他觀察到的現象是:模型考慮某一步,意識到這步是臭棋,但找不到更好的,於是繞了一圈又回到那步棋,然後走了出去。 在一個真正精確的推理系統裡,你不應該看到這種情況。 (“You just shouldn't be seeing that happening in a very precise reasoning system.”) 這就是他所說的「鋸齒狀智慧」(jagged intelligence):一方面能解國際數學奧林匹亞(IMO)金牌級別的問題,另一方面換個提問方式就會犯基本的算術錯誤。在他看來,這種不一致說明系統缺少某種對自身思維過程的「自省」能力。但他也補充說,修復這種缺陷可能只需要一兩個關鍵調整。 【6】Agent:實驗階段,投入產出比還沒對上 Garry Tan 問 Agent 是炒作還是剛剛開始。Hassabis 的回答是:剛剛開始,但還在實驗階段。 他的論點是:要達到 AGI,你必須有一個能主動解決問題的系統,Agent 就是通向 AGI 的路徑。但目前,Agent 在「完整任務」上還不夠好,主要是因為它們不能在具體使用環境中持續學習和適應。缺乏持續學習是 Agent 無法做到「交付後不管」(fire and forget)的根本原因。 他還提到了 a 個耐人尋味的觀察: 我看到很多人啟動幾十個 Agent 跑 40 個小時,但我不確定產出能匹配這種級別的投入。 (“I see a lot of…
Embed this episode
Ready to play
@dotey:Demis Hassabis:AGI 還缺什麼,Agent 到底行不行,下一個科學突破長什麼樣 Demis Hassabis 是 Google DeepM…
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.