Google 發布 Gemini 3.8 Flash,串起程式執行、除錯與反覆修改的代理式迴圈 episode artwork

EPISODE · Sep 2, 2026 · 2 MIN

Google 發布 Gemini 3.8 Flash,串起程式執行、除錯與反覆修改的代理式迴圈

from EasyVibeCoding Podcast · host Google

Google 發布 Gemini 3.8 Flash,串起程式執行、除錯與反覆修改的代理式迴圈。淺藍色背景的發表公告畫面,中央以黑字標示「Introducing Gemini 3.8 Flash and 3.8 Flash Cyber」,下方帶有四色四角星標誌,背景帶有毛玻璃質感的幾何光影。這次發布同時展示一般 Flash 的廣泛產品入口,以及 Cyber 僅開放給通過審核的防守方使用的 Fairwind 安全邊界。模型定位 Google 將 Gemini 3.8 Flash 稱為「主力型工作模型」,表示它在維持 Gemini 3.7 Flash 速度與低成本定位的同時,加強程式開發、複雜工程、代理式任務與多步推理。Koray Kavukcuoglu 更稱它在複雜工程任務中勝過多數較大型前沿模型;不過這是第一方定位,仍要在相同評測框架(harness)、模型版本與成本條件下核對。Gemini 3.8 Flash Cyber 則被定位為 Google 目前能力最強的資安模型,主攻找出並修補漏洞,並在 CWE-Bench 位於帕累托前沿。Gemini 3.8 Flash Cyber 在 CyberGym C/C++ 漏洞發現評測(Pass@1)中以 86.2% 得分領先 GPT-5.5-Cyber、Mythos 5、GPT-5.6 Sol 與 Gemini 3.5 Flash Cyber。代理式程式開發示範 GoogleAI 展示 Gemini 3.8 Flash 在 Google Antigravity 中完成一段 66 秒的互動流程:模型先建立 3D 奇幻解謎遊戲,再實際遊玩、觀察錯誤,接著修改程式碼來修正問題。重點不只是產生程式碼,而是能在複雜專案中操作,把原生影片理解、程式執行、除錯與反覆修改串成一個代理式迴圈。來源:@GoogleAI|執行 Google Antigravity 與 Gemini 3.8 Flash 建構的 3D 奇幻解謎遊戲實機展示影片展示的遊戲包含多個章節與任務,例如第一章「CHAPTER I: THE SEALED VESTIBULE」要求解除偉大符文閘門、閱讀大法師伊芙琳的日誌,並依季節順序點燃四大元素火盆;後續還有「CHAPTER II: THE ALCHEMIST'S DESPAIR」與「CHAPTER III: THE SHATTERED SPIRE」。畫面也出現 100 生命值、100 魔力值,以及火、冰、風、地、光等能力圖示。不過這只是單次能力示範,原始資料未提供提示詞、完整執行紀錄、成功率或可重現的評測框架,不能單獨視為正式評測結果。一款第一人稱奇幻冒險遊戲的遊玩畫面,左上角顯示章節名稱「CHAPTER 1: THE SEALED VESTIBULE」與任務目標,畫面右側持有一支帶有發光魔法圓環的法杖,下方中央則排列著五個法術快捷列與血量、魔力數值。官方規格與產品入口 Gemini 3.8 Flash 的 API 文件顯示,模型可接受文字、圖片、影片、音訊與 PDF 輸入,最高支援 1,048,576 個輸入 token 與 65,536 個輸出 token。功能包括脈絡快取、程式執行、電腦操作預覽、檔案搜尋、函式呼叫(function calling)、Google Maps 與搜尋依據,以及結構化輸出;思考等級可選低、中、高。Batch、Flex 與 Priority 推論也可使用,但不支援最低思考等級。完整文件見 Gemini 3.8 Flash API 模型文件。產品可用範圍包括:開發者可在 Antigravity、Google AI Studio 與 Android Studio 使用。 代理工作流程可使用 Antigravity 與 Agent Platform,介面工作則可使用 Stitch。 企業可從 Gemini Enterprise 的模型選單使用。 Google AI Pro 與 Ultra 使用者可在 Gemini 應用程式、搜尋的 AI 模式與 Google Sheets 使用。官方評測結果 Google 的評測矩陣涵蓋程式開發、代理式任務、文件、影片、科學與作業系統操作,Gemini 3.8 Flash 的數據包括:DeepSWE v1.1:73.7%;GDPval-AA v2:Elo 1545;Vals Finance Agent v2:61.4%。 Harvey Legal Agent all-pass:10.0%;Terminal-Bench 2.1:89.4%;Terminal-Bench 4.0:19.1%;GDP PDF:35.0%。 CharXiv reasoning:86.2%;LVBench 代理式模式:87.8%,靜態模式:87.1%;Humanity's Last Exam Verified:54.9%。Gemini 3.8 Flash 在 HLE-Verified 多學科專家推理基準測試中以 54.9% 的得分率領先 GPT-5.6 Sol (54.5%)、Claude Opus 5 (54.4%)、Gemini 3.7 Flash (53.6%)、GPT-5.6 Terra (51.1%) 與 Claude Sonnet 5 (31.0%)。OSWorld 2.0:59.0%;BioMysteryBench 在「人類可解」題目為 88.8%,「人類高難度」題目為 56.5%;LABBench2:86.2%。Gemini 3.8 Flash 在 Vals Finance Agent v2(61.4%)、Harvey's Legal Agent Benchmark(10.0%)、Terminal-bench 2.1(89.4%)、CharXiv Reasoning(86.2%)、LVBench(87.8%)與 LABBench2(86.2%)等多項 Agent 與推理測試中取得領先,但在 DeepSWE v1.1、GDPval-AA v2、Terminal-bench 4.0、GDP.PDF 及 OSWorld-2.0 等項目落後於 Claude Opus 5 或 GPT-5.6 Sol,整體表現各有高低。Gemini 3.8 Flash Cyber 的官方數據則分開報告:CyberGym pass@1 為 86.2%,CWE-Bench 為 47.2%;Google 另稱其在涵蓋 20 種程式語言的內部真實世界漏洞測試中,表現超過 70%。Fairwind 頁面列出的 CyberGym 對照包括 GPT-5.5-Cyber 85.6%、Mythos 5 83.8%、GPT-5.6 Sol 83.6% 與 Gemini 3.5 Flash Cyber 77.5%;CWE-Bench 則是 Fable 5 的 47.8% 對 Gemini 3.8 Flash Cyber 的 47.2%。Cyber 仍只開放給通過審核的防守方,須透過 Fairwind Program 取得;實際審核、執行輪次與配額條件未在來源中說明。來源:@koraykv|Gemini 3.8 Flash Cyber 在 CWE-Bench 的 Pass@1 與每任務成本權衡中位於 Pareto 曲線前沿,在維持高 Pass@1 表現的同時顯著降低單次 rollout 成本。價格與外部驗證 Gemini 3.8 Flash 的首發優惠價持續至 2026 年 12 月 31 日,每百萬個輸入 token 為 $0.75,每百萬個輸出 token 為 $3.75;自 2027 年 1 月 1 日起調整為 $1.50 與 $7.50,快取讀取另有 90% 折扣。也就是說,模型的低成本定位有明確期限,規劃長期預算時不能只採用首發價格。來源:@koraykv|Gemini 3.8 Flash 與 Claude Opus 5、DeepSeek v4 Pro 等模型在 DeepSWE V1.1 評測中的每任務平均成本與正確率表現比較。Artificial Analysis 以自己的評測框架(harness)測試同一發布版本,結果不屬於 Google 官方矩陣:Intelligence Index:高思考強度 59、中思考強度 57、低思考強度 52;Gemini 3.7 Flash 高思考強度為 56。來源:@ArtificialAnlys(回覆)|在 Artificial Analysis 的 Intelligence Index 中,Gemini 3.8 Flash 高思考強度拿到 59 分,高於 Gemini 3.7 Flash 高思考強度的 56 分,以及 Gemini 3.8 Flash 低思考強度的 52 分。每任務成本:高思考強度 $0.58、中思考強度 $0.41、低思考強度 $0.24;Gemini 3.7 Flash 高思考強度為 $0.40。來源:@ArtificialAnlys(回覆)|Ar…

Episode metadata supplied by the publisher feed · Published Sep 2, 2026

Embed this episode

Ready to play

Google 發布 Gemini 3.8 Flash,串起程式執行、除錯與反覆修改的代理式迴圈

0:00 2:33

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 2 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on September 2, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!