Google 發布 Gemini 3.7 Flash,程式開發評測領先前代並改善 Agent 工作流程 episode artwork

EPISODE · Aug 13, 2026 · 7 MIN

Google 發布 Gemini 3.7 Flash,程式開發評測領先前代並改善 Agent 工作流程

from EasyVibeCoding Podcast · host koray kavukcuoglu

Google 發布 Gemini 3.7 Flash,程式開發評測領先前代並改善 Agent 工作流程。 這次更新也以三個 Agent 協作、從零訓練機器人控制模型的展示,說明其 agentic performance 與 coding accuracy 的進展。 來源:@GoogleDeepMind(回覆)|Gemini 3.7 Flash 產品名稱與彩星圖示 發布背景 發文者 Koray Kavukcuoglu 表示,Flash 系列在短時間內快速迭代,從 Gemini 3.5 到 Gemini 3.7 約三個月;Google 其他官方貼文則指出,Gemini 3.7 Flash 僅在 Gemini 3.6 Flash 推出約三週後登場。Logan Kilpatrick 將這次進步歸因於演算法改良,並強調模型速度快、價格較低,已可透過 API、Google AI Studio、Google Antigravity 等管道使用。Google DeepMind 將它定位為適合程式開發、知識工作與網頁開發的「workhorse model」,也就是面向日常生產工作的主力模型。 Gemini 3.7 Flash 的產品標誌與四色星形圖示浮水印於淺藍色漸層背景上。 評測表現 相較 Gemini 3.6 Flash,Gemini 3.7 Flash 在多項程式開發與企業工作流程評測中提升,發文者列出的結果包括: DeepSWE v1.1:發文者列出的整體評測由 37.0% 升至 65.3%。 Code Arena Elo:1506 成長至 1588。 AutomationBench:13.4% 成長至 30.4%。 Gemini 3.7 Flash 在多項程式碼與 agent 工作流程測試中相較 3.6 Flash 均有大幅提升,並在跨領域 benchmark 中與 GPT-5.6 Terra 及 Claude Sonnet 5 各有高低。 Google 的產品文章提供了更細的對照數據。針對產出可直接用於生產環境的程式碼,FrontierCode 1.1 Main 從 34.4% 提升至 43.6%,Google 產品文章的文字口徑則顯示,DeepSWE v1.1 從 49.0% 提升至 65.3%。同篇不同附圖分別以 48.6% 或 48.0% 標示前代基準,反映來源版次或對照組不同,不宜混為同一組數據。在 Arena.ai 的 WebDev Arena 中,Elo 分數由 1538 提升至 1588;GDP.pdf 文件理解評測則由 22.0% 提升至 34.0%。這些結果涵蓋除錯、問題修復、複雜文件處理與真實世界企業流程,而不只是單次程式碼生成。 來源:@OfficialLoganK(回覆)|Gemini 3.7 Flash 在 DeepSWE V1.1 長期軟體工程基準測試獲得 65.3% 的成績,顯著超越 Gemini 3.6 Flash 的 48.6%,在各模型中僅次於 GPT-5.6 Terra 的 69.6%。 程式開發與網頁生成 Gemini 3.7 Flash 被描述為更擅長處理除錯與 issue resolution,也提高首次產出程式碼的正確率。網頁開發方面,模型能用較少的 prompt 產生功能更完整的版面與應用程式;進行 UI 生成時,還能依照螢幕截圖、圖片或完整 design system,維持較高的設計遵循度與視覺一致性。 來源:@OfficialLoganK(回覆)|Gemini 3.7 Flash 在 FrontierCode 1.1 Main 的正式程式碼品質評測中以 43.6% 的準確率領先 Claude Sonnet 5、GPT-5.6 Terra 與前代 Gemini 3.6 Flash。 官方展示包含多種端到端產出:從文字 prompt 即時建立可遊玩的 3D 遊戲,並搭配 Nano Banana 動態生成角色、物品與材質;也展示以 Gemini 3.7 Flash 協調 sub-agents,再由 Gemini Omni 產生具互動視差效果的 landing page。此外,模型能把靜態 PDF 年報轉成包含即時圖表與彙整洞察的互動式資料故事。 來源:@OfficialLoganK(回覆)|Gemini 3.7 Flash 在 Code Arena 網頁開發(Web development)基準測試中以 Elo 1588 領先 Claude Sonnet 5、Gemini 3.6 Flash、Muse Spark 1.2 及 GPT-5.6 Terra。 Agent 協作展示 發文者特別分享了一項機器人實驗:以三個 Agent 組成團隊,讓 Gemini 3.7 Flash 在 MuJoCo 物理模擬環境中,從零開始自主訓練四足機器人的控制模型。媒體畫面顯示,這套展示採用「3-Agent Conditional Branching Graph」,由 Coordinator、Evaluator 與 Tuner 分工,反覆執行訓練、觀察與調整。 Gemini 3.7 Flash 訓練機器人模型的展示畫面 Coordinator 管理 Evolutionary Strategies(ES)的族群基準,並監控前進距離與保持直立等條件。 Evaluator 讀取記憶體中的 video_frames 陣列與數值遙測資料,分析連續畫面的運動流與腿部離地高度,再輸出結構化 JSON 診斷。 Tuner 依據診斷結果調整 rewardfunction.py 中的 computereward,以及 Kp、Kd、sigma、ACTION_SCALE 等超參數,將建議回傳給 Coordinator。 來源:@OfficialLoganK(回覆)|Gemini 3.7 Flash 在 AutomationBench 企業工作流程自動化測試中以 30.4% 領先各模型。 展示畫面所列的機器人設定包括 0.4m × 0.2m × 0.1m、0.8kg 的軀幹、四條各有髖關節與膝關節的腿、8 個 hinge joints,以及最高 2.0 Nm 的馬達扭矩。控制迴圈為 50 Hz,dt = 0.01s,每個 step 使用 2 個 substeps。這些屬於展示中出現的實驗設定,不應直接視為 Gemini 3.7 Flash 的通用產品規格。 來源:@GoogleDeepMind(回覆)|Gemini 3.7 Flash 在 DeepSWE V1.1 評測取得 65.3% 的成績,較前代 Gemini 3.6 Flash 的 48.6% 大幅提升,並超越 Claude Sonnet 5 與 Muse Spark 1.2。 持續診斷與障礙測試 展示中的 Orchestrator Agent 會重複執行 ES 最佳化,直到機器人停止學習,再把影片交給 Multi-Modal Evaluator Agent 判斷問題,最後由 Tuner Agent 提出神經政策更新。媒體內容設定的最終驗證條件,是在完整 15.0 秒的 evaluation episode 中,champion policy 必須達到 distanceTraveled >= 15.0m 與 timeUpright >= 10.0s;訓練期間則可由 Coordinator 與 Tuner 動態選擇 rollout horizon,例如先使用 3.0 至 5.0 秒的探索區間,再逐步延長。 來源:@GoogleDeepMind(回覆)|Gemini 3.7 Flash 在 FrontierCode 1.1 Main 的正式程式碼品質測試中以 43.6% 的成績領先 Claude Sonnet 5、GPT-5.6 Terra 與 Gemini 3.6 Flash。 在不重新訓練、也不使用 privileged vision 的情況下,展示進一步測試了可推動木箱、固定階梯與多物件碎片場。畫面中的 Phase 2 報告指出,Gen 90 政策能與可移動障礙物互動,但面對固定垂直障礙時,單靠平面行走策略仍有限制。Gemini 3.7 Flash 的 Evaluator 建議提高擺腿離地高度,或加入以自身視角取得的地形高度感測,例如 egocentric raycast elevation grids;後續 Phase 3 則轉向高離地的 leaping gait,目標是讓機器人像青蛙一樣跳過全部物件,並持續迭代到視覺評估確實呈現跳躍動作。 來源:@GoogleDeepMind(回覆)|Gemini 3.7 Flash 在 Code Arena 的 Web development 基準測試中以 1588 分領先 Claude Sonnet 5、Gemini 3.6 Flash 等模型。 開發體驗 Googl…

Episode metadata supplied by the publisher feed · Published Aug 13, 2026

Embed this episode

NOW PLAYING

Google 發布 Gemini 3.7 Flash,程式開發評測領先前代並改善 Agent 工作流程

0:00 7:55

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 7 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on August 13, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!