Uber agent software factory 請求量增 9.4 倍,單次 session 成本降 52% episode artwork

EPISODE · Aug 30, 2026 · 5 MIN

Uber agent software factory 請求量增 9.4 倍,單次 session 成本降 52%

from EasyVibeCoding Podcast · host Uber Engineering

Uber agent software factory 請求量增 9.4 倍,單次 session 成本降 52%。規模與成效 Uber Engineering 的官方文章指出,超過 70% 的 pull requests 可歸因於本機或雲端 Agent;工程師已建立超過 3,600 個可重複使用的 skills,每日執行超過 30,000 次。2026 年 2 月至 8 月中旬,weekly active users 成長為 7 倍,requests 成長為 9.4 倍,但整體支出維持穩定。Uber agent software factory 自 2026 年 2 月至 8 月期間每週活躍使用者成長 7 倍、Agent requests 成長 9.4 倍,而整體 Cost 支出逐漸趨於穩定。成本控制機制 Uber 透過多項架構與排程策略控制 agent 成本:Uber 在固定模型條件下,每 1,000 次請求成本與每 session 成本均自高點顯著下降在不同 model 之間採用 managed routing,並預設 Medium reasoning。 約在 400,000 token 觸及 compaction,壓縮過長的 context。 依需求設定 prompt-cache TTL,降低重複處理成本。 將 MCP 形態的能力移到 CLI、tool-search 或 code-mode 介面後方。架構與執行環境分類圖,頂端橫列標示 Code Gen、Validate、Deploy、Observe、Maintain 與 SKILL CLOUD 等生命週期階段,下方分為 SPECIALIZED AGENTS、GENERAL AGENTS、SESSIONS W/ SKILLS 及 RAW SESSIONS 四大類,詳細列出 Minion、uReview、Agentic XP、Conan AI、Fawkes、Cortana 等 agent 與相關計費維度與執行環境圖示。因此,固定 model 每 1,000 次 requests 的成本較高峰下降約 34%,每個 session 的成本則較 2026 年 6 月高峰下降 52%。Uber 透過增加 Users 與 Sessions / User 以推動 adoption and engagement,同時縮減 agent trajectories 與 unit price(Price / Token),在週活躍使用者成長 7 倍與請求增長 9.4 倍下,實現每 session 成本下降 52% 並穩定整體支出。系統與衡量方式 Uber 也建立約 2,400 萬個節點、8,000 萬條邊的 context graph,串聯程式碼、負責人與組織知識。文章主張應以 session 與 workflow 衡量成本和產出,而不是只看 requests 數量;後者本身無法證明實際價值,也不能單獨解釋支出。五列三欄的評估指標表格,橫跨 Layer、Metrics 與 What it answers 三個欄位,詳細列出從 Portfolio、Unit economics, per tool、Model economics、Driver decomposition 到 Managed agent outcomes 各層級的成本與效能衡量指標及其解答的業務問題。四欄列結構的表格,左側為類別欄位(Price / Token、Tokens / Request、Requests / Turn、Visibility & Education),右側則羅列了相對應的技術規格與功能細節。Frontier Model C 在 uReview benchmark 以 F1 分數 0.50(單次 review 成本 $0.47)位於 Pareto frontier 最上端,領先其他 10 種模型與 harness 設定組合。在 MAIN THREAD 工作流程中 1-hour TTL 以 2.40x 的總成本較 5-minute TTL 便宜 39%;而在 SUBAGENT 工作流程中 5-minute TTL 以 1.65x 的總成本較 1-hour TTL 便宜 31%。Tool search + the CLI 模式在 context window 中僅佔用 near zero 的 token,顯著少於 Install each server 模式所消耗的 ~50-70,000 tokens。比較 MCP TOOL USE 與 CODE-MODE 兩種架構的序列圖顯示,前者每個步驟皆為 model turn 並在 3 到 7 個 turn 中消耗 903 至 1,431,594 tokens,後者則由 model 撰寫 script 讓 loop 在 model 外部執行,僅需 1 個 model turn 與約 400 tokens。Code-mode 在各項 Query 測試中每筆 Query 消耗的 token 均低於 LLM tool-use,可節省 55% 至 ~100% 的 token 數。架構圖說明 MCP GATEWAY 如何透過單一 shell 指令(aifx mcp call )在 context 內外連接多個 SaaS 伺服器與對應的工具數量,包含 Workspace suite 49 tools、Project tracker 46 tools、Messaging 34 tools、Issue tracker 28 tools 與 Design 16 tools。WITH THE GRAPH 在回答 Forge 車輛列表查詢問題時耗時 38 秒並獲得 30 / 30 滿分(CORRECT),優於 WITHOUT THE GRAPH 的 20 分 09 秒與 19 / 30 分(WRONG)。顯示工程師日常視角的命令列狀態介面圖,頂端標題為 WHAT AN ENGINEER SEES, ALL THE TIME,下方區塊列出主機與分支名稱、包含 46k token 與佔比 11%/400k 的 token 使用量進度條,並顯示 Sonnet 4.6 (1M) 模型、費用、session 狀態與相關網址。某軟體操作介面的 Overview 總覽頁面,頂部列出導覽標籤與各項指標計數,下方卡片顯示總花費 $4162.07、433 次 sessions、95% 快取命中率、快取未命中成本 $1097.82 及潛在節省 $1213.87,並提供日期範圍與專案篩選下拉選單。原文:https://easyvibecoding.app/curated/3186-uber-agent-software-factory-requests-cost-reduction

Episode metadata supplied by the publisher feed · Published Aug 30, 2026

Embed this episode

Ready to play

Uber agent software factory 請求量增 9.4 倍,單次 session 成本降 52%

0:00 5:37

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 5 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on August 30, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!