EPISODE · Sep 9, 2026 · 5 MIN
Claude Code 的 prompt-audit 在 Opus 5 客服測試中降低成本 14.6%,準確率提高 5.3 個百分點
from EasyVibeCoding Podcast · host ClaudeDevs
Claude Code 的 prompt-audit 在 Opus 5 客服測試中降低成本 14.6%,準確率提高 5.3 個百分點。三個優化方向 ClaudeDevs 在 2026 年 9 月 8 日的文章指出,降低成本不必直接犧牲結果品質,重點包括:提高 prompt cache 命中率,避免重複計算輸入內容。 升級至 frontier Claude models 時,移除不再適用的 prompt anti-pattern。 依任務難度校準 effort,不把「更高 effort」一律視為更好。Prompt caching 機制 Claude 會先把 prompt 預填充成內部工作狀態,也就是 key-value(KV)快取;後續請求若從相同前綴開始,就能讀取既有狀態,而不必重新計算完整輸入,快取讀取的計價也低於完整輸入。這套機制有三項關鍵限制:快取綁定特定 model、前綴內容必須逐 byte 完全一致,而且 TTL 有限;文章特別指出,5 分鐘 TTL 是從請求開始時起算。實務上,effort 設定會寫入內容前方,因此在對話中途改變 effort 可能破壞快取;只有包括 Opus 5 與 Fable 5.1 在內的部分 Claude models,才支援不中斷快取地更新。系統提示中的動態時間戳或 ID、重新排序的工具定義,以及分支或子 Agent 的非完全相同前綴,也都可能造成 cache miss。Claude Console 與 cache diagnostics API 可顯示未命中的原因及兩次請求開始分歧的位置。Claude Opus 5 在 prompt 快取監控面板中展現 71.3% 的快取讀取比例(較前 7 天提升 8.2%)與 12.4B 快取讀取 token 量(較前 7 天提升 11.4%),同時統計 1.2B 快取未命中 token 的原因歸因。prompt-audit 清理結果 從舊版 Claude 遷移至 frontier models 時,原本有效的提示可能反而增加 token 消耗或導致錯誤。文章列出的常見問題包括「double-check your work」等重複驗證要求、要求模型極度詳盡的強調語、固定的 scratchpad 與逐步推理模板、過時的 few-shot 範例、互相矛盾的規則,以及較舊 Claude 世代使用的手動 thinking 設定。顯示 Claude 平台快取層級的架構圖,從上到下依序為全域快取的 System instructions 與 Tools、專案快取的 CLAUDE.md memory、工作階段快取的 Session state,以及每回合遞增的 MessagesClaude Code 可執行 /claude-api prompt-audit,掃描工作目錄中的提示詞、skills 與工具描述、呼叫 Claude API 的應用程式碼,以及 CLAUDE.md 等 Claude Code 設定。文章以 customer-support benchmark 測試 Opus 4.8 遷移至 Opus 5:六組舊 prompt 各自植入一種 anti-pattern,先只替換 model ID,再執行一次 prompt-audit。清理後平均成本降低 14.6%,準確率從 91.7% 提高至 97.0%,增加 5.3 個百分點。成本下降來自移除多餘工具呼叫與重複推理;準確率提升則包括修正已退役的 thinking 設定、消除矛盾退款規則,以及避免手動 scratchpad 與 Opus 5 內建 thinking 衝突。經過 /claude-api prompt-audit 處理後,Opus 5 audited 以 2.93¢ 的成本達到 97.0% 的正確率,相較於 Opus 5 unaudited 提升了 5.3 個百分點並降低 0.49¢ 成本。Effort 的成本取捨 effort 代表 Claude 願意投入多少推理、驗證與替代方案探索。不同任務的最佳點差異很大:在 FrontierCode Diamond 最難的 50 項任務中,Claude Fable 5 以 low effort 得分 11.5%,每項任務 $5.35;max effort 得分 30.9%,每項 $19.00。得分成長為約 2.7 倍,成本則成長為約 3.5 倍。 在不使用工具的 Humanity's Last Exam 中,Claude Fable 5.1 從 low effort 的約 53%、每題約 $0.30,提升到 max effort 的約 61%、每題約 $2.23;最後增加的約半個百分點落在 benchmark 每次執行的雜訊範圍內,卻增加 46% 成本。 高 effort 可能造成過度思考、增加延遲與成本,甚至降低品質;low effort 則可能在蒐集足夠證據前停止,少做工具呼叫與必要檢查,讓答案建立在不完整資訊上。Claude Fable 5 在 FrontierCode Diamond 上的表現隨著 effort 調高而提升,從 low effort 下每任務 $5.35 取得 11.5% 分數,增加至 max effort 下每任務 $19.00 取得 30.9% 分數(分數提升 19.4 個百分點,成本約為原本的 3.5 倍)。hillclimb 搜尋配置 /claude-api hillclimb 會把 evaluation 拆成 train 與 test,提出設定變更,並讀取 train 中失敗的案例來修正 prompt。文章在 customer-support benchmark 從 Opus 4.8 的預設 high effort 開始,先改用 Opus 5 low effort 並套用 prompt-audit,使 train 準確率達到 98.9%,每張 ticket 成本降至 2.6 美分;接著測試 Sonnet 5 low effort,成本降至每張 1 美分,但準確率跌至 88.9%。系統根據失敗案例加入 routing 規則與退款上限交叉參照後,Sonnet 5 以相同成本回到 98.9%。在 CursorBench 3.2 中,Claude Fable 5.1 在不同 effort 設定下的每任務成本與分數權衡表現領先 Claude Fable 5。在未被搜尋流程看過的 14 張 held-out customer-support tickets 上,最終配置準確率為 90.5%,原始設定為 78.6%,成本約為原設定的五分之一。這項結果限定於 14 張 held-out tickets 與特定原始設定。這張圖呈現訓練集上的工單成本與決策準確率:Opus 4.8 high effort 的起始準確率為 74.4%;切換模型並調整提示詞後,Sonnet 5 low effort 在約 1¢ 的工單成本下取得更高準確率。cost-optimize 與基準結果 /claude-api cost-optimize 會分析 token 消耗來源,套用降低成本的調整;若提供 evaluation,還會比較不同 effort 與 model 選擇下的成本/效能。文章以 Sonnet 5 為基準,在四個公開 benchmark 報告:LegalBench:成本降低約 58%,透過共享前綴快取、low effort 與 Batch API,thinking tokens 從 102,779 降至 8,284,pass rate 維持在雜訊範圍內。 tau2-bench retail:明確放置快取 breakpoint 後,成本降低 72%,pass rate 維持平坦。 OfficeQA Pro:加入批次處理與文件快取,成本從 $136.20 降至 $64.87,約降低 52%。 SWE-bench Verified:預設設定原本已正確使用快取,改用 medium effort 並限制 Agent 只輸出幾句精簡文字後,成本降低約 55%;每項任務中位步驟數從 29 降至 17,prompt tokens 從 75.2M 降至 33.7M。上述節省數字都對應具名 workload 與特定設定,文章未主張能套用至每個應用程式。tau2-bench (retail)、LegalBench、OfficeQA Pro 與 SWE-bench Verified 在成本優化後,每次執行成本降低 52.4% 至 72.7%,分數變動則介於 -3.3pp 至 +4.5pp 之間。建議使用順序 已遷移至 frontier Claude model 時,先執行 /claude-api prompt-audit 檢查既有提示詞、skills 與工具描述;需要完整成本盤點時使用 /claude-api cost-optimize;若有 evaluation 並希望搜尋成本與效能配置,則使用 /claude-api…
Embed this episode
Ready to play
Claude Code 的 prompt-audit 在 Opus 5 客服測試中降低成本 14.6%,準確率提高 5.3 個百分點
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.