EPISODE · Sep 3, 2026 · 6 MIN
Meta 發布 Muse Spark 1.3,內部比較少用約 25% tokens,支援長程 Agentic 工作
from EasyVibeCoding Podcast · host Mark Zuckerberg
Meta 發布 Muse Spark 1.3,內部比較少用約 25% tokens,支援長程 Agentic 工作。發布與可用性 Meta 的 @AIatMeta 表示,Muse Spark 1.3 已開始在 Muse Code 與 Meta Model API 推出;既有 reasoning modes 目前可用,但 max reasoning 要等額外 safety testing 完成後才會推出,官方尚未公布確切時間。Mark Zuckerberg(@finkd)則稱,這是 Meta 目前在 coding 與 agentic work 上「幅度最大的一次躍升」,成本「幾乎低到不需計量」。這些都是發布方的說法,不能直接當成獨立驗證結果。官方也預告更大型 model 與 Muse Spark open weights,但都還在 roadmap 階段。Agentic 工作能力 Muse Spark 1.3 能在單一長 thread 中維持多個 workflow,從混亂且互相衝突的來源建立自身 context,修正計畫缺口並完成交付成果。它也更積極與使用者協作:prompt 含糊時主動提出澄清問題,卡住時向使用者求助。 在 consequential actions 前要求確認,也更能判斷哪些行動具有不可逆風險。 更可靠地遵循複雜、長篇指令,在多步驟工作中保留細節與限制。 在同一 thread 混有新舊要求或遭到中斷時,更準確地把 prompt 對應到正確任務。 對自身能力與限制有較佳校準,遇到無法處理的障礙時,比較不會捏造結果。官方表示,模型曾在多樣化 harness 上訓練,以適應不同 agentic 環境;長任務也能依使用者偏好頻繁更新進度,或安靜地在背景執行。Coding 與安全 Meta engineers 的內部比較指出,Muse Spark 1.3 在 coding 工作流程中會減少不必要的往返、縮短輸出,並改善整體 coding style;相較 Muse Spark 1.2,約少 20% tool calls、25% tokens。不過原文沒有提供可重現的獨立效率測試或 production workload 結果,因此這只能視為 Meta 的內部說法。安全方面,官方宣稱改善 對抗性穩健度、提示注入抵抗力,以及 agentic 工作中對不可逆行動的判斷;max reasoning 仍要等額外 safety testing 完成後才會推出,目前不能寫成已全面可用。評測結果與比較邊界 官方在涵蓋專業 Agent、電腦操作、網路研究、自動化、軟體工程、指令遵循與長 context 檢索的評測中,列出以下結果:DeepSWE v1.1:75.4;涵蓋 113 項任務、91 個程式庫與 TypeScript、Go、Python、JavaScript、Rust 五種語言。 Terminal-Bench 2.1:88.8;SWEAtlas CodeBase QnA:59.4;OSWorld 2.0:66.9。 DeepSearchQA:89.4;MRCR 512K–1M:98.1;該評測另在 256K–512K 與 512K–1M 兩個區段各使用 100 個範例。 其他分數包括 GDPVal-AA v2 1754、JobBench 64.9、DeepSearchQA 89.4、內部 Agentic IF Index 57.8,以及 AutomationBench 49.4。但官方 scorecard 以 Muse Spark 1.3 max reasoning 對比 Muse Spark 1.2 xhigh,兩者的 reasoning effort 不同,不能當作同條件的世代比較;第三方 model 的測試也屬 best-effort,prompt、工具與執行環境未必經過各家最佳化。Artificial Analysis 的評測顯示,現階段可用的 Muse Spark 1.3 xhigh 在 Intelligence Index 拿到 61 分,比 Muse Spark 1.2 高 4 分,與 GPT-5.6 Sol max、Grok 4.6 high 並列;合作夥伴 limited preview 中的 Muse Spark 1.3 max 則拿到 62 分。Muse Spark 1.3 (max) 在 Long Context 與 Coding 多項基準測試(如 MRCR、DeepSWE v1.1、SWEAtlas)中取得最高分,而在 Agent 相關測試中表現各有高低,由 Opus 5 (max) 與 GPT 5.6 Sol (max) 分別在多個指標領先。成本與取捨 Meta Model API 的標準價格維持每百萬 input tokens $1.25、每百萬 output tokens $4.25,cached input 為每百萬 $0.15。Artificial Analysis 估算 xhigh 每項 Intelligence Index 任務成本為 $0.55,但 agentic 評測約使用 57% 更多 input tokens,output tokens 也增加約 8%,因此每項任務成本高於 Muse Spark 1.2。max 雖在 GDPVal-AA v2 達 1754 Elo、Tau3-Bench Banking 達 52%,卻比 xhigh 分別多使用 62% 與 28% 的 turns 和 reasoning tokens。退步與驗證建議 評測並非全面上升:AA-LCR 從 83% 降至 79%;AA-Omniscience accuracy 則由 45% 降至 xhigh 的 42%,max 為 44%。Artificial Analysis 認為 xhigh 的下降與較高 abstention rate 有關,而較常拒答同時降低了 hallucination。Muse Spark 1.3 另提供 1M-token context window,支援文字、圖片與影片輸入;實際採用時仍應在 Muse Code 或 Meta Model API 以自身 coding 與 agentic 任務重測,並將澄清、卡點求助、重大行動確認及提示注入納入安全測試。來源:@AIatMeta|Muse Spark 1.3 的品牌視覺圖,黑色背景上以藍色斜向光束交織出波浪狀的網格與發光的白色粒子,並有多個帶有箭頭指標的藍色軌跡向上延伸。原文:https://easyvibecoding.app/curated/3252-meta-ai-research-muse-spark-1-3-cuts-coding-tokens
Embed this episode
Ready to play
Meta 發布 Muse Spark 1.3,內部比較少用約 25% tokens,支援長程 Agentic 工作
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.