Magic 稱新預訓練方法以約 1/50 計算量達到 DeepSeek V4 Pro Base 水準 episode artwork

EPISODE · Sep 9, 2026 · 3 MIN

Magic 稱新預訓練方法以約 1/50 計算量達到 DeepSeek V4 Pro Base 水準

from EasyVibeCoding Podcast · host Magic

Magic 稱新預訓練方法以約 1/50 計算量達到 DeepSeek V4 Pro Base 水準。成本效率 Magic 表示,新預訓練方法的計算效率超過領先開放權重基礎模型的 10 倍;其中,這套方法以約 1/50 的 FLOPs,達到 DeepSeek V4 Pro Base 的水準,在 GB200 上的成本估算約為 50 萬美元($0.5M),約是 GPT-3 預訓練計算量的一半。團隊再把規模擴大至 10 倍,成本約 400 萬美元($4M),在 perplexity 評估中勝過所有公開可取得的 open base models。Magic 的最新模型在 heldout 程式碼的 bits per byte 評測中,達到與 DeepSeek V4 Pro 相同效能時所需預訓練計算量約為其 1/48(48x less compute)。比較方法 研究以留出的評估資料測量 bits-per-byte loss;Magic 只能對自家模型排除評估資料混入訓練的情況,無法替其他開放權重模型做同樣檢查。部分網路評估資料可能已出現在對手的訓練資料中,Magic 指出這種污染會讓比較偏向對手。這項指標能降低不同 tokenizer 對結果造成的影響,數值越低越好。Magic 再依據 scaling laws,估算模型要達到特定能力需要多少計算量,藉此比較不同訓練 recipe 的效率。評估涵蓋私有程式庫、其他新創公司取得的程式庫、研究論文,以及保留的數學推理題;公開模型的 logprobs 則以 vLLM 和 SGLang 在 GB200、GB300 上測試,並與 Fireworks 的內部推理引擎交叉確認部分基準結果。V5 (e24) 在留出競賽數學測試集的正確率達到 72%,高於 V5 (e23) 的 31% 與 DeepSeek V4 Pro 的 65%。成本推估限制 Magic 依 DeepSeek V4 Pro 的 recipe 推算,若要訓練出同等能力的模型,成本將超過 1 億美元(>$100M)。這是 scaling-law estimate,且來源明確說明沒有納入可取得資料量的影響,因此它描述的是計算量推估,不是實際已支付的訓練費用。研究也以 6·N·D 代表訓練 FLOPs,而非精確值;其中 N 是啟用的參數數量,D 是預訓練 token 數量。Magic 選用這個近似式,是因為部分公開模型缺少完整序列長度等資訊,不希望自行猜測。Magic 的預訓練計算效率自 2024 年底的 V2 至 2026 年 9 月的 V5 累計提升超過 500 倍。Base model 範圍 本文比較的對象是 base models,也就是尚未接受強化學習、監督式微調(SFT)或其他後訓練的預訓練模型。由於這些模型對 prompt 高度敏感,Magic 認為以抽樣產生答案的評估不可靠,因此改用 heldout data 的 loss 進行比較。團隊另外執行低計算量的數學 RL,並讓所有 RL 直接從 base model 開始,不使用 SFT 或 distillation;這些結果用來檢查預訓練 loss 是否能反映 post-RL 表現。研究方法 Magic 將效率提升歸因於模型架構、優化器、訓練目標與資料整理等面向的數十項變更,並指出修正小型 bug 也能成為計算效率倍增器。團隊用 NanoGPT speedruns 快速篩選想法,但發現許多能改善小模型的做法,無法改善大型模型;相反地,一些多數大型語言模型都具備的功能,也能在不損害大規模表現下刪除。每項變更會以跨越兩個數量級計算量的 3 個模型測試,只有 power law fit 顯示可在大規模有效,才會保留。Magic 在 167 個領域評測的算力效率相較競爭模型最佳表現各有高低,於 Inference systems 達到最高 123 倍,而在 Hindi local news 則低至 0.002 倍。後續方向 Magic 表示,預訓練與 long-context 研究已相當成熟,下一步將擴大 long-horizon RL,讓 Agent 在部署後透過 long-context 持續學習,同時研究具備穩健理論性質的 alignment training,以及預訓練的進一步改良。團隊宣稱其目標是打造超越人類能力的 coding agents、實現 AI R&D 自動化,並表示「期待釋出這個成果」;因此本次來源呈現的是 base-model 預訓練研究,並非已發布的 posttrained 產品。原文:https://easyvibecoding.app/curated/3301-magic-pretraining-recipe-hits-deepseek-v4-pro-base-level

Episode metadata supplied by the publisher feed · Published Sep 9, 2026

Embed this episode

Ready to play

Magic 稱新預訓練方法以約 1/50 計算量達到 DeepSeek V4 Pro Base 水準

0:00 3:15

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 3 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on September 9, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!