Marin 公開訓練 535B-A23B:以即時紀錄提高大型模型訓練透明度 episode artwork

EPISODE · Aug 23, 2026 · 4 MIN

Marin 公開訓練 535B-A23B:以即時紀錄提高大型模型訓練透明度

from EasyVibeCoding Podcast · host Percy Liang

Marin 公開訓練 535B-A23B:以即時紀錄提高大型模型訓練透明度。公開訓練計畫 Percy Liang 表示,535B-A23B 已於 2026 年 8 月啟動訓練。整體行程規劃將 80% 用於 pretraining、20% 用於 midtraining,在 11 座 GB200 NVL72 上運算約 3 個月,預計處理 18.75T token、消耗約 2.7e24 FLOPs,post-training 之後再進行。Mary Newhauser 認為,這可能是目前最開放、最透明的模型訓練之一,但也指出 OLMo 3 的公開程度同樣令人印象深刻。資料與可稽核性 公開資料集包含 23.11T token,分布於 40 個語意領域與五個品質分級。Harrier K40 overview 以涵蓋資料庫 94.6% token 的確定性對齊樣本估算來源組成;各欄位比例可精確計算,但來源組成仍只是稽核估算,不是完整的來源歸屬。Scaling ladder 與觀測 正式 Hero Run 前,團隊先用四階 scaling ladder,從 1.6B-A61M、48B token 測到 27.7B-A1.2B、926B token,用來除錯、預測最終損失,也檢查中間 checkpoint 是否符合進度。公開的 W&B 報告提供五次 run 與即時圖表,包括 MFU、每秒 token 數、MoE 丟棄比例、參數範數、梯度範數與交叉熵損失;整套效能追蹤約占總運算量的 1%,預計持續約 100 天。Marin 模型訓練進程中各 scaling ladder 配置與 hero 跑實驗的 train/crossentropyloss 曲線變化,顯示 rav-ladder 系列模型的維度越大(從 d768-v2 至 d2048-v3),其 cross-entropy loss 越低。模型與實作細節 公開的 launchscalingladder.py 以五種模型寬度實作同一套 hero-shape recipe:每個階段使用 384 個 routed experts 與 top-8 routing。 採用 hidden/2-wide experts、pooled-wave transport,以及 Harrier 2026.08.18 two-phase mixture。 評估使用 dropless held-out evaluation。 規模從 d768、48B token、61M active/1.6B total parameters,擴展到 d6144 Hero Run。Hero Run 的公開規格為 18T token、23B active/535B total parameters,約需 2.7e24 FLOPs。 step budget 以每個 active parameter 791 token 設定,梯度範數與參數範數每 10 steps 記錄一次。hero · 535B-A23B · 18T tok 在 dropless paloma macro-loss 指標上全程保持最低損失並領先其餘各規模模型。工程與不確定性 issue #8435 指出,完整方案是 EP64 MoE pretrain,規格為 535.3B total、22.76B active parameters 與 18.0T token,並在 GB200 上使用手工打造的 pooled-wave expert-parallel all-to-all 實作。團隊同時公開 JAX/GPU Expert Parallel、硬體規格、context 從 4k 延伸至 8k、65k、262k 的訓練指標,以及長上下文 RL 的 cooldown 實驗設計;Percy Liang 也坦言這是團隊迄今最大規模的 run,因此過程中仍可能遇到意料之外的問題。可查看 Harrier K40 資料報告、W&B 即時報告 與 Marin issue #8435。來源:@mnewhaus|瀏覽器介面呈現 535B-A23B 18T Token Hero Run 與 Scaling Ladder 專案實驗的多項訓練損失與效能評估圖表與執行列表;evaldropless/paloma/macroloss 的可見最低曲線為 rav-ladder-d2048-v3。瀏覽器介面呈現 535B-A23B 18T Token Hero Run 與 Scaling Ladder 專案實驗的多項訓練損失與效能評估圖表與執行列表;eval_dropless/paloma/macro_loss 的可見最低曲線為 rav-ladder-d2048-v3。 影片中的 Prompt 與操作:操作步驟: 1. @00:03捲動頁面檢視 Scaling Ladder 圖表與執行狀態列表 2. @00:05游標懸停在圖表數據點上檢視詳細數值 3. @00:08向下捲動瀏覽更多訓練監控圖表原文:https://easyvibecoding.app/curated/3094-marin-releases-535b-a23b-training-transparency-records

Episode metadata supplied by the publisher feed · Published Aug 23, 2026

Embed this episode

Ready to play

Marin 公開訓練 535B-A23B:以即時紀錄提高大型模型訓練透明度

0:00 4:01

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 4 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on August 23, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!