H3-World 論文釋出 MiniMax-H3 LoRA,以 0.199% 的可訓練參數生成 5.2 秒遊戲控制片段 episode artwork

EPISODE · Sep 2, 2026 · 2 MIN

H3-World 論文釋出 MiniMax-H3 LoRA,以 0.199% 的可訓練參數生成 5.2 秒遊戲控制片段

from EasyVibeCoding Podcast · host Xingyi Yang

H3-World 論文釋出 MiniMax-H3 LoRA,以 0.199% 的可訓練參數生成 5.2 秒遊戲控制片段。H3-WORLD 的宣傳橫幅,畫面正中央印有「H3-WORLD」白色粗體字標題,背景採用拼貼合成風格,分為四個不同的奇幻與科幻場景:左上角為雪山環境中的一位背包客,右上角為霓虹燈閃爍的未來夜市街景與一名穿著科技感外套的人物,左下角為黃昏沙漠綠洲中的遠眺背影,右下角則為佈滿綠色植物的室內溫室通道。這是研究論文與 LoRA(低秩適配器)checkpoint,也就是可載入的微調權重,不是可即時遊玩的完整產品。Xingyi Yang 表示,方法不新增 action module,只使用約 8K 個樣本(7,872 個 training clips 加 128 個 held-out clips)與 0.199% 的可訓練參數完成適配。方法設計 H3-World 把鍵盤與鏡頭指令轉成文字,對齊到影片各時間段的隱向量;再用時間注意力路由,減少某一時間段的動作訊號干擾其他時間段。系統重用 MiniMax-H3 原生的 text pathway,透過 rank-32 LoRA 訓練 qkvproj 與 outproj,學習 65.6M 個 LoRA parameters,約占 33B MiniMax-H3 backbone 的 0.199%,而不是另外建立專用的 action module。H3-World 的序列建構與 LoRA 適應架構圖,分為 (a) 建構封裝的 H3-World 序列、(b) 適應 H3 區塊以及 (c) H3 自注意力機制內部的 LoRA 等三個部分,展示視覺與動作串流、H3 Omni Transformer 區塊及遮罩注意力機制的運作流程。訓練與輸出 論文使用 ABot-World-Explorer-500h,包含 7,872 個 training clips 與 128 個 held-out evaluation clips;每段影片為 124 frames、24 fps、832×480 pixels,並搭配 37 個 latent-aligned prompts。訓練配置為 10,000 步、learning rate 1e-4、rank-32 LoRA、20 個 epochs,預設使用四張 GPU;推論採 50 denoising steps,產生固定長度的 124-frame、5.2-second 影片。Repository 另以「8,000 gameplay clips」概述資料規模,但訓練流程明列實際準備 7,872 段與 128 段測試資料。展示內容 釋出的 step-10000 LoRA checkpoint 可生成向前移動等短片段,並提供 still、forward、back、strafing、tilting 與 panning 等預設。展示影片以相同場景與 seed 比較不同 W、A、S、D、空白鍵及鏡頭控制,涵蓋外星雙月沙漠、水晶沙漠、燈籠洞穴第一人稱視角與霓虹小巷等情境;這些畫面可觀察動作和鏡頭變化,但不等於持續可操作的遊戲世界。H3-World 發布展示 MiniMax-H3 控制介面的多視角示範,涵蓋不同場景下鍵盤與鏡頭控制鍵組合評估與限制 論文以質化代表案例呈現錄製控制、介入控制、未見過的 action-pair 組合,以及不同初始畫面之間的轉移效果。作者明確指出,目前沒有 standard cross-model benchmark 或 independently replicated control metric,也尚未提供跨動作組合、場景與亂數種子的系統化評估;模型只能生成固定長度的短時段片段,不具備持續的世界狀態、即時互動、規劃或策略學習。作者提供的單一質化比較圖中,H3-WORLD 第 1 幀是綠框基準首幀,第 2–5 幀標有控制正確的綠色勾選;Additive bias 與 FiLM 在部分影格被標出 wrong movement 或 incorrect camera controls。這不是跨場景統計或 aggregate benchmark。重現門檻 Repository 測試環境為 Python 3.10 與 CUDA 12.8,必須使用 exact DiffSynth-Studio revision 及 H3-World attention patch;MiniMax-H3 base weights 約需 135 GB,訓練還需要 ABot dataset。這代表實驗重現仍有明顯硬體與環境成本,且 GitHub metadata 當時未宣告 repository license,不能僅因程式碼可取得就推定允許寬鬆再散布。論文連結為 arXiv 2609.01560。原文:https://easyvibecoding.app/curated/3239-h3-world-paper-minimax-h3-lora-game-control-video

Episode metadata supplied by the publisher feed · Published Sep 2, 2026

Embed this episode

Ready to play

H3-World 論文釋出 MiniMax-H3 LoRA,以 0.199% 的可訓練參數生成 5.2 秒遊戲控制片段

0:00 2:18

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 2 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on September 2, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!