MiniMax H3:打破任務與模態界線的開放模型 episode artwork

EPISODE · Aug 1, 2026 · 11 MIN

MiniMax H3:打破任務與模態界線的開放模型

from EasyVibeCoding Podcast

MiniMax H3:打破任務與模態界線的開放模型 今天,我們推出通用型多模態生成模型 MiniMax H3。H3 能夠理解橫跨文字、圖片、影片與音訊的統一 context,並能原生生成具備立體聲、最高 15 秒且解析度達 2K 的影片。 早期測試顯示,H3 已準備好應用於各種使用情境的商業內容創作,並在指令遵循(instruction following)、精確的文字與品牌渲染(rendering),以及 V2V(影片到影片)動作遷移(motion transfer)方面表現出色。憑藉著精確、可控的多模態生成與編輯能力,H3 非常適合應用於廣告、品牌行銷、電子商務、產品設計、UI/UX、遊戲等領域。 在 Contextual Omni Representation、H3-VAE、H3-Omni Transformer 和 In-Context Regeneration 等技術的驅動下,H3 提供了業界領先的性價比。我們預設提供 2K 解析度。在 2K 解析度下,H3 的每秒價格不到主流模型的三分之一;而在 768p 解析度下,價格則不到主流模型 720p 的一半。 長期以來,閉源模型一直主導著影片生成領域,其迭代速度較慢,生態系統也不如大型語言模型等領域開放。為了支援開源社群、加速與更廣泛 AI 硬體相容,並讓使用者更容易打造專屬的自定義版本,我們計畫在遵守適用法律和法規的前提下,於未來幾天內開源模型權重。硬體相容性一直是 H3 設計初期以來的關鍵考量。 --- H3 模型亮點 多模態 context 理解 真實的創意工作需要在多個模態之間融合複雜資訊,並將圖片、音訊、影片等作為輸入來源。例如,以下鏡頭的 prompt 是:「參考影片 1 中的希區考克式鏡頭運動(Hitchcock camera movement),讓圖片 2 中的角色唱歌,且歌聲要與音訊 3 相符。」只需用文字描述 context 與目標影片之間的關係,H3 就能自行處理複雜的全模態理解。 多模態輸入 展開畫面重點畫面為戶外咖啡座的實景拍攝。主體是一位留著黑色蓬鬆捲髮、臉上有明顯雀斑的年輕女性,身穿白色上衣與藍色吊帶褲,手腕戴著多色手環,正低頭捧著一個小型白瓷杯飲用。背景為歐式街景,左側可見「CAFÉ」字樣的招牌,並有其他顧客坐在藤編座椅上用餐,整體光線明亮。 (原文此處為 H3 生成影片,未收錄) 2K 效能 原生立體聲 --- H3 使用情境 電影開場片頭 產品網站 動態海報 廣告與電子商務 --- H3 的設計哲學 打破任務之間的界線:從專用走向通用 我們先前已經開發過兩代模型:海螺 01(Hailuo 01)從零開始建立了系統,而海螺 02(Hailuo 02)則專注於改善核心元件,例如架構效率、資料品質與規模。 在設計 H3 時,我們意識到先前生成式模型在任務界線上的限制:圖片生成通常被拆分為 T2I(文字轉圖片)、編輯、主體參考、動作參考和風格參考等不同的專家模型;音訊生成中的語音、音效和音樂,很大程度上也被視為獨立的領域研究;影片生成則進一步碎片化為文字轉影片、圖片轉影片、首尾幀、主體參考、動作參考、語音參考、影片編輯等,圖片、影片和音訊之間也存在著清晰的界線。 這些孤立的任務、能力和模態在實務上限制了創作自由,而在訓練方面,也限制了模型的泛化能力。這兩點都表明,無論是在應用範式還是訓練範式上,都有很大的改變空間。因此,指導 H3 開發的第一原則就是跨任務的統一與泛化。 基於此,以下是 H3 預訓練範式的簡要概述: 資料與任務 文字轉圖片 文字轉影片 伴隨聯合生成的音訊,所有音訊輸出皆為原生立體聲 原生多鏡頭建模 文字轉音訊 語音、音效與音樂之間沒有區隔——全部進行聯合建模 廣義參考與編輯 圖片到圖片的參考與編輯 圖片到影片的參考與編輯 音訊到音訊的參考與編輯 音訊影片到音訊影片的參考與編輯 在我們的設計中,「廣義參考與編輯」意味著: 完全由真實、自然的資料構建,賦予其強大的資料可擴展性。 參考與編輯關係透過自然語言表達,而不侷限於固定的任務集;語言(廣義上的智慧結構)是通往泛化的橋樑。 架構 儘早融合多樣化的資料類型與任務——合適的混合比例是關鍵。 訓練策略 在訓練過程中儘早融合多樣化的資料類型與任務——合適的混合比例是關鍵。 這些選擇都指向同一個目標:從預訓練階段開始,賦予 H3 廣泛的多模態 context 理解與生成能力。 我們稍早談到了訓練範式的轉變,那麼影片模型的應用版圖又是如何變化的呢? 我們看到創作者直接用自然語言描述他們的意圖,而不只是輸入簡單的視覺 prompt。隨著多模態理解、指令遵循和複雜任務執行的不斷提升,影片模型將能夠掌握更完整的創作意圖,處理更複雜的內容需求,並逐漸從「生成片段」真正參與到整個內容生產過程中。 --- H3 的技術選擇 H3 的設計哲學很簡單——但建構過程絕非如此。從海螺 01(Hailuo-01)到海螺 02(Hailuo-02)再到 H3,每一代模型的工程複雜度都比上一代大約成長為 10 倍。 以下簡要介紹 H3 的幾項核心技術: H3-Contextual Omni Representation 在工程化 H3 的過程中,我們做過最重要的事情之一就是強化其標註(captioning)能力。 引入多模態 context 進一步擴大了「標註」需要涵蓋的範圍,我們不再只是描述目標影片,還要描述 context 與目標影片之間的關係,甚至是 context 內部元素之間的關係。 我們需要聯合描述影片與音訊,而這種音影關係在多個鏡頭之間會變得更加複雜。 這本質上是一種 Contextual Omni Representation 的形式,其中語言扮演著可泛化的橋樑與解譯器,將「任務」統一為開放的描述性形式。這就是 H3 具備廣泛指令遵循能力的根源。 為了實現這一點,我們建立了專用模型和全模態理解管道。大多數原始素材都需要大約 100K token 的推論,並被蒸餾至平均約 4K token。 H3-VAE:大幅提升架構效率 H 系列不斷推進 tokenizer 技術。在 H3 中,我們徹底改造了先前的 tokenizer,在重建品質與可學習性上實現了全面提升,讓 H3 在效率上具備競爭優勢。其高壓縮比也帶來了 4 倍的有效序列長度提升,大幅降低了訓練與推論成本,這也是我們支援原生 2K 解析度的關鍵技術。 H3-Omni Transformer:為任務泛化而生的架構 秉持著 H3「架構應為任務服務」的設計哲學,通用性與效率是僅有的兩個目標。值得一提的是,我們捨棄了海螺 02(Hailuo-02)的架構,儘管它曾帶給我們顯著的架構優勢,因為對於一個以任務泛化為核心的模型來說,它會引入不必要的複雜性。我們相信任務泛化是不可逆轉的趨勢,架構上的小技巧應該讓位於模型的定義方式。 在 H3 中,多模態 context 的引入使序列長度的變異數增為三倍,理解與生成的運算工作負載也變得明顯異質化。我們採用了一種將理解與生成工作負載分離的訓練架構,針對每一種負載微調硬體利用率,同時兼顧單一樣本內的異質運算與跨樣本的負載平衡。端到端來看,這將訓練吞吐量提升了近 30%。 H3-In-context Regeneration 針對 H3 的 2K 輸出,我們沒有使用傳統的專用超解析度(super-resolution)模組,而是讓 H3 基礎模型在 context 內對自身的低解析度輸出進行重新生成(regenerate)。這帶來了兩個好處:首先,重新生成過程最大限度地重複利用了 H3 基礎模型內建的生成能力;其次,context 內的方法讓模型能夠再次利用原始的多模態 context 來產出高解析度輸出,恢復傳統超解析度只能「猜測」且往往無法還原的細節,例如小字型和精細細節。 In-Context Regeneration 本身就是任務泛化的另一種表現形式。 我們很快就會分享完整的 H3 技術報告。我們期待聽到您的意見回饋。 --- 我們的願景與下一步 語言、圖片、影片和音訊是人類體驗的基本模態。它們深度互聯,是我們與世界互動的主要介面。它們共同構成了多模態 context,能夠高效傳遞豐富的資訊,而表達與分享資訊的能力本身就是一種生產力。 對於多模態理解與生成,我們將語言視為一個可泛化、可擴展的計算系統。這就是為什麼我們堅信多模態智慧應該深深紮根於語言之中。 H3 還有成長空間,以下是我們對未來版本的優先規劃: 強大的多模態理解是高品質生成的基礎,且仍有很大的提升空間。在下一代的 H 系列中,我們計畫整合 M 系列模型…

Episode metadata supplied by the publisher feed · Published Aug 1, 2026

Embed this episode

NOW PLAYING

MiniMax H3:打破任務與模態界線的開放模型

0:00 11:08

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of EasyVibeCoding Podcast?

This episode is 11 minutes long.

When was this EasyVibeCoding Podcast episode published?

This episode was published on August 1, 2026.

Can I download this EasyVibeCoding Podcast episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!