EPISODE · Aug 1, 2026 · 11 MIN
MiniMax H3:打破任務與模態界線的開放模型
MiniMax H3:打破任務與模態界線的開放模型 今天,我們推出通用型多模態生成模型 MiniMax H3。H3 能夠理解橫跨文字、圖片、影片與音訊的統一 context,並能原生生成具備立體聲、最高 15 秒且解析度達 2K 的影片。 早期測試顯示,H3 已準備好應用於各種使用情境的商業內容創作,並在指令遵循(instruction following)、精確的文字與品牌渲染(rendering),以及 V2V(影片到影片)動作遷移(motion transfer)方面表現出色。憑藉著精確、可控的多模態生成與編輯能力,H3 非常適合應用於廣告、品牌行銷、電子商務、產品設計、UI/UX、遊戲等領域。 在 Contextual Omni Representation、H3-VAE、H3-Omni Transformer 和 In-Context Regeneration 等技術的驅動下,H3 提供了業界領先的性價比。我們預設提供 2K 解析度。在 2K 解析度下,H3 的每秒價格不到主流模型的三分之一;而在 768p 解析度下,價格則不到主流模型 720p 的一半。 長期以來,閉源模型一直主導著影片生成領域,其迭代速度較慢,生態系統也不如大型語言模型等領域開放。為了支援開源社群、加速與更廣泛 AI 硬體相容,並讓使用者更容易打造專屬的自定義版本,我們計畫在遵守適用法律和法規的前提下,於未來幾天內開源模型權重。硬體相容性一直是 H3 設計初期以來的關鍵考量。 --- H3 模型亮點 多模態 context 理解 真實的創意工作需要在多個模態之間融合複雜資訊,並將圖片、音訊、影片等作為輸入來源。例如,以下鏡頭的 prompt 是:「參考影片 1 中的希區考克式鏡頭運動(Hitchcock camera movement),讓圖片 2 中的角色唱歌,且歌聲要與音訊 3 相符。」只需用文字描述 context 與目標影片之間的關係,H3 就能自行處理複雜的全模態理解。 多模態輸入 展開畫面重點畫面為戶外咖啡座的實景拍攝。主體是一位留著黑色蓬鬆捲髮、臉上有明顯雀斑的年輕女性,身穿白色上衣與藍色吊帶褲,手腕戴著多色手環,正低頭捧著一個小型白瓷杯飲用。背景為歐式街景,左側可見「CAFÉ」字樣的招牌,並有其他顧客坐在藤編座椅上用餐,整體光線明亮。 (原文此處為 H3 生成影片,未收錄) 2K 效能 原生立體聲 --- H3 使用情境 電影開場片頭 產品網站 動態海報 廣告與電子商務 --- H3 的設計哲學 打破任務之間的界線:從專用走向通用 我們先前已經開發過兩代模型:海螺 01(Hailuo 01)從零開始建立了系統,而海螺 02(Hailuo 02)則專注於改善核心元件,例如架構效率、資料品質與規模。 在設計 H3 時,我們意識到先前生成式模型在任務界線上的限制:圖片生成通常被拆分為 T2I(文字轉圖片)、編輯、主體參考、動作參考和風格參考等不同的專家模型;音訊生成中的語音、音效和音樂,很大程度上也被視為獨立的領域研究;影片生成則進一步碎片化為文字轉影片、圖片轉影片、首尾幀、主體參考、動作參考、語音參考、影片編輯等,圖片、影片和音訊之間也存在著清晰的界線。 這些孤立的任務、能力和模態在實務上限制了創作自由,而在訓練方面,也限制了模型的泛化能力。這兩點都表明,無論是在應用範式還是訓練範式上,都有很大的改變空間。因此,指導 H3 開發的第一原則就是跨任務的統一與泛化。 基於此,以下是 H3 預訓練範式的簡要概述: 資料與任務 文字轉圖片 文字轉影片 伴隨聯合生成的音訊,所有音訊輸出皆為原生立體聲 原生多鏡頭建模 文字轉音訊 語音、音效與音樂之間沒有區隔——全部進行聯合建模 廣義參考與編輯 圖片到圖片的參考與編輯 圖片到影片的參考與編輯 音訊到音訊的參考與編輯 音訊影片到音訊影片的參考與編輯 在我們的設計中,「廣義參考與編輯」意味著: 完全由真實、自然的資料構建,賦予其強大的資料可擴展性。 參考與編輯關係透過自然語言表達,而不侷限於固定的任務集;語言(廣義上的智慧結構)是通往泛化的橋樑。 架構 儘早融合多樣化的資料類型與任務——合適的混合比例是關鍵。 訓練策略 在訓練過程中儘早融合多樣化的資料類型與任務——合適的混合比例是關鍵。 這些選擇都指向同一個目標:從預訓練階段開始,賦予 H3 廣泛的多模態 context 理解與生成能力。 我們稍早談到了訓練範式的轉變,那麼影片模型的應用版圖又是如何變化的呢? 我們看到創作者直接用自然語言描述他們的意圖,而不只是輸入簡單的視覺 prompt。隨著多模態理解、指令遵循和複雜任務執行的不斷提升,影片模型將能夠掌握更完整的創作意圖,處理更複雜的內容需求,並逐漸從「生成片段」真正參與到整個內容生產過程中。 --- H3 的技術選擇 H3 的設計哲學很簡單——但建構過程絕非如此。從海螺 01(Hailuo-01)到海螺 02(Hailuo-02)再到 H3,每一代模型的工程複雜度都比上一代大約成長為 10 倍。 以下簡要介紹 H3 的幾項核心技術: H3-Contextual Omni Representation 在工程化 H3 的過程中,我們做過最重要的事情之一就是強化其標註(captioning)能力。 引入多模態 context 進一步擴大了「標註」需要涵蓋的範圍,我們不再只是描述目標影片,還要描述 context 與目標影片之間的關係,甚至是 context 內部元素之間的關係。 我們需要聯合描述影片與音訊,而這種音影關係在多個鏡頭之間會變得更加複雜。 這本質上是一種 Contextual Omni Representation 的形式,其中語言扮演著可泛化的橋樑與解譯器,將「任務」統一為開放的描述性形式。這就是 H3 具備廣泛指令遵循能力的根源。 為了實現這一點,我們建立了專用模型和全模態理解管道。大多數原始素材都需要大約 100K token 的推論,並被蒸餾至平均約 4K token。 H3-VAE:大幅提升架構效率 H 系列不斷推進 tokenizer 技術。在 H3 中,我們徹底改造了先前的 tokenizer,在重建品質與可學習性上實現了全面提升,讓 H3 在效率上具備競爭優勢。其高壓縮比也帶來了 4 倍的有效序列長度提升,大幅降低了訓練與推論成本,這也是我們支援原生 2K 解析度的關鍵技術。 H3-Omni Transformer:為任務泛化而生的架構 秉持著 H3「架構應為任務服務」的設計哲學,通用性與效率是僅有的兩個目標。值得一提的是,我們捨棄了海螺 02(Hailuo-02)的架構,儘管它曾帶給我們顯著的架構優勢,因為對於一個以任務泛化為核心的模型來說,它會引入不必要的複雜性。我們相信任務泛化是不可逆轉的趨勢,架構上的小技巧應該讓位於模型的定義方式。 在 H3 中,多模態 context 的引入使序列長度的變異數增為三倍,理解與生成的運算工作負載也變得明顯異質化。我們採用了一種將理解與生成工作負載分離的訓練架構,針對每一種負載微調硬體利用率,同時兼顧單一樣本內的異質運算與跨樣本的負載平衡。端到端來看,這將訓練吞吐量提升了近 30%。 H3-In-context Regeneration 針對 H3 的 2K 輸出,我們沒有使用傳統的專用超解析度(super-resolution)模組,而是讓 H3 基礎模型在 context 內對自身的低解析度輸出進行重新生成(regenerate)。這帶來了兩個好處:首先,重新生成過程最大限度地重複利用了 H3 基礎模型內建的生成能力;其次,context 內的方法讓模型能夠再次利用原始的多模態 context 來產出高解析度輸出,恢復傳統超解析度只能「猜測」且往往無法還原的細節,例如小字型和精細細節。 In-Context Regeneration 本身就是任務泛化的另一種表現形式。 我們很快就會分享完整的 H3 技術報告。我們期待聽到您的意見回饋。 --- 我們的願景與下一步 語言、圖片、影片和音訊是人類體驗的基本模態。它們深度互聯,是我們與世界互動的主要介面。它們共同構成了多模態 context,能夠高效傳遞豐富的資訊,而表達與分享資訊的能力本身就是一種生產力。 對於多模態理解與生成,我們將語言視為一個可泛化、可擴展的計算系統。這就是為什麼我們堅信多模態智慧應該深深紮根於語言之中。 H3 還有成長空間,以下是我們對未來版本的優先規劃: 強大的多模態理解是高品質生成的基礎,且仍有很大的提升空間。在下一代的 H 系列中,我們計畫整合 M 系列模型…
Embed this episode
NOW PLAYING
MiniMax H3:打破任務與模態界線的開放模型
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.