EPISODE · Aug 3, 2026 · 2 MIN
MiniMax 公開 H3 全模態影片生成模型,最高輸出 2K、15 秒立體聲影片
MiniMax 公開 H3 全模態影片生成模型,最高輸出 2K、15 秒立體聲影片。MiniMax 於 2026 年 8 月 3 日宣布開放模型,模型頁面位於 Hugging Face 。 以偵探風格呈現的 MiniMax H3 宣傳短片,展示文字、圖像、聲音與影片等多模態生成功能。 核心能力 MiniMax-H3 支援 4~15 秒影片、24 FPS、32 kHz 立體聲,以及 21:9、16:9、1:1、9:16 等多種畫面比例;穩定支援阿拉伯文、中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文與西班牙文共 11 種對話語言。H3-Base-FL2VA 可接受零至兩張圖片,支援文字生影片、首幀/末幀生影片與首末幀生成;H3-Base-Ref2VA 則可混合最多 9 張圖片、3 段影片與 3 段音訊,所有輸入檔案合計最多 12 個。 MiniMax H3 的 Next-Generation Open-Weights General-Purpose Multimodal Video Model 形象標題畫面 系統架構 完整系統由 H3-Context-IR、H3-Base 與 H3-Regenerate-2K 組成:前者負責解析跨模態關聯、時間脈絡與複雜推理,H3-Base 先生成 768p 結果,再由 H3-Regenerate-2K 依原始脈絡重生成 2K,以保留小字與細節。H3-Omni-Transformer 是 33B 參數的 dense 單流 Transformer;另有 H3-Encoder 使用 Qwen3-VL-32B 的完整預訓練權重,取其第 50 層 hidden states 餵給前者。H3-Omni-Transformer 的完整權重已釋出,但初始版本僅提供 full attention,sparse attention 將於後續更新推出。 MiniMax H3 System Overview 的系統架構流程圖,分為 Context Understanding、Base Generation 與 High-Resolution Regeneration 三個主要階段。 MiniMax H3-Base 的多模態編碼、上下文序列打包、統一生成與解碼架構圖 開放範圍與限制 H3-Context-IR 與 H3-Regenerate-2K 因依賴多階段 hosted models 與服務,尚未開源,官方改以 API 驗證結果;使用者可在本機部署 H3-Base,或結合 Open Platform API 執行端到端 2K 流程。文字、圖片、影片與增強後 prompt 會經自動審核,疑似違法、色情或侵害第三方權利的內容可能遭封鎖,且官方提醒仍可能出現誤判。原文:https://easyvibecoding.app/curated/2824-minimax-releases-h3-multimodal-video-generation-model
Embed this episode
Ready to play
MiniMax 公開 H3 全模態影片生成模型,最高輸出 2K、15 秒立體聲影片
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.