開源視覺大型模型提升多模態生成能力,2K 高畫質音訊與影片將為產業帶來革命性變革

8月3日,人工智慧公司 MiniMax 宣布將其新一代通用影片模型MiniMax H3 開源釋出。這個全模態生成系統突破了傳統單一任務的界限,能深度整合並理解文字、圖像、影片及音訊等多模態情境,展現出強大的任務泛化能力。
在生成方面,H3 支援以 24 FPS 幀率及 32 kHz 立體聲輸出,影片長度範圍為 4 至 15 秒。 使用者可從 21:9、16:9、4:3 或 1:1 等常見畫面比例中選擇,基本創作的預設較短邊為 768 像素。專用的 H3-Regenerate-2K 解決方案可生成最高達 2K 解析度的驚艷影像。 在多語言互動方面,它可靠地支援 11 種主要語言:阿拉伯語、中文、英語、法語、德語、義大利語、日語、韓語、西班牙語、葡萄牙語及俄語。
為因應多元的創作情境,H3 提供靈活的模型版本與豐富的輸入選項。H3-Base-FL2VA 首尾幀模式可接受 0 至 2 張圖片,處理「文字轉影片」、「首幀轉影片」、「尾幀轉影片」以及「首尾幀協作」等任務。 另一方面,H3-Base-Ref2VA 全模態參考模式則支援最多 9 張圖片、3 段影片片段(總時長不超過 15 秒)以及 3 段音訊片段的混合輸入——總計最多 12 個檔案——為專業創作者提供前所未有的精細控制能力。
在技術層面上,MiniMax H3 系統由三個核心模組組成。首先,H3-Context-IR(情境中間表示)會深入分析複雜的多指令,並將其轉換為模型易於處理的結構,作為產生高品質輸出的關鍵環節。 其次,H3-Base 模組以 768p 解析度生成基礎音訊與影片。最後,H3-Regenerate-2K 模組透過將初始結果與原始情境進行反饋,實現 2K 超解析度重建。此組合在保留生動細節的同時,大幅提升了視覺保真度。
該模型現已根據 MiniMax H3 社群授權正式發布。開發者與科技愛好者可透過Hugging Face 取得完整的開源程式碼與資源。業界專家認為,此次開源發布將進一步降低多模態影片生成的門檻,推動電影製作、視覺設計及 AI 互動邁向新高度。
相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
評論 (0)
0/500

8月3日,人工智慧公司 MiniMax 宣布將其新一代通用影片模型
在生成方面,H3 支援以 24 FPS 幀率及 32 kHz 立體聲輸出,影片長度範圍為 4 至 15 秒。 使用者可從 21:9、16:9、4:3 或 1:1 等常見畫面比例中選擇,基本創作的預設較短邊為 768 像素。專用的 H3-Regenerate-2K 解決方案可生成最高達 2K 解析度的驚艷影像。 在多語言互動方面,它可靠地支援 11 種主要語言:阿拉伯語、中文、英語、法語、德語、義大利語、日語、韓語、西班牙語、葡萄牙語及俄語。
為因應多元的創作情境,H3 提供靈活的模型版本與豐富的輸入選項。H3-Base-FL2VA 首尾幀模式可接受 0 至 2 張圖片,處理「文字轉影片」、「首幀轉影片」、「尾幀轉影片」以及「首尾幀協作」等任務。 另一方面,H3-Base-Ref2VA 全模態參考模式則支援最多 9 張圖片、3 段影片片段(總時長不超過 15 秒)以及 3 段音訊片段的混合輸入——總計最多 12 個檔案——為專業創作者提供前所未有的精細控制能力。
在技術層面上,MiniMax H3 系統由三個核心模組組成。首先,H3-Context-IR(情境中間表示)會深入分析複雜的多指令,並將其轉換為模型易於處理的結構,作為產生高品質輸出的關鍵環節。 其次,H3-Base 模組以 768p 解析度生成基礎音訊與影片。最後,H3-Regenerate-2K 模組透過將初始結果與原始情境進行反饋,實現 2K 超解析度重建。此組合在保留生動細節的同時,大幅提升了視覺保真度。
該模型現已根據 MiniMax H3 社群授權正式發布。開發者與科技愛好者可透過
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用





首頁






