开源视觉大型模型提升多模态生成能力,2K高清音视频有望彻底改变行业格局

8月3日,人工智能公司MiniMax宣布将其新一代通用视频模型MiniMax H3 开源。这一全模态生成系统突破了传统单任务的界限,深度整合并理解文本、图像、视频和音频等多模态上下文,展现出强大的任务泛化能力。
在生成方面,H3支持以24帧/秒的帧率和32千赫的立体声音频,输出时长为4至15秒。 用户可选择21:9、16:9、4:3或1:1等常见宽高比,基本创作时默认较短边为768像素。专用的H3-Regenerate-2K解决方案可生成高达2K分辨率的精美图像。 在多语言交互方面,它可靠地支持11种主要语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、西班牙语、葡萄牙语和俄语。
为适应多样化的创作场景,H3 提供了灵活的模型版本和丰富的输入选项。H3-Base-FL2VA 首尾帧模式支持 0 至 2 张图片,可处理文本转视频、首帧转视频、尾帧转视频以及首尾帧协作等任务。 与此同时,H3-Base-Ref2VA 全模态参考模式支持最多 9 张图片、3 个视频片段(总时长不超过 15 秒)和 3 个音频片段的混合输入——总计最多 12 个文件——为专业创作者提供了前所未有的精细控制能力。
在技术层面,MiniMax H3 系统由三个核心模块组成。首先,H3-Context-IR(上下文中间表示)模块对复杂的多指令进行深度分析,并将其转换为模型易于处理的结构,这是实现高质量输出的关键环节。 其次,H3-Base 模块生成 768p 分辨率的基础音频和视频。最后,H3-Regenerate-2K 模块通过将初始结果与原始上下文进行反馈,实现 2K 超分辨率重建。这种组合在保留生动细节的同时,大幅提升了视觉保真度。
该模型现已根据 MiniMax H3 社区许可证正式发布。开发者和技术爱好者可通过Hugging Face 获取完整的开源代码和资源。行业专家认为,此次开源发布将进一步降低多模态视频生成的门槛,推动影视制作、视觉设计和 AI 交互迈向新高度。
相关文章
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (0)
0/500

8月3日,人工智能公司MiniMax宣布将其新一代通用视频模型
在生成方面,H3支持以24帧/秒的帧率和32千赫的立体声音频,输出时长为4至15秒。 用户可选择21:9、16:9、4:3或1:1等常见宽高比,基本创作时默认较短边为768像素。专用的H3-Regenerate-2K解决方案可生成高达2K分辨率的精美图像。 在多语言交互方面,它可靠地支持11种主要语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、西班牙语、葡萄牙语和俄语。
为适应多样化的创作场景,H3 提供了灵活的模型版本和丰富的输入选项。H3-Base-FL2VA 首尾帧模式支持 0 至 2 张图片,可处理文本转视频、首帧转视频、尾帧转视频以及首尾帧协作等任务。 与此同时,H3-Base-Ref2VA 全模态参考模式支持最多 9 张图片、3 个视频片段(总时长不超过 15 秒)和 3 个音频片段的混合输入——总计最多 12 个文件——为专业创作者提供了前所未有的精细控制能力。
在技术层面,MiniMax H3 系统由三个核心模块组成。首先,H3-Context-IR(上下文中间表示)模块对复杂的多指令进行深度分析,并将其转换为模型易于处理的结构,这是实现高质量输出的关键环节。 其次,H3-Base 模块生成 768p 分辨率的基础音频和视频。最后,H3-Regenerate-2K 模块通过将初始结果与原始上下文进行反馈,实现 2K 超分辨率重建。这种组合在保留生动细节的同时,大幅提升了视觉保真度。
该模型现已根据 MiniMax H3 社区许可证正式发布。开发者和技术爱好者可通过
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径





首页






