MaynorAI
返回博客

MiniMax H3 刚刚上线:AI 视频终于有了自己的「后期之王」

MiniMax H3 正式上线海螺视频,把火力集中在视觉包装与后期动效:字幕花字、Logo 演绎、电商宣传片、活动预告都能一次生成。本文梳理 H3 的能力边界、六类落地场景,以及可直接复用的 Prompt 公式。

2026年7月31日Maynor
MiniMax H3 刚刚上线:AI 视频终于有了自己的「后期之王」

MiniMax H3 刚刚上线:AI 视频终于有了自己的「后期之王」

过去的 AI 视频模型更像一台虚拟摄影机,MiniMax H3 想补上的,是拍完以后那一整套视觉包装工作。

今天,沉寂了一段时间的 AI 视频模型赛道终于有了新动向。

MiniMax H3 正式上线海螺视频。官网给出的核心定位很直接:原生多模态理解与生成、精准编辑与控制、商用级多场景内容生成

我把官网当前页面、原文截图和作者实测分开核了一遍。H3 不是简单再拼一次画质,而是把火力集中在了一个很商业、也很容易形成生产力的方向:视觉包装和后期动效

为什么这个切口值得关注?因为真正每天都有人付费制作的内容,往往不是巨龙、爆炸和极限运镜,而是品牌广告、电商素材、产品介绍、活动预告、App 演示、游戏 PV 和企业宣传片。

这些内容拍完只是开始,字幕、花字、片头、转场、图形、UI、Logo 演绎和节奏设计,才是后期真正消耗时间的地方。

MiniMax 官方发布 H3 的公开信息

01 H3 到底更新了什么?

先看能从官网和产品界面直接确认的信息。

项目 当前公开信息
模型 MiniMax H3
产品入口 海螺视频 Web 端
模型定位 原生多模态理解与生成、精准编辑与控制
参考输入 图片、视频、音频等,全能参考最多 12 个
输出分辨率 当前界面提供 2K
时长 原文产品截图显示可选 4–15 秒,实际以页面实时选项为准
官网价格文案 2K 低至 0.53 元/秒,实际扣费以创作页为准

海螺视频首页的 H3 创作入口

最大的变化,是 H3 把图片、视频和音频放进了同一个参考系统。

你可以指定一张图作为起始画面,一段视频作为动作参考,再加入音频做配乐。界面显示最多支持 12 个参考素材,这意味着角色、场景、动作、声音和风格可以被放在同一个任务里组合控制。

H3 支持图片、视频和音频的全能参考

分辨率与时长也更面向交付。原文截图里,2K 模式可选 4–15 秒,多种横竖画幅都能直接设置。

H3 的比例、2K 分辨率和 4 至 15 秒时长设置

02 真正的长板,是视觉包装

原作者在提前体验后的判断很明确:H3 并没有在所有环节全面超过 Seedance 2.0,但它在广告动效、文字控制和后期包装上形成了很明显的长板。

可以把两者理解成两种不同的生产角色:

生产环节 更擅长解决的问题
前期拍摄与影视画面 世界生成、摄影机运动、动作与镜头张力
后期包装与商业动效 字幕花字、视觉元素、UI、Logo、转场和品牌统一

H3 最有意思的地方,是它能直接生成一段带歌词的动态 MV,也能把平面海报、排版、文字和视觉元素一起动起来。

H3 生成的动态 MV 案例

它还可以把真人表演、报纸排版、像素世界等视觉语言放进同一条连续镜头里。原文测试认为,H3 对 Prompt 的语义遵循能力很强,文字和画面元素可以按时间节点出现。

实验 MV 中的报纸视觉包装

这类能力不只适合 MV。游戏开场界面、综艺花字、产品发布片、节目片头和设计大会主视觉,本质上都是同一类工作:用图形、文字和动效重新组织信息。

H3 生成的游戏 UI 动效案例

真人画面叠加综艺式动效的案例

03 六类场景,最容易马上用起来

1. MV 与歌词 VJ

把歌词、人物、镜头运动和风格切换写进同一个 Prompt,让文字成为画面的一部分,而不是后期再贴上去。

上传 Logo,描述材质、镜头与品牌气质,就能生成片头、片尾或发布会开场动画。

H3 生成的 Logo 演绎案例

3. 电商新品宣传片

把产品图、包装、灯光和品牌色作为参考,让 H3 负责动态展示、字幕与节奏包装。

H3 生成的电商产品视觉案例

4. 节目片头与活动预告

AI 节目、直播栏目和线下活动都需要频繁换版本。H3 的价值,是把片头中的文字、路线、空间和转场一次性组织起来。

H3 生成的 AI 影视节目片头案例

5. 设计大会主舞台视觉

将大会主题、建筑空间、线条运动和标题文字一起生成,适合先快速出概念片,再由设计师做品牌级精修。

H3 生成的设计大会视觉案例

6. App 演示与社交媒体短片

产品功能演示最需要多尺寸、多语言和多版本。素材不变,只调整 Prompt 与画幅,就可以快速产出不同平台的版本。

过去需要手动拉关键帧、做素材、套转场的执行工作,会被进一步压缩。设计师和后期的价值不会消失,而是会往上游移动:定义方向、建立审美、判断好坏、控制品牌一致性

生产能力越普及,判断力就越值钱,不是吗?

04 怎么开始用 H3?

H3 是网页工具,不需要下载安装。

第一步:进入海螺视频

官方入口:

https://hailuoai.com/

进入“视频”创作页,选择 MiniMax H3 与“全能参考”。

第二步:上传参考素材

按任务需要加入图片、视频或音频。素材不必凑满 12 个,关键是每一个参考都要有明确作用,例如起始帧、人物、动作、场景或配乐。

第三步:把 Prompt 写成时间轴

原文中的实验 MV Prompt 值得保留。它不是只写风格词,而是明确了人物、摄影机、世界变化、歌词、声音和禁止项:

15秒,16:9横版,一镜到底。生成一支极具视觉炫技感的实验MV。
主角是一位银色寸头、穿纯黑长外套的中性歌手。摄影机始终围绕主角顺时针旋转,人物持续对镜头演唱,嘴型和身份稳定。同一个废弃摄影棚随着摄影机旋转,依次转化为五种视觉世界:真实胶片、黑白报纸、彩色黏土、透明水下、像素游戏。每次变化都由主角动作和歌词触发,空间连续,不使用硬切。

歌词与文字:“CHANGE THE FRAME”“KEEP THE FACE”“EVERY WORLD IS MINE”

0至3秒:真实胶片摄影棚。主角抬手唱出“CHANGE THE FRAME”,手掌扫过的位置变成黑白报纸网点,文字像报纸标题一样从墙面展开。
3至6秒:摄影机继续环绕,报纸世界被主角撕开,空间变成彩色黏土。人物仍保持真人皮肤和真实脸,周围道具与地面变成手工黏土。“KEEP THE FACE”沿主角身后弯曲出现。
6至9秒:主角跺脚,黏土地面化成透明水面。摄影机与人物同时进入水下,头发、衣服和气泡符合真实水体运动,歌声保持清晰。
9至12秒:主角拍碎水面,所有水滴变成像素方块。摄影棚加载成复古三维游戏世界,人物仍为真人。“EVERY WORLD IS MINE”形成巨大的游戏关卡入口。
12至15秒:摄影机完成一整圈环绕。所有视觉世界像多层皮肤一样从空间剥落,回到最初摄影棚。主角站在原位,伸手接住一枚同时包含五种材质的小方块。

声音:原创实验电子乐,五个世界分别拥有胶片、纸张、黏土、水下和像素音色,节奏连续。

禁止切镜头、人物换脸、服装变化、世界突然跳变、额外歌词、普通蒙版转场和水下嘴型失控。

这个写法可以直接复用成一个公式:

总时长与画幅 + 人物与场景 + 摄影机规则 + 分段时间轴 + 文字与声音 + 禁止项。

第四步:设置比例、2K 和时长

先用短时长验证人物与文字,再延长到完整版本。需要交付时再选择 2K,避免在方向尚未确定时反复消耗额度。

05 价格、限制与开源信息

海螺官网当前首页写的是 2K 低至 0.53 元/秒。按这个最低单价简单计算,15 秒约为 7.95 元;具体仍会受模式、活动和页面实时计费影响,下单前应以创作按钮旁的扣费显示为准。

H3 目前也不是没有问题。

  • 小字号文字仍可能出现错误,关键品牌文案需要逐帧检查。
  • 极端影视镜头的张力,不一定比专注电影感的模型更强。
  • 参考素材越多,越需要把每个素材的角色写清楚,否则控制目标会互相干扰。
  • AI 生成画面用于商用前,仍要核对素材授权、人物肖像、商标和音乐版权。

原文称 MiniMax H3 后续“要开源”。截至本文核实时,海螺官网已经上线 H3,但官网首页尚未展示对应的开源仓库链接。因此,开源许可、权重范围和发布日期应以 MiniMax 后续官方公告与仓库为准

这反而是接下来最值得追踪的部分。一个可用、可控、又能被社区继续优化的视觉包装模型,会不会真正改写 AI 视频的后期工作流?

写在最后

过去半年,视频 Agent 长得很快,但真正能拉高成片质量的基础模型并不多。H3 没有选择再做一台只负责拍摄的虚拟摄影机,而是直接走进了剪辑台、包装间和品牌部门。

它未必在所有维度都是第一,但在视觉包装这个切口上,确实很可能成为商业内容团队最想立刻试用的新工具。

Codex 国内站:

https://codex.maynorai.top/

该站为国内使用入口,不是 OpenAI 官方网站,请按页面说明自行判断和使用。

我是 MaynorAI 团队,分享 AI 编程、AI SaaS 工具出海、一人团队搭建经验。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

继续阅读

相关推荐