今天,被Seedance 2.0压制了整整半年,沉寂了很久的AI视频模型行业,终于又有了点新的动向了。
MiniMax,终于掏出了他们的H3模型。
并且,要开源。

AI视频,终于也开始向大模型领域看齐了。
过去这半年,AI视频行业活得很奇怪。
视频Agent应用疯狂增长,但是模型却寥寥无几。
最后绕不开的那个名字,依然是Seedance 2.0。
它就像那一堵最高的山。
以至于过去半年,AI视频行业最 大的悬念,逐渐变成了:
到底还有没有人,能给Seedance 2.0一点压力?
现在,MiniMax终于带着他们的AI视频模型来了。
我在昨天其实就已经拿到了体验资格,在做了一些测试之后,我非常坦率的讲,在很多的环节上,它确实可以跟Seedance 2.0相媲美,但是还没有达到所谓的全面超越的地步。
但H3找到了一个非常独特、非常有意思、而且我觉得极其商业的切口,那就是:
视觉包装和后期特 效。
这个点,MiniMax实在是太强太强了,这块的长板强到比Seedance 2.0都要强很多。
我直接放几个case你就懂了。
H3这个模型非常的独特。
独特到一时我不知道该用什么词去形容它。
你可以让它直接生成一段带歌词的动态MV。
你也可以给它几张平面海报,它可以把排版、文字和视觉元素全部动起来,做成一支动态海报。
你也可以给它一堆照片,它能理解每张照片里的内容,自动做成有装饰、有节奏、有声音的Vlog。
你甚至可以让它直接生成电影片头、歌词VJ、时尚品牌Campaign、游戏UI、网页滚动动效和产品发布片。
只要涉及到一切跟视觉包装相关的工作,它干的都极 佳。
如果说,Seedance更偏向与前期,更重影视和特 效,那H3我觉得,就更偏向后期,更重广告与动效。
两者相辅相成,终于补全了整个视频制作的全流程。
在首页上,你就能看到这次全新的H3了,也是一个原生多模态模型。
在纯粹的功能上,非常的全面,全能参考啥的也都有。
支持视频图片音频等等的各种参考,最多12个。
参数上,目前开放的直接是2K,甚至768P的都暂时还没开放,最多15s。

价格上2K的效果,1秒是12贝壳,差不多就是10块钱一条15秒的2K视频。
动作参考、指定元素替换、换背景、改写视频、实拍视频加特 效、绿幕换背景、白模视频上色、视频续写延长、视频整体参考等等这些常用的功能,也都没啥问题,而且效果不错。
这次的重点,我们自然还是要回到,视觉包装上。
其实我们会发现在过去半年里面,AI视频加速的最多的是AI短剧赛道。
而传统的商业广告、宣传片、综艺等等,AI介入的好像还没有那么多。
原因特别简单,过去我们一直在做的AI视频模型更像是一台很强的虚拟摄影机,它们能够凭空创造一个世界,然后把这个世界拍下来,记录下来。
但是,摄像机拍完以后,一条真正意义上的视频,其实才刚刚开始。
因为人类最终看到的绝大多数视频,都不是现实世界原封不动的切片。
我们会剪辑,会加字幕,会设计片头,会制造转场,会用图形、文字、UI和特 效重新组织信息。
这些东西,现实世界里原本都不存在。
它们全部是人类创造出来的视觉语言。
这些就是视觉包装。
最典型的就是综艺里面经常会加的花字。
这种以前AI视频几乎没有办法去处理,因为很难生成稳定加准确的文字,且很难理解文字与视频素材和视频内容之间的关系。
但是这一次,MiniMax H3可以搞定这种了。
比如一个飞行嘉宾出场,以前我们可能得做很复杂的动画,然后K很多的帧,搞得还挺麻烦的,现在,一个Prompt。
这个效果当然跟顶 级综艺没有办法比,也会出现一些奇奇怪怪的数字。但是你可以看到关于人物的、氛围的、元素的设计,还有一些主体背景跟文字之间的互动,其实都已经做得很不错了。
在品牌语言上也是比较统一的。
除了综艺,还有很多很多需要做视觉包装的,比如说MV。
Prompt:15秒,16:9横版,一镜到底。生成一支极 具视觉炫技感的实验MV。主角是一位银色寸头、穿纯黑长外套的中性歌手。摄影机始终围绕主角顺时针旋转,人物持续对镜头演唱,嘴型和身份稳定。 同一个废弃摄影棚随着摄影机旋转,依次转化为五种视觉世界:真实胶片、黑白报纸、彩色黏土、透明水下、像素游戏。每次变化都由主角动作和歌词触发,空间连续,不使用硬切。歌词与文字: “CHANGE THE FRAME” “KEEP THE FACE” “EVERY WORLD IS MINE” 0至3秒:真实胶片摄影棚。主角抬手唱出“CHANGE THE FRAME”,手掌扫过的位置变成黑白报纸网点,文字像报纸标题一样从墙面展开。 3至6秒:摄影机继续环绕,报纸世界被主角撕开,空间变成彩色黏土。人物仍保持真人皮肤和真实脸,周围道具与地面变成手工黏土。“KEEP THE FACE”沿主角身后弯曲出现。 6至9秒:主角跺脚,黏土地面化成透明水面。摄影机与人物同时进入水下,头发、衣服和气泡符合真实水体运动,歌声保持清晰。 9至12秒:主角拍碎水面,所有水滴变成像素方块。摄影棚加载成复古三维游戏世界,人物仍为真人。“EVERY WORLD IS MINE”形成巨大的游戏关卡入口。 12至15秒:摄影机完成一整圈环绕。所有视觉世界像多层皮肤一样从空间剥落,回到最初摄影棚。主角站在原位,伸手接住一枚同时包含五种材质的小方块。 声音:原创实验电子乐,五个世界分别拥有胶片、纸张、黏土、水下和像素音色,节奏连续。 禁止切镜头、人物换脸、服装变化、世界突然跳变、额外歌词、普通蒙版转场和水下嘴型失控。
可以看到生成出来的这个运镜效果其实非常的棒,而且文字极其准确,歌词全部都是对上的。

除了一些特别小的字,稍微大一点,几乎都没崩。
视觉包装做的非常的棒,在转场和过渡上也非常的和谐。
而且大家可以对比一下我的Prompt,H3有个非常强的特点,就是它的语义遵循能力极强,你真的就是说什么,它就能给你实现出什么,在做视觉包装的时候非常有用,因为做视觉包装很多时候就是极其精确的文字控制。
当然,这种语义遵循强的能力也带来了一些缺点,就是在某些影视级别的需要超 强张力的镜头上,表现的没有Seedance效果好。
而这个case其实就能感觉到整个视觉包装的效果会更强一点,做了非常多的素材的包装和特 效。
除了MV,还有我们经常会做的logo演绎的视觉包装。
H3做的也非常有意思。
比如,我就把我们公司的logo,给扔了进去,让H3给我做一个logo演绎视频。
你别说,做的还是相当酷炫的。
当然,你还可以做电商产品的某一次全新的新品宣传片。
一个AI影视节目的片头。
一个设计大会的主舞台宣传片。
还有很多很多,电商、游戏、短视频,甚至还能给Vlog做好玩的动效等等。
你不需要再去做复杂的动效,不需要再去手K素材,甚至你都不需要打开剪辑软件,把你的素材扔到H3里,然后说出你的需求。
一条经过视觉包装的视频,就可能已经做好了。
AI视频模型过去最喜欢展示的,往往是最极限的画面。
巨龙、战争、跑酷、追车、爆炸、复杂运镜。
这些东西很爽,也很适合证明模型的上限。
可真正数量巨大、每天都在被生产、每天都有人愿意付钱的视频,很多都没有这么宏大。
品牌广告、电商素材、产品介绍、App功能演示、活动预告、社交媒体短片、游戏PV、企业宣传片。
它们的生命周期很短,更新频率很高,经常还要针对不同人群、不同平台、不同尺寸,做出一大堆版本。
这种内容最需要的能力,恰好就是H3擅长的东西。
设计师和后期的价值,也会继续往上游移动。
手动拉关键帧、做素材、套转场这类执行工作的价值还会下降。
定义方向、建立审美、识别好坏、控制品牌一致性的价值,会越来越高。
生产能力越泛滥,判断力就越值钱。
而且大家不要忘了,MiniMax H3,是要开源的。
一个开源模型的生命力,往往是从发布那一天才刚刚开始。
后面一定会有人继续去给它做推理优化,给它去微调特定风格。未来我们可能会看到无数种特化的,在垂直领域继续发光发热的H3版本出来。
这个世界需要开源。
每一个愿意开源的,也都是英雄。
现在,MiniMax H3,来当那个英雄了。
我们也希望,能看到越来越多的AI视频领域的开源模型。
那才是真正的未来。











