打开APP

MiniMax H3发布,还要开源,AI视频终于有了自己的后期之王

今日MiniMax推出H3模型并将开源,其在视觉包装和后期特效表现出色,能满足多种视频制作需求,未来或催生更多特化版本。

今天,被Seedance 2.0压制了整整半年,沉寂了很久的AI视频模型行业,终于又有了点新的动向了。

MiniMax,终于掏出了他们的H3模型。

并且,要开源。

AI视频,终于也开始向大模型领域看齐了。

过去这半年,AI视频行业活得很奇怪。

视频Agent应用疯狂增长,但是模型却寥寥无几。

最后绕不开的那个名字,依然是Seedance 2.0。

它就像那一堵最高的山。

以至于过去半年,AI视频行业最 大的悬念,逐渐变成了:

到底还有没有人,能给Seedance 2.0一点压力?

现在,MiniMax终于带着他们的AI视频模型来了。

我在昨天其实就已经拿到了体验资格,在做了一些测试之后,我非常坦率的讲,在很多的环节上,它确实可以跟Seedance 2.0相媲美,但是还没有达到所谓的全面超越的地步。

但H3找到了一个非常独特、非常有意思、而且我觉得极其商业的切口,那就是:

视觉包装和后期特 效。

这个点,MiniMax实在是太强太强了,这块的长板强到比Seedance 2.0都要强很多。

我直接放几个case你就懂了。

H3这个模型非常的独特。

独特到一时我不知道该用什么词去形容它。

你可以让它直接生成一段带歌词的动态MV。

你也可以给它几张平面海报,它可以把排版、文字和视觉元素全部动起来,做成一支动态海报。

你也可以给它一堆照片,它能理解每张照片里的内容,自动做成有装饰、有节奏、有声音的Vlog。

你甚至可以让它直接生成电影片头、歌词VJ、时尚品牌Campaign、游戏UI、网页滚动动效和产品发布片。

只要涉及到一切跟视觉包装相关的工作,它干的都极 佳。

如果说,Seedance更偏向与前期,更重影视和特 效,那H3我觉得,就更偏向后期,更重广告与动效。

两者相辅相成,终于补全了整个视频制作的全流程。

在首页上,你就能看到这次全新的H3了,也是一个原生多模态模型。

在纯粹的功能上,非常的全面,全能参考啥的也都有。

支持视频图片音频等等的各种参考,最多12个。

参数上,目前开放的直接是2K,甚至768P的都暂时还没开放,最多15s。

价格上2K的效果,1秒是12贝壳,差不多就是10块钱一条15秒的2K视频。

动作参考、指定元素替换、换背景、改写视频、实拍视频加特 效、绿幕换背景、白模视频上色、视频续写延长、视频整体参考等等这些常用的功能,也都没啥问题,而且效果不错。

这次的重点,我们自然还是要回到,视觉包装上。

其实我们会发现在过去半年里面,AI视频加速的最多的是AI短剧赛道。

而传统的商业广告、宣传片、综艺等等,AI介入的好像还没有那么多。

原因特别简单,过去我们一直在做的AI视频模型更像是一台很强的虚拟摄影机,它们能够凭空创造一个世界,然后把这个世界拍下来,记录下来。

但是,摄像机拍完以后,一条真正意义上的视频,其实才刚刚开始。

因为人类最终看到的绝大多数视频,都不是现实世界原封不动的切片。

我们会剪辑,会加字幕,会设计片头,会制造转场,会用图形、文字、UI和特 效重新组织信息。

这些东西,现实世界里原本都不存在。

它们全部是人类创造出来的视觉语言。

这些就是视觉包装。

最典型的就是综艺里面经常会加的花字。

这种以前AI视频几乎没有办法去处理,因为很难生成稳定加准确的文字,且很难理解文字与视频素材和视频内容之间的关系。

但是这一次,MiniMax H3可以搞定这种了。

比如一个飞行嘉宾出场,以前我们可能得做很复杂的动画,然后K很多的帧,搞得还挺麻烦的,现在,一个Prompt。

这个效果当然跟顶 级综艺没有办法比,也会出现一些奇奇怪怪的数字。但是你可以看到关于人物的、氛围的、元素的设计,还有一些主体背景跟文字之间的互动,其实都已经做得很不错了。

在品牌语言上也是比较统一的。

除了综艺,还有很多很多需要做视觉包装的,比如说MV。

Prompt:15秒,16:9横版,一镜到底。生成一支极 具视觉炫技感的实验MV。主角是一位银色寸头、穿纯黑长外套的中性歌手。摄影机始终围绕主角顺时针旋转,人物持续对镜头演唱,嘴型和身份稳定。  同一个废弃摄影棚随着摄影机旋转,依次转化为五种视觉世界:真实胶片、黑白报纸、彩色黏土、透明水下、像素游戏。每次变化都由主角动作和歌词触发,空间连续,不使用硬切。歌词与文字:  “CHANGE THE FRAME” “KEEP THE FACE” “EVERY WORLD IS MINE”  0至3秒:真实胶片摄影棚。主角抬手唱出“CHANGE THE FRAME”,手掌扫过的位置变成黑白报纸网点,文字像报纸标题一样从墙面展开。  3至6秒:摄影机继续环绕,报纸世界被主角撕开,空间变成彩色黏土。人物仍保持真人皮肤和真实脸,周围道具与地面变成手工黏土。“KEEP THE FACE”沿主角身后弯曲出现。 6至9秒:主角跺脚,黏土地面化成透明水面。摄影机与人物同时进入水下,头发、衣服和气泡符合真实水体运动,歌声保持清晰。  9至12秒:主角拍碎水面,所有水滴变成像素方块。摄影棚加载成复古三维游戏世界,人物仍为真人。“EVERY WORLD IS MINE”形成巨大的游戏关卡入口。  12至15秒:摄影机完成一整圈环绕。所有视觉世界像多层皮肤一样从空间剥落,回到最初摄影棚。主角站在原位,伸手接住一枚同时包含五种材质的小方块。  声音:原创实验电子乐,五个世界分别拥有胶片、纸张、黏土、水下和像素音色,节奏连续。  禁止切镜头、人物换脸、服装变化、世界突然跳变、额外歌词、普通蒙版转场和水下嘴型失控。

可以看到生成出来的这个运镜效果其实非常的棒,而且文字极其准确,歌词全部都是对上的。

除了一些特别小的字,稍微大一点,几乎都没崩。

视觉包装做的非常的棒,在转场和过渡上也非常的和谐。

而且大家可以对比一下我的Prompt,H3有个非常强的特点,就是它的语义遵循能力极强,你真的就是说什么,它就能给你实现出什么,在做视觉包装的时候非常有用,因为做视觉包装很多时候就是极其精确的文字控制。

当然,这种语义遵循强的能力也带来了一些缺点,就是在某些影视级别的需要超 强张力的镜头上,表现的没有Seedance效果好。

而这个case其实就能感觉到整个视觉包装的效果会更强一点,做了非常多的素材的包装和特 效。

除了MV,还有我们经常会做的logo演绎的视觉包装。

H3做的也非常有意思。

比如,我就把我们公司的logo,给扔了进去,让H3给我做一个logo演绎视频。

你别说,做的还是相当酷炫的。

当然,你还可以做电商产品的某一次全新的新品宣传片。

一个AI影视节目的片头。

一个设计大会的主舞台宣传片。

还有很多很多,电商、游戏、短视频,甚至还能给Vlog做好玩的动效等等。

你不需要再去做复杂的动效,不需要再去手K素材,甚至你都不需要打开剪辑软件,把你的素材扔到H3里,然后说出你的需求。

一条经过视觉包装的视频,就可能已经做好了。

AI视频模型过去最喜欢展示的,往往是最极限的画面。

巨龙、战争、跑酷、追车、爆炸、复杂运镜。

这些东西很爽,也很适合证明模型的上限。

可真正数量巨大、每天都在被生产、每天都有人愿意付钱的视频,很多都没有这么宏大。

品牌广告、电商素材、产品介绍、App功能演示、活动预告、社交媒体短片、游戏PV、企业宣传片。

它们的生命周期很短,更新频率很高,经常还要针对不同人群、不同平台、不同尺寸,做出一大堆版本。

这种内容最需要的能力,恰好就是H3擅长的东西。

设计师和后期的价值,也会继续往上游移动。

手动拉关键帧、做素材、套转场这类执行工作的价值还会下降。

定义方向、建立审美、识别好坏、控制品牌一致性的价值,会越来越高。

生产能力越泛滥,判断力就越值钱。

而且大家不要忘了,MiniMax H3,是要开源的。

一个开源模型的生命力,往往是从发布那一天才刚刚开始。

后面一定会有人继续去给它做推理优化,给它去微调特定风格。未来我们可能会看到无数种特化的,在垂直领域继续发光发热的H3版本出来。

这个世界需要开源。

每一个愿意开源的,也都是英雄。

现在,MiniMax H3,来当那个英雄了。

我们也希望,能看到越来越多的AI视频领域的开源模型。

那才是真正的未来。

【本文由投资界合作伙伴微信公众号:数字生命卡兹克授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

AI数据总览

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】