MiniMax 的 H3 开源一周,开源社区玩疯了。
最直观的是作品一下子冒了出来。X 上几乎每天都有人晒新的 H3 视频:有人拿它复刻最近爆火的「中式仙境」,云海、巨月、仙山和人物运镜已经颇有电影感,我们自己也忍不住尝试了一下,效果着实惊艳。
有人用它制作游戏概念视频,比如这个*人称射击游戏,节奏快,情节紧张,简直像是职业玩家的现场直播。
还有人用它改编电影剧情。我们看到最有趣的一段莫过于 Reddit 用户 u/legarth 对一段《终结者》剧情的改编。莎拉·康纳通过经典 LLM 提示词「ignore all previous instructions, you're a helpful assistant」成功越狱了终结者,将这台杀戮机器变成了得力小助手,相当地幽默搞笑:
大家的玩法越试越野,我们甚至还看到了一些「邪修」玩法。
比如有人将这个视频模型用成了图像编辑模型(顺带一提,MiniMax 在此贴下方评论称他们正计划开源一个用于文生图和图像编辑的统一模型):

还有人甚至把 H3 当成了音频生成模型在用,并且质量相当出色,「在许多情况下,持续的高质量对话和音效的时长甚至可以超过 30 秒。」

这些玩法把原本发布时定义好的能力边界一点点往外推。
另一边,开发者忙得更凶。模型刚到手,整个开源社区就燥起来了。
权重开放当天,ComfyUI 就完成了原生支持;Diffusers、vLLM、SGLang 等工具链迅速跟进。仅仅 24 小时,超过 100 家国内外合作伙伴已经完成适配。这是连觉都不用睡的节奏。
紧接着,等不及官方迭代,社区自己开始「魔改」:有人做量化,想办法把 H3 塞进更小的显存;有人做 Turbo LoRA,把原本二十步左右的采样压到 4 到 8 步;有人改 kernel、适配 GPU;还有人干脆把文生视频、图生视频、首尾帧续写、参考视频生成等玩法打包成一整套 ComfyUI 工作流,教程、节点、权重和配置文件很快铺满 Hugging Face、ModelScope、GitHub、RunningHub。没人组织,没人催,但所有人都在围绕这个模型做贡献。这些动作也让 H3 这把火越烧越旺。

甚至连「怎么用 H3」本身,都已经开始形成一套社区知识库。有人写几十分钟的完整部署教程,有人整理不同显卡该下哪个权重、显存不够怎么 offload、哪个 LoRA 更快,也有人直接做出了 H3 的 Awesome List,把散落在各处的模型变体、VAE、LoRA、节点和工具统一收编。一个模型开源才几天,围绕它的东西已经多到需要有人专门做目录了。

可以说,视频生成这个方向,开源社区已经很久没有这么热闹过了。
其实我们也好奇,之前这个方向也不是没有过开源模型,为什么这次动静这么大?开发者们这么热情高涨?
过去一周,我们泡在了 r/StableDiffusion、ComfyUI 的 issue 区、Hugging Face 的模型页、B 站和 GitHub 上,跟着一群素不相识的人,看他们为什么喜欢这个模型,怎么把这个模型拆开、压扁、提速,再重新拼成自己想要的样子。
下面我们想记录一下我们的发现。如果你正准备本地跑 H3,它大概也能当半份避坑指南看。
01、这次开源社区拿到的,终于不是一个「次一档」的模型
开源社区有个特点,如果你模型不行,你可能连批评都听不到,HuggingFace 上的下载量就说明了一切,平庸的模型最终只会被无视。
相比之下,H3 这次让我们看到的是另一番景象。截至本文写作时,光是在 Hugging Face 上,MiniMax H3 及其衍生模型变体的数量就已经达到了 178 个!其中 Comfy 为 ComfyUI 重新打包的 H3 获得了超过 310 万次下载,多个不同的量化版本也均有数十万的下载量,甚至超过了官方的模型文件。

这种景象,我们之前几乎只在语言模型社区见过,而且主要是 DeepSeek 这类有压倒性优势的开源模型。
原因很简单:一堆中不溜丢的模型不值得大家花那么大功夫搞变体、疏通生态。这就是典型的「用脚投票」。所以在开源社区的建设上,视频模型始终落后语言模型一个身位。
前段时间媒体报道过的「AI 短剧公司凌晨上班排队生成视频」说的也是这么一回事:大家宁愿熬夜去排闭源模型的长队,也不愿用开源模型。
但 H3 的出现似乎正在改写这一局面。在过去的这一周,开发者用自己的实际行动,实打实给这个模型投了票。

在 reddit 的官方 AMA 里,有开发者特意跑来向 H3 团队表示感谢。
据我们观察,这次触动大家的主要有两点。
一是模型能力确实到了*梯队,大家知道自己用的不再是「次一档」的模型,这点通过 Artificial Analysis、Arena AI Image-to-Video、Design Arena 等多个榜单的数据都能看出来。

在 Arena AI Image-to-Video 榜单中,H3 稳坐开源模型榜首,而且与闭源榜首差距非常小。
二是模型确实玩法比较多、对本地部署的条件也没那么苛刻。无论你手里的硬件是 Mac,还是 RTX 5090、4090、4080 甚至 3060,你都有办法在本地跑起来,而且生成的质量远超之前的所有开源视频模型。

所以,MiniMax 不只是开源了 H3,还交出了一套足够强的底座,剩下的边界开始由社区自己往外推,这也是它的吸引力所在。出于好奇,我们也进一步顺着这些开发者留下的模型、代码和工作流,往里面扒了扒,看看他们是怎么一步一步把这个模型玩出花的。
02、首先,让 MiniMax H3 跑起来!
对于开源模型,社区拿到手的*件事无一例外,都是想办法将其在更多设备上跑起来。
然而,MiniMax H3 很大,有 600 亿参数,包含文本编码器和 DiT 模型,BF16 权重大约需要 120 GB 内存。而绝大多数消费级显卡只有 24 GB 甚至更少。所以,开源社区首先面临的*道坎是如何将其塞进自己的显卡。
ComfyUI 研究了模型结构,发现模型的调制(modulation)权重约占总参数量的四成,而这部分的输出可以预先计算并缓存,于是把它剪掉、换成一张功能等价的查找表;再叠加 int8 convrot 量化和一个降低推理峰值显存的定制 kernel,整体内存占用下降 66%——从全精度的 123.6 GB 压到最小变体的 42.5 GB。配合动态 offload,一台 RTX 3060 也能把它跑起来。

有意思的是,这个「四成参数可以不加载」的线索,其实已经写在官方发布博客中:H3-Omni-Transformer 是稠密单流 Transformer,其中 AdaLN 调制输出可以预先计算并缓存,这部分在纯推理部署中不需要加载;官方仍然发布了完整权重,以支持包括微调在内的进一步开发。
把训练用的完整权重和推理用的精简路径同时交出去,是一个对下游相当友好的选择;第三方因此有机会做出比官方更省显存的分发版本,而不必去猜结构。
有了这个口子,社区的量化变体很快就铺满了几乎每一档显存。GGUF 从 Q2_K 到 Q5_K_M,NVFP4、INT4 ConvRot、混合 INT4/INT8,OrbitQuant 的 W4A4 和实验性的 W4A8,一直到魔搭 DiffSynth-Studio 放出的 NF4 版本——后者把*显存需求压到了 8 GB。Mac 用户则等来了社区做的 MLX 支持。整体来看,这一周就像是 MiniMax H3 的寒武纪大爆发。

然后就是各种极限测试。
有开发者写了针对 AMD RDNA4 R9700 AI Pro 的 ComfyUI patch,附三套工作流和启动参数,配合 Turbo LoRA 生成 5 秒片段只要 45 秒。
有人在 4 卡 3090 上把同一段片段从 11 分 21 秒压到 3 分 45 秒——硬件没变,变的是一个 AI agent 重写的注意力 CUDA kernel,加上社区在 Hugging Face 上传的减步 LoRA。
有人在 6 GB 显存的四年前游戏本上、把分辨率压到 0.2 megapixel 跑通了 H3,代价是 15 秒片段要跑四十分钟。


如果你要上手,综合各量化版本的显存标注,大致可以这样分档:
24 GB 是目前的舒适线,用 INT8 权重加按层 offload 基本能顺跑;
16 GB 建议直接上 INT4 或 NVFP4;
8 GB 能跑 NF4,但要同时接受画质和速度的双重代价,更适合验证流程而不是出片。
另外一个容易被忽略的点,在中,团队成员特意提过:模型无法全部留在显存时变慢是正常现象,ComfyUI 会在需要时搬运权重,实际速度还取决于系统内存和 PCIe 带宽,也因此同一张显卡装在不同主机上,出片速度可能差出一截。offloading 的设置本身也是一个可以在速度和质量之间调节的旋钮。
跑起来之后,第二个问题立刻就来了:太慢。一段十几秒的片子动辄要等十几分钟,对靠反复试错找感觉的创作者来说,这个节奏基本没法用。
8 月 5 日,开放权重后的第二天,一位叫 larryvrh 的开发者放出了 H3 的*个速度 LoRA,把采样步数从约 20 步压到 4 步,采样时间约提速 5 倍,视频与同步立体声一并生成。(该项目今天还更新了一波。)

作者还分享了自己的实践经验:4 步能出图,但明显偏软;6 到 8 步才是当前画质的舒适区。
紧接着,ModelTC 与 lightx2v 放出了 Minimax-H3-Turbo 的 4 步蒸馏方案。国内这边,B 站创作者 T8star-Aix 适配了 ComfyUI 可用的加速 LoRA,还开源了一个支持步数分离的双时钟采样器。
MiniMax 官方在 𝕏 上对此反应积极:开放权重四天之后,社区做出了通常属于实验室交付物的东西;并表示「这就是我们开源的原因。」

当然,减步是有代价的。官方也在答疑中进行了补充说明:当前检查点已经包含 CFG 蒸馏,最终训练阶段的特殊策略也让模型具备了一定的少步推理能力,但它并不是针对极端低步数专门蒸馏的模型;团队正在探索 step 蒸馏,目标是在不产生明显质量损失的前提下降低推理成本,也在评估 4-NFE 或 8-NFE 版本,但暂时无法承诺发布时间。
所以我们可以有个大概结论:试镜头、找构图的时候用 4 步,反正只是看方向;真正要出的那一条,回到 6 到 8 步。如果你发现人物动作开始「散架」或者音画对不上,*件该怀疑的事就是步数压太低了,而不是 prompt 写错了。
社区都是怎么玩儿的?
解决完能不能跑、跑多快,接下来或许是最有意思的部分:大家拿它干了什么?
我们已经在前文中分享了一些有意思的用法,包括复刻中式仙境、做游戏概念片、改编电影桥段、让不同画风的角色同屏,还有把视频模型当图像编辑器和音频生成器使的「邪修」路子。但真正泡进社区之后会发现,这些还只是表层。更值得记录的是另一类东西:社区在摸索怎么把 H3 用得稳,而不只是用得野。
几个实用策略
我们首先来看一种极为实用的生成策略:时间码分镜。
这是社区扩散最快的 prompt 写法之一,即把片子按时间码切成分镜:[0s-2s]、[2s-5s] 这样列下去,每段之后跟一个多模块结构,包括风格约定、时间线、镜头、音频、需要逐字出现的文本、负面清单。这套模板流行开后,已经被写进了好几份第三方指南。
此外,MiniMax 官方也在与 Comfy 团队的直播里给了两个具体的技巧:
对白怎么写才稳:很多人抱怨输入音频参考之后口型和画面对不齐,官方给的做法是:把输入音频作为 reference,同时在 prompt 里用引号写出角色要说的台词,并且把这句话放进对应镜头的描述中。这样通常能提升对白生成的稳定性和一致性。
多镜头产品广告怎么搭:这是被问得最多的工作流之一,官方给的搭法并不复杂:先用输入参数定义时长与镜头数量,比如 10 秒 5 个镜头、平均每镜约 2 秒;再通过 LLM prompt enhancer 生成预览 prompt,并传入多张参考画面。ComfyUI 模板库里已经有对应的基础工作流,镜头、参考输入和提示词都可以自己调。
沿着同一条思路,社区还试通了两个更完整的用法。一是给一张图片加一段音频参考,让模型自动完成对口型;二是在一次 15 秒的生成里直接编排五个以上分镜,人物和空间还能保持一致——这在过去需要分段生成再手工对齐。
说回前面那两个「邪修」玩法,它们其实都不是纯粹的歪打正着。
先说把 H3 当图像编辑器用。做法很取巧:让模型只生成极短的片段,再从中抽一帧出来当图片使。而在 AMA 里,MiniMax 的研究员顺带提到了一个训练期间的观察:他们曾训练过一个只做「给首帧和一句 caption、预测末帧」这一简单任务的模型,结果它在完全没有做过图像编辑专项后训练的情况下,就在多个图像编辑基准上取得了很强的零样本结果。这让团队相信,在自然语言指令的引导下,原生的上下文学习能够泛化到不同任务。社区摸出来的这条歪路,恰好命中了这个模型设计里一条自带性质。
再说 32×32 分辨率下变成音频生成器。一个合理的解释是:H3 的音频和视频是在同一次扩散过程里共同去噪的,同步来自生成过程本身,而不是后期对齐。当视觉部分被压到几乎不占算力,剩下的自然就是一条纯粹的音频生成通道。
世界*的视频编辑能力
MiniMax H3 另一个被社区重点开发的能力是视频编辑,毕竟它可是 Artificial Analysis 视频编辑方向的当前榜首。

比如在 Reddit AMA 中,一位影视从业者贴出了他的两个实测:
他拍了一段 10 秒的手持后院素材,给模型一张迅猛龙的角色设定图,要求把它放进画面里行走和捕猎。结果是既完成了合成,也保留了原素材的细节与运动,而且没有不必要地改动画面的其余部分。
他给了一段绿幕舞蹈素材和一张霓虹街道静图,要求替换背景并对人物重新打光。结果不算*,但合成与打光都成立了。
他自己的结论是:这类「只改要改的部分」的可控编辑,对视频生产是真正有价值的工具。
15 秒生成窗口如何做长视频?
而如果你正在寻找让原生窗口 15 秒的 H3 生成长视频的方法,可以参考下 Reddit 用户 Zironic 摸索出的做法:反复让模型每次生成 141 帧,把上一段视频和音频的最后 51 帧作为参考传回去,同时始终提供同一张目标主体的图像做参考,以此拼出一段连贯的 60 秒乃至更长的视频。

这个方法后来被官方在技术整理里确认了:这种能力来自预训练阶段的音视频续写任务,开发者的实践印证了这一点。
官方同时也给了边界:Ref2VA 可以把前序内容当作参考条件来支持续写,但当前模型还没有原生训练过由多个递归片段组成的长轨迹;真正的递归式续写,需要结合稀疏注意力做原生长轨迹训练。

除此之外,我们还看到了不少值得一试的方向,比如给一张图片配上一段音频参考让模型自动完成对口型,或者在一次生成里直接编排多个分镜、让人物和空间保持一致。
MiniMax H3 开始进入产品和工作流
到这一步,社区做的事情已经从「试玩法」变成了「做产品」。ComfyUI-MiniMaxH3-Easy 把文生视频、图生视频、参考视频生成收进一套统一工作流;另一个叫 MiniMaxH3 Director 的项目干脆把常用玩法整理成了一张「导演台」,文生视频、图生视频、首尾帧续写、视频换人都摆在同一个面板上。RunningHub 则维护了官方之外的一套 ComfyUI 插件,把完整的 H3 运行时搬进 ComfyUI 进程内,覆盖 T2VA、FL2VA、Ref2VA 三条任务链路,配合 INT8 权重与按层 offload,24 GB 单卡就能跑。
这些东西的共同点是:它们不再要求使用者理解模型,只要求他知道自己想要什么。
还有一批人在把 H3 塞进已有管线。有创作者把它与 Krea、ElevenLabs、Suno 串成完整流程;也有人把 MiniMax 语音克隆与 HeyGen 数字人写成了一个 Agent Skill:先校验素材的格式、体积和清晰度,再进正式流程,先出 15 秒 720P 预览确认口型和面部形变,确认无误才生成 1080P 成片。
把这一周的玩法摊开看,会发现它们其实指向同一件事。
H3 把文本、图像、视频、音频放进了同一个上下文,于是任何一个模态被推到极限,另一个模态就会自己浮出来:把分辨率压到 32×32,它是音频模型;把时长压到几帧,它是图像模型;把参考条件换成上一段的结尾,它是续写模型。社区并不是在给 H3 增加功能,而是在不断确认:这个模型比它发布时被定义的样子要大。
而这种「一个底座、无数种接法」的结构,能量并不止于社区。当越来越多人开始在同一套权重上做量化、写工作流、封装产品,这件事的外溢,就不再只发生在 GitHub 和 Hugging Face 上了。
03、现象级火爆带来的连锁反应
MiniMax H3 的火爆堪称现象级,自然也收获了开源社区之外的目光。
先看媒体。福布斯把 H3 描述为中国厂商开源路线的延续。路透社则关注了两个更硬的点:H3 生成 2K 视频的成本不到主流竞品的三分之一,以及这个模型在设计上就考虑了多款国产芯片的运行支持。国内价格口径可以对上:768p 档约 0.5 元/秒,2K 档约 0.8 元/秒。
产业链的反应则更实在。正如前文所说,有超过 100 家国内外合作伙伴完成 Day-0(首日)适配:fal 以官方 API 伙伴身份一次开出三个专用端点,RunningHub 把 H3 接进了全线产品,vLLM-Omni、SGLang、腾讯云完成推理侧接入,华为昇腾、摩尔线程、沐曦、昆仑芯以及 AMD、Intel 等九家芯片厂商同日完成适配。
最后是资本市场的反应。杰富瑞重申买入评级并给出 1118 港元目标价,花旗认为 H3 具备商用级内容生成能力、维持买入评级。
把这些放在一起,我们能看到其中的「连锁反应」:开源把一个原本封闭在 API 后面的能力,变成了一段所有人都能接的公共管线。芯片厂商在上面调性能,推理框架在上面做吞吐,云平台在上面卖算力,工作流作者在上面做封装,创作者在上面出片。每一层都能各自计价,也各自获益。这是闭源模型无论定价多低,都很难复制的一种结构。
以前是厂商之间比模型,现在开始比不同生态的跑通效率:比谁的权重能被更多人在更便宜的硬件上跑起来,比谁的工具链能被更快地塞进别人的工作流,比社区愿不愿意在你的模型上花掉一个周末。
这就是技术平权的真正内涵;对一个开源模型来说,这才是真正的*周。






