最近 AI 视频这块又热闹起来了。不过和前两年不太一样,以前效果好的视频模型基本都在云端,想玩就得充值、买积分,一次生成几秒钟,抽卡抽得心疼。现在MiniMax H3 开放权重之后,咱们这些有独显的臭打游戏的有福了,终于可以正儿八经塞进自己电脑里跑了。
最简单的方法就是,去某g__hub上下载Windows Portable版本,N卡就下ComfyUI_windows_portable_nvidia。别像我一样,自认为我的CPU是intel的,就下了intel版本,结果打开后无法加载GPU……
另外,ComfyUI有desktop安装版本,但装好后部署comfyui我发现其内置的最新版是0.28的,在模板里搜不到minimax H3 图生视频,所以就别用desktop安装版了。
下载好后解压,ComfyUI_windows_portable的目录如下:
把它放到一个没有中文的目录下就行,建议放到硬盘的根目录,可以减少文件路径过长导致的错误。打开run_nvidia_gpu.bat批处理文件后,它会自动启动terminal终端来完成各项部署,完成后就会启动浏览器开启web工作台:
我们点击模板。
在模板里选择生成类型》视频,里面就可以按照我们的需求去选择模板了,选好之后,就会进入节点式工作流↓
第一次部署我建议先玩:MiniMax H3文生视频(T2V)
因为它变量最少。先确认模型能够正常加载、采样和输出视频,再折腾其他的。
下载哪些模型?
如果你用的是T2V或者I2V,官方推荐的本地组合主要是下面四个文件。
视频扩散模型
minimax_h3_fl2va_pruned_int8_convrot.safetensors
放到ComfyUI解压后目录里的:
ComfyUI/models/diffusion_models/
·
Qwen3-VL文本/多模态编码器
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
放到:
ComfyUI/models/text_encoders/
·
Video VAE
minimax_h3_video_vae_fp16.safetensors
+
Audio VAE
minimax_h3_audio_vae_fp32.safetensors
两个模型放到:
ComfyUI/models/vae/
如果你要玩R2V参考生视频,则需要另外下载:
minimax_h3_ref2va_pruned_int8_convrot.safetensors
同样放进:
ComfyUI/models/diffusion_models/
FL2VA和Ref2VA是两套不同权重,别下错了。
模型搞定后,就可以关掉comfyui并重新打开加载一遍,随后就能正常用了。
试下!
文生视频
我们先做一次最简单的T2V,不要看到H3支持高分辨率、15秒,就直接把所有参数拉满,先确认能跑。
我建议第一次直接:
16:9;832×480;5秒
duration就是时长,5.0就是5秒钟;百万像素0.4就是832×480。
然后写一条简单Prompt,比如:夜晚的东京街道,一名穿黑色夹克的年轻男子从便利店走出来,细雨落在路面上,霓虹灯倒映在积水中。镜头缓慢向人物推进,人物停下来抬头看向天空。背景有轻微车辆行驶声和雨声,远处传来城市环境音,电影感,真实摄影。
大概2分半就能生成5秒的视频,效率我觉得还挺不错。
Prompt你不用只写:人物、衣服、背景、镜头。
还可以直接把:
人物做什么、镜头怎么运动、环境里有什么声音、人物说什么、背景音乐是什么
全写在同一个Prompt里面,如果不太会写的话,可以用deepseek这类AI工具帮你润色,扩展想象力。H3本身就是音视频联合生成,所以Prompt里把画面、运动和声音一起描述清楚,一般更容易得到接近预期的结果。
接下来
图生视频
实际玩下来,我觉得很多人真正用得最多的应该还是I2V,纯文生视频随机性还是比较高。而图生视频可以先把人物、产品或者场景确定下来,再让H3负责“让它动起来”。
在模板里选择生成类型》视频》MiniMax H3图生视频
节点工作流载入完成后,点击选择文件上传,把自己的图片放进去。然后写动作。
例如拿一张产品照片,可以写:
保持产品外观、材质、颜色和Logo不变。镜头缓慢从左向右环绕产品,背景灯光产生轻微移动,产品保持静止。镜头最后缓慢推进至产品正面。环境安静,伴随轻微电子氛围音乐。
如果有明确的结尾画面,还可以复制一下加载图像的节点,接First Frame+Last Frame——也就是我们经常说的首尾帧生成,H3会尝试生成两个画面之间的运动过程。
对于产品动画、转场以及一些短片镜头,这个功能其实非常实用。
比如做数码产品视频的时候,我完全可以先拍好产品的起始画面和结束画面,再交给H3补中间过程。相比完全靠Prompt抽卡,可控性要高不少。
参考生视频
H3比较有意思的是Reference to Video,比如可以给它:人物照片+喜欢的运镜+参考声音。然后告诉H3:人物外貌参考Picture 1,镜头运动参考Video 1,人物声音参考Audio 1。模型会自己理解这些素材之间的关系。
官方工作流要求参考素材按照<Picture 1>、<Video 1>、<Audio 1>这样的顺序进行描述,而且最好明确告诉模型每一个素材到底负责什么:人物身份、画风、动作、镜头还是声音。
比如:让图像1的女生做出图像2的动作,镜头缓慢向人物推进,人物停下来抬头看向天空。远处传来山谷环境音,电影感,真实摄影。
效果还不错。
常见问题
找不到GPU 无法加载独显
重下一个适合你GPU品牌的版本,N卡下nvidia的,A卡下amd的,别像我一样和CPU的品牌弄混。还有就是驱动下最新版本的,N卡尽量选择studio。
工作流打开全是红色报错
先更新ComfyUI,如果是很久没更新的版本,很可能压根没有H3相关的原生节点。如果是desktop版,建议删了重新下一个portable的。
小显存小内存能不能跑?
用固态硬盘虚拟内存,能跑,但真的慢。
最后
这次ComfyUI原生支持之后,本地部署门槛已经比想象中低很多,无论是内置工作流、支持中文这些都极大的降低了门槛。唯一的门槛就是一张显存较大的独立显卡吧,但如果你有大显存显卡的话,我觉得还是值得玩一玩的。
