news 2026/8/27 16:48:14

MiniMax H3 量化全模态视频生成:16GB 显存本地跑 2K 带音频视频

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MiniMax H3 量化全模态视频生成:16GB 显存本地跑 2K 带音频视频

MiniMax H3 量化全模态视频生成:16GB 显存本地跑 2K 带音频视频

【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot

MiniMax-H3-nvfp4-INT4-INT8-Convrot 提供 MiniMax H3 全模态视频生成的量化权重,覆盖 INT4、INT8、NVFP4 三种精度,让 16GB–24GB 显存的显卡能在 ComfyUI 里本地生成 2K 带立体声音频的视频,16GB 卡显存占用约 11.3GB。

🎬 16GB 显存卡在哪?MiniMax H3 量化本地生成的三个场景

先说结论:原版 H3 的开销在服务器级,消费级显卡普遍卡在加载这一步。它的骨干 H3-Omni-Transformer 是 33B 稠密 Transformer,文本编码器又用了完整的 Qwen3-VL-32B,4070 Ti Super 这类 16GB 卡装不下。

如果你要用多张图参考人物或场景,24GB 显存对应 INT8 权重:约占 21GB,是各档位里剪枝后质量最高的一档。

如果手头是 RTX 5090 这类 Blackwell 新卡,NVFP4(英伟达 4 位浮点格式,需 Blackwell 硬件支持)只占 12.5GB,压缩效率比 INT4 更优。

16GB/24GB/Blackwell 显卡怎么选 MiniMax H3 量化模型文件

规则一句话:显存越小精度越低,24GB 选 INT8,Blackwell 选 NVFP4;扩散模型和文本编码器要同精度搭配。

你的显卡扩散模型(仓库根目录)文本编码器(text_encoders/)大致显存
16GB:RTX 4070 Ti Super / 4080_pruned_int4_convrot_pruned_mixed_int4_int8_convrotqwen3vl_32b_minimax_h3_int4_convrot.safetensors(15.0GB)11.3–15.5GB
24GB:RTX 3090 / 4090_pruned_int8_convrotqwen3vl_32b_minimax_h3_int8_convrot.safetensors(27.1GB)约21GB
Blackwell:RTX 5090_pruned_nvfp4qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(15.7GB)12.5GB

不管选哪档,vae/里的两个文件都必下:minimax_h3_audio_vae_fp32.safetensors(605MB,音频解码)和minimax_h3_video_vae_fp16.safetensors(5.21GB,视频解码),VAE 是把潜码还原成画面与声音的最后一环。

🛠️ 5 步完成 ComfyUI 本地部署

  1. 克隆仓库:
git clone https://gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot
  1. 准备环境:Python 3.10+,装好 PyTorch 与 Diffusers,或直接使用 ComfyUI。
  2. 文件入位:扩散模型进models/diffusion_models/,文本编码器进models/text_encoders/,两个 VAE 进models/vae/
  3. 工作流加载:UNETLoader 选扩散权重,CLIPLoaderGGUF 选文本编码器,VAELoader 分别挂视频和音频 VAE;仓库附带的ref2.json是现成工作流,可直接导入。
  4. 参数起步:24 FPS、短边默认 768px,先跑 4 秒片段,再逐步加长。

FL2VA 与 Ref2VA 输入规格速查(进阶)

FL2VA 还是 Ref2VA 看输入复杂度,不看显存。FL2VA 管标准流程:纯文本生视频、单图做首帧或尾帧、双图定首尾帧;Ref2VA 管多模态参考,上限如下:

系列输入上限
FL2VA0 / 1 / 2 张图,也可纯文本
Ref2VA≤9 张图;≤3 段视频(每段 2–15 秒、总长 ≤15 秒);≤3 段音频(每段 2–15 秒,需搭配图/视频);混合文件 ≤12 个

所有量化权重的输出规格一致:时长 4–15 秒;短边默认 768px,可上 2K;24 FPS;32kHz 立体声音频;对白支持中、英、日、韩、德等 11 种语言。

许可证与使用边界

权重遵循 MiniMax H3 Community License Agreement,仅限非商业研究和个人使用,官方渠道另有内容合规审查。先按显存把文件选对,再用 4 秒、768px 参数起步,第一条带声音的视频会比你想象中来得快。

【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/27 16:44:02

热轧带钢表面缺陷检测:基于YOLO的深度学习实战项目解析

简介:在工业制造场景中,表面缺陷检测是保障产品质量的关键环节,尤其在热轧带钢这类高速连续产线上,传统人工目检已难以满足实时性与一致性要求。深度学习目标检测技术的引入,为这一领域带来了高效可靠的自动化解决方案…

作者头像 李华
网站建设 2026/8/27 16:43:56

CarSim与Simulink联合仿真:MPC路径跟踪控制器开发与调参实战

简介:在自动驾驶技术落地过程中,路径跟踪控制是连接规划与执行的关键环节。模型预测控制(MPC)凭借其滚动优化与显式约束处理能力,成为中高速场景下最受关注的算法之一。而CarSim作为高精度车辆动力学仿真软件&#xff…

作者头像 李华