把 MiniMax-H3 音视频联合生成模型接入 ComfyUI 的插件,支持文生视频+音频、首尾帧驱动和多模态参考三种任务,靠 INT8 量化与分层卸载在单张 24GB 显卡上跑完整流程。

适合已有 24GB 以上 N 卡的 ComfyUI 老用户 · 做短视频/广告分镜的创作者 · 想研究音视频联合扩散的开发者

亮点

  1. 音画同一次扩散生成

    双 sigma 整流流采样器让视频与音频共享采样步、各自独立 shift 调度,声音天生咬住画面动作,不用事后对齐音轨。

  2. 24GB 单卡能跑起来

    DiT 自动分层卸载、adaLN 预计算后释放约 40% 权重、按形状预留激活显存,把大模型压进消费级单卡。

  3. res_multistep 省 2.5 倍去噪

    二阶指数积分器用约 21 个 sigma 点达到 50 步 Euler 的画质,权重不变、无需重量化,默认仍是 euler。

  4. 接错线直接报错而非出废片

    每个加载器输出都带版本与组件指纹,混用 FL2VA 和 Ref2VA 组件或中途换权重会失败退出,不会静默生成错误结果。

取舍

选它的理由

  • 音画同步由生成过程产出,省掉后期配音对轨
  • 24GB 消费级单卡即可跑完整 H3 运行时
  • T2VA/FL2VA/Ref2VA 三种任务一个插件覆盖
  • 自带示例工作流,改掉占位素材名即可跑通

先想清楚

  • 显卡显存低于 24GB 或用的是 AMD/Mac
  • 只想快速出一条带音效的视频
  • 生产环境需要稳定可回溯的版本
  • 无任何 GitHub Release,只能 git clone 装

安全警示

  • 无自身安全事件记录;但 ComfyUI 生态存在 CVE-2025-67303:ComfyUI-Manager 3.38 前配置文件存放位置权限不足,可被远程篡改,建议升级
  • 该插件无 GitHub Release,需直接 clone main 分支运行,代码变更缺少版本审计边界
  • 需从第三方账号 Gluttony10 下载 INT8 转换权重,非 MiniMax 官方仓库,建议自行校验文件

基于公开资料与 AI 分析整理,仅供参考,请自行核实。

同类推荐

查看全部

更多「音视频工具」软件

软鉴 SoftMemo

AI 整理的软件知识库

AI 整理软件资料、版本动态、更新通知、订阅权益与对比分析,沉淀可复用的工具知识。