返回

文章详情

MiniMax H3 在 ComfyUI 中的 Day-0 支持:开放权重、本地音频和 2K 视频

Hacker News2026年8月3日 13:34

MiniMax H3 今天发布,具备开放权重,并已在 ComfyUI 中原生支持,今天早上上线。第零天。这是一个下一代开放权重视频模型。输入文本、图像、视频或音频,它可以生成最多 2K 分辨率、最多 15 秒的 clip 的视频,带有真实立体声。它是 MiniMax 的第三代视频模型,继 Hailuo 01 和 Hailuo 02 之后,是公司首次发布的开放权重模型。在 Comfy Cloud 上尝试文本到视频 — 仅限提示;图像到视频 — 让图像栩栩如生;首尾帧 — 控制开头帧、结束帧或两者,并让模型填充其余部分;参考到视频 — 提供参考图像、视频或音频,并在片段中呈现主题、动作或声音。输出分辨率达到 2K,时间最长可达 15 秒。音频与视频在同一次传递中生成,以立体声的方式进行,而不是后续添加。这是 MiniMax 的核心能力,它将五项独立任务整合为一个模型。真实工作往往会涉及多种模态。H3 将图像、音频和视频结合在一起,并根据提示解释它们之间的关系。描述您输入内容与想要的镜头之间的关系,模型将自行处理跨模态的工作。音频是模型的一个属性,而不是后处理。每个音频输出都是原生立体声。运动转移是图形工作中最重要的。当参考视频提供运动 - 摄像机运动、表演、剪切节奏 - 同时主题和风格来源于其他地方。结合现有编辑,这意味着对镜头进行反复迭代。确保 H3 在消费级硬件上良好运作需要显著的机器学习工程。我们发现模型的调制权重(约占总参数的 40%)可以被修剪并替换为功能等效的查找表,从而显著缩小内存占用,但不影响输出质量。除此之外,这些权重采用准确而高效的 int8 convrot 量化,并且自定义内核在推断期间减少了峰值 VRAM 使用。结果是总内存占用减少了 66%,从全精度下的 123.6 GB 减少到最小模型变体下的 42.5 GB。结合我们的动态 VRAM 卸载,使下一代 2K 视频模型能够在像 RTX 3060 这样的 GPU 本地运行。更新 ComfyUI 至最新版本 0.30.0,或前往 Comfy Cloud 下载工作流,或在模板库中查找它们。下载 MiniMax H3 I2V 工作流 下载 MiniMax H3 R2V 工作流 下载 MiniMax H3 T2V 工作流 按照工作流中的说明下载模型并保存到正确的模型目录。编写您的提示,连接任何帧或参考输入,然后运行。模型权重:🤗 Comfy-Org/MiniMax-H3 一如既往地,享受创作!无帖子

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡