跳到正文
Comfy· Bryan Wade·· 14 小时前精选

如何在单张 GPU 上用 MiniMax H3 生成实时视频

How I Generated Live Video with MiniMax H3 on a Single GPU

AI 导读

作者用 FastVideo 的 FastH3 V2 checkpoint 配合四项采样、VSA 稀疏注意力、ClipProj 小文本编码器、INT8 剪枝 checkpoint 与 FP4 融合 MLP 等优化,在单张 RTX 5090 上把 15 秒 448×256 视频的生成时间压到 15 秒以内,显存需求从 80GB 降到 30GB 以下。

推荐理由

作者公开了在单张 RTX 5090 上实时生成视频的完整优化组合,可迁移到其他视频模型的部署场景。

正文 · AI 翻译

ComfyStreamerH3

背景

最近,实时视频在 AI 推特上成了热门话题。从 Fal 发布的、在质量上竞争并在上个月登顶榜单的 H3 Max 模型,到在成本上做优化的 FastH3 模型。自从人们开玩笑说 AI 模型无法让威尔·史密斯吃意大利面动起来以来,视频模型已经走了很长一段路!

尽管这些最近的模型令人印象深刻,但存在一个问题。这个问题就是成本。持续运行这些模型每天可能花费高达 6 千美元!这使得这些模型对普通消费者来说完全无法使用。

感谢阅读 ComfyUI Newsletter!免费订阅以接收新文章并支持我的工作。

目标

所以我问的问题是,这些模型能被推到多远?如果你让一个智能体在互联网上搜索每一种优化、每一种加速、每一种成本节省,当然还有每一种为了速度而牺牲质量的肮脏技巧。然后如果你把这一切整合到一个在单张消费级 GPU 上运行的单一自定义 comfy 节点中会怎样?我的要求如下:

  • 硬件:一张拥有 32 GB 显存的 RTX 5090

  • 速度:在 15 秒或更短时间内生成 15 秒视频

  • 分辨率:448×256 分辨率

  • 质量:保持可观看,即使片段有粗糙的边缘

RTX 5090 是一个有用的目标:一些高端游戏 PC 拥有它,而且在市场上最便宜的一端,可以以大约每小时 70 美分的价格租到。

基准测试

示例:同样的意大利面。三种风格。

动漫

风格化 3D

水彩

这些片段显然有一些粗糙的边缘和伪影。但对于一张每小时租金不到 70 美分的单张 GPU 来说,这结果还不算太糟!

但话不多说,让我们进入细节。随意观看者请注意,其中一些我甚至都不理解,因为它们只是我的智能体能够从其他项目中提取出来的。赞美 Astra Codex!

实现细节

我在四步设置中使用了 FastVideo 的 FastH3 V2 检查点。作为对比,FastVideo 的 Preview V1 在一张 B200(提示:贵得多的 GPU)上生成了 15 秒、1344×768 的片段,用时 47.2 秒。

以下是我们为在单张 RTX 5090 上运行该工作流所做的优化:

  • 四个采样步骤。每一步都是另一轮模型工作来细化视频。使用四步意味着每个片段的工作量更少。

  • 稀疏注意力。注意力让视频的各部分在生成时共享信息。VSA 将完整注意力集中在选定的 20% 视频块上——跳过约 80%——同时仍然包含提示词。

  • 更小的文本编码器。编码器将你的提示词转换为 H3 可以使用的信息。NicoLab28 的 ClipProj 改造 Qwen3-VL-4B 来替代 H3 的 32B 编码器:它使用约 4.5 GB 而不是 15.7 GB。

  • 更小的检查点。FastVideo 的剪枝 INT8 检查点将剪枝(移除选定的权重)与 INT8 存储(8 位数字)相结合,减少了模型所需的 GPU 内存。

  • 融合的 FP4 MLP。MLP 处理模型大量的重复计算。对这一部分使用四位数学并融合其操作,意味着权重的内存更少,需要移动的临时结果也更少;这建立在 ByronLeeeee 的 H3 优化之上。

  • 解码与编码同步进行。 Kijai 的 INT8 H3 视频解码器以分块方式重建视频。NVENC 在解码器准备下一块时就开始写入已完成的块,因此这些步骤相互重叠。该工作流只保留最后一帧用于下一个任务,而不是缓存每一帧解码结果。

这些优化同时提升了速度和内存利用率,将显存需求从 80GB 降至 < 30GB,可安全容纳于 RTX 5090 的 32 GB 显存之内。

演示

如果你想亲自测试结果,该自定义 Comfy 节点已在此处开源发布: https://github.com/Comfy-Org/comfystreamerh3

此外,你还可以从 Comfy 开发者平台 租用 GPU。

Comfy API 负责处理 GPU 托管、模型和依赖项,因此你的应用无需自备 GPU 即可请求视频。你还可以按照 readme 此处 的说明注册并将此演示部署到 Comfy API。

最终思考

这些视频在图像细节、一致性和分辨率方面显然还有很大的提升空间。但能让 H3 在单块 RTX 5090 上实时生成哪怕只是部分可辨识的视频,就足以说明在单 GPU 实时视频这一前沿领域,这些模型还能被推进多远。下一步可以是将每个片段送入一个成本优化的视频超分模型,例如最近发布的 SolRefinery:即先以 448 × 256 快速生成初始视频,再低成本地超分到更高分辨率。我对该模型的初步测试显示,仅用 3 倍 GPU 即可实现 7 倍像素密度提升。因此,考虑到未来优化的可能性,我们可能比你想象的更快拥有成本高效、半可用的实时视频!

超分结果

感谢阅读 ComfyUI Newsletter!免费订阅以接收新文章并支持我的工作。

来源:Comfy · blog.comfy.org