在 AI 影片生成技術跨越式突破的 2026 年,創作者對影音同步品質與生成效率的要求已推升至全新境界。MiniMax 稀宇科技推出的大型全模態模型 MiniMax H3,憑藉其原生「聲畫同步聯合生成」的強大架構,一次算完就能同時輸出畫面和立體聲,成為開源社群中極具代表性的頂級模型。然而,原生模型龐大的參數開銷與長時間採樣,往往讓本地消費級顯卡望而卻步。這正是 ComfyUI 展現其模組化優勢的核心時刻。
本文將深入探討如何構建一個兼顧「品質優先」與「極速渲染」的圖生影(Image to Video, I2V)自動化工作流。我們摒棄了會損害細節與肢體結構的 Turbo 類模型,採用全原生的 20 Step 採樣,並透過整合 Spectrum 頻域快取預測與 SageAttention 注意力機制優化,成功將生成等待時間大幅壓縮。對於擁有 RTX 50 系列顯卡的使用者來說,這套工作流能在顯存安全不 OOM 的前提下,流暢產出畫質頂級、音畫完全同步的精緻影片。
此工作流的精髓在於其「品質與速度的完美平衡」。透過 ComfyUI 的靈活架構,我們將 Qwen3-VL 32B 文字編碼器、原生 FL2VA 擴散模型與雙 VAE(影片與音訊)進行模組化拆開處理。導入的 Spectrum 加速器在維持前 5 步構圖與後 5 步細節完全原生的基礎上,對中間採樣進行頻域外推;搭配 SageAttention 降低注意力矩陣計算開銷,讓原本動輒數十分鐘的生成任務大幅提速。無論是製作帶有柔和哼聲與配樂的角色短片,還是進行動態鏡頭壓力測試,這套流程都是不折不扣的頂級生產力神器。
📝 核心技術要點說明
| 項目 | 說明與建議路徑 |
|---|---|
| 核心擴散模型 (Diffusion) | 需放置於 ComfyUI\models\diffusion_models,建議使用 minimax_h3_fl2va_pruned_fp8_scaled.safetensors。 |
| 文字與視覺編碼器 (CLIP) | 需放置於 ComfyUI\models\text_encoders,採用 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors。 |
| 影像解碼器 (Video VAE) | 需放置於 ComfyUI\models\vae,檔案為 minimax_h3_video_vae_fp16.safetensors。 |
| 音訊解碼器 (Audio VAE) | 需放置於 ComfyUI\models\vae,檔案為 minimax_h3_audio_vae_fp32.safetensors。 |
| 雙重加速客製化節點 | 需安裝 comfyui-spectrum-minimax-h3(Spectrum)與 comfyui-kjnodes(SageAttention)。 |
上述提到的四款核心模型檔案,在您將本文提供之工作流 JSON 檔案導入 ComfyUI 時,系統若偵測到本地路徑缺少對應檔案,通常會自動跳出提示,詢問是否協助下載這些模型。這項自動化機制能大幅降低初次配置的門檻,確保工作流在不同設備間遷移時的便利性與穩定性。客製化節點建議在導入工作流前先行安裝好,另外 SageAttention 若要成功運作,可先參考這篇文章進行環境準備。

▲ 此圖展示了工作流的整體邏輯分佈,主要分為三個步驟。Step1 負責載入 MiniMax H3 核心擴散模型、Qwen3-VL 文本編碼器以及雙 VAE 解碼器;Step2 設定直向畫面的解析度與生成長度,並透由腳本自動計算對齊 17k+5 採樣幀數;Step3 則透過 PathchSageAttentionKJ 與 SpectrumApplyMiniMaxH3 雙重加速節點處理模型矩陣,最後將採樣解碼後的影像與音軌進行自動封裝,即時輸出含音效的高畫質影片!
⚡ 實測效能數據對比(RTX 5070 Ti 16 GB)
在實際測試環境中(NVIDIA GeForce RTX 5070 Ti 16 GB VRAM + 64 GB RAM),我們針對 672 x 1216 px(9:16 直向 720p 級別)、24 fps 進行了不同加速組合與生成時間的實測對比。生成過程中約佔用 50 ~ 60 GB 的系統主記憶體以及約 12 GB 的顯示記憶體:
| 影片長度 / 規格 | 加速配置方案 | 渲染總耗時 | 效能評估與品質表現 |
|---|---|---|---|
| 5 秒 (124 幀) | 單開 Spectrum 加速 | 426 秒 | 品質極佳,音畫完美同步,肢體細節穩定。 |
| 5 秒 (124 幀) | Spectrum + SageAttention 雙加速 | 316 秒 | 最佳提速點!耗時縮短約 25.8%,品質與單開無異。 |
| 10 秒 (243 幀) | 單開 Spectrum 加速 | 1153 秒 | 依然沒有品質問題。但生成時間長上不少。 |
| 10 秒 (243 幀) | Spectrum + SageAttention 雙加速 | 786 秒 | 大幅提速 31.8%!將近省下 6 分鐘等待時間。 |
🎬 生成示範提示詞與影音展示
為發揮 MiniMax H3 的劇本理解與聲畫同步優勢,提示詞採用自然語言結構化分區撰寫:
[Visual]
A front-facing medium shot. The character directly faces the camera, gently swaying her head and upper body side-to-side while blinking naturally. Natural skin texture, soft lighting.
[Audio]
A female vocal emits gentle humming sounds: <d>[English] Hmm, hmm, hmm~</d>.
[Music]
Calm, sweet instrumental piano background music.
以下為此工作流實際產出的影音同步示範影片:
▲ 觀賞示範影片可以看到萌芽娘輕晃與眨眼動態自然流暢,且背景鋼琴音樂與柔和哼聲(Hmm, hmm, hmm~)均精準對齊,展現了強大的多模態生成實力!(原始靜態圖像使用 Nano Banana 2 生成)
👉 工作流下載:點擊此處前往下載(贊助方案)
希望能幫助大家在本地體驗 MiniMax H3 時更加快速與順暢!😁
《上一篇》ComfyUI:安裝 SageAttention 教學!以啟用極速幾乎無損的 AI 影片加速術 









留言區 / Comments
萌芽論壇