Fizgig:免重訓練逐塊修 LoRA,仲可以當遊戲咁變體

你試過 train 好個 LoRA 先發現風格走晒樣、身份感 overbaked 嗎?Fizgig 畀你逐個 block 拉 slider 救返,仲可以一鍵部署上 RunPod,免安裝。

Fizgig LoRA Studio — watch the full video tutorial

對成日同 LoRA 打交道嘅創作者來講,最痛苦嘅唔係訓練,而係訓練完之後先發現結果唔啱用。Fizgig 就係針對呢個痛點而嚟:佢係一個圍繞 Flux 2 Klein 9B、Krea 2 同 MiniMax H3 嘅 LoRA 工作台,聲稱可以喺 16 GB 顯示卡起跳,由普通 LoRA 一直玩到全模型微調都搞得掂。

佢最實用嘅功能叫做「LoRA surgery」:當你發現某個 LoRA 身份感太重、風格被壓扁,可以逐個 block 拉 slider 去修正,唔使重新訓練,直接輸出新嘅 .safetensors。對應到 MiniMax H3 影片 LoRA,仲可以逐 block 預覽每段對動作、面孔同聲音嘅影響,22 格短片連音效並排播俾你揀。

Minimax H3 - Edit your LoRAs directly with Video Previews

如果你鍾意試新變體,Fizgig 提供類似遊戲化嘅 mutation 流程:應用程式提出變化,你揀鍾意嘅,LoRA 就透過選擇演化落去。配合 LoRA Royale,你可以一次過睇晒成個訓練 run 每個 epoch 嘅效果,或者用 crossfade 喺唔同版本之間游走。LoRA Royale 仲可以直接輸出 MP4 或 GIF 格式嘅循環動畫,方便分享成果。

佢支援標準 LoRA、LoKR 甚至全模型微調,完成嘅 fine-tune 會變成普通 checkpoint,而 Checkpoint to LoRA 功能可以將任何 fine-tune 蒸餾返做可分享嘅 LoRA,揀你鍾意嘅 rank。對於冇 GPU 嘅人,官方提供 RunPod 一鍵部署連結,唔使本地安裝就得用到 24 GB 卡嘅 int8 設定。

重點摘要:

  • 逐 block 修復 LoRA:slider 直接調,唔使重訓練,解決 overbaked identity 同風格崩塌
  • 遊戲化變體探索:app 提議 mutation,用戶揀最愛,LoRA 經選擇演化
  • LoRA Royale 視覺化:一次過 render 晒每個 epoch,crossfade 揀最好嗰個,仲可以輸出分享用動畫
  • Block profiling:清楚顯示每個 block 揹住身份、風格定係細節,調之前先知邊度落手
  • 多模型支援:Flux 2 Klein 9B、Krea 2、MiniMax H3 三線齊,由照片、影片到聲音都覆蓋

GitHub

Categories: 開源, ComfyUI, AI productions, Video, MiniMax

VDN-H3 開源:14 秒 MiniMax 影片生成只花 11 秒

OpenVDN 團隊將 softmax 與線性注意力混合架構(hybrid attention)套用到 MiniMax H3 影片生成模型,在 8 張 B200 上以 8 步去噪產出 14.4 秒 768p 影片,速度比播放還快。

Repository image for OpenVDN/vdn-minimax-h3

影片生成最貴的部分往往不是參數量,而是長序列上的 softmax attention。VDN-H3 針對這個痛點,把 MiniMax H3 骨幹拆成兩條互補分支:滑窗 softmax 負責鄰近幀之間的精細對齊,線性注意力則接手長距離語境與主體一致性,並用 4 向邊界錨點補強全域結構。最終在 8 張 NVIDIA B200 上,用 8 步去噪就能在 11.23 秒內生成 14.4 秒 768p 片段,生成速度比播放還快。

與同類做法的差異在於「近乎無損」這個定位。純線性注意力雖然快,但長序列下容易丟失主體身份、場景佈局與時序依賴;VDN-H3 透過混合架構把這部分成本交回給局部 softmax,線性分支只負責長程記憶,因此視覺品質與原版 H3 幾乎難以區分,也比 MiniMax FastH3 有更好的指令跟隨能力。對需要高吞吐量同時不犧牲一致性的團隊,這個取捨相當實用。

部署面需要 PyTorch 2.13、CUDA 12.9 與 FlashAttention 4(含 nvidia-cutlass-dsl 預釋版依賴),另外還要安裝一份修補過的 Diffusers;骨幹權重不需更動,兩條 LoRA adapter 可在推理時合併進去,等同 plug-and-play 替換。程式碼、訓練流程與優化後的推理 stack 一併開源,研究者與影片生成產品團隊都能直接複用。

重點摘要

  • 8 步去噪、8 張 B200,11.23 秒生成 14.4 秒 768p 影片,生成快過播放。
  • 混合 attention:滑窗 softmax 保留局部細節,線性分支負責長距離語境。
  • 視覺品質與原版 MiniMax H3 近乎無損,比 FastH3 指令跟隨更佳。
  • LoRA adapter 可合併進骨幹推理,不需更動原始權重。
  • 權重、推理 stack 與訓練程式碼同步開源。

項目主頁 · GitHub · 模型· ComfyUI 節點

Categories: 開源, AI productions, 視覺模型, 多模態模型, 視頻模型, NVIDIA, Video, Python, MiniMax

MiniMax-H3-Motion-Director 全能導演台節點

ComfyUI 自訂節點 Motion Director 將 T2V、I2V、V2V 等多段生成整合到同一介面,支援分鏡重跑、跨鏡頭連貫與即時預覽,讓多片段 AI 影片製作不再被節點海淹沒。

MiniMax H3 Motion Director — Mixed Mode

用 ComfyUI 砌 AI 影片嘅朋友,多數都經歷過呢個困局:想做一個有五個鏡頭嘅項目,要由零開始接 T2V、I2V、V2V 各種 workflow,每段調好參數再串埋,節點一多就連自己都搞唔清邊段行緊、邊段要重做。Motion Director 想處理嘅就係呢個問題——佢係一個 ComfyUI 自訂節點,把多段影片生成收納到同一個 Director 介面,等你可以逐段揀唔同生成方法(T2V / I2V / FL2V / R2V / V2V / RV2V),又唔使為咗切換而重新拉整個圖。

佢同一般 ComfyUI 工作流最大嘅分別,係圍繞「項目」做設計。Director 介面入面有 Segment、Multi Segment、Final Result 三層檢視,亦有 Director Live Preview 即時顯示邊段行緊、邊段做完。跨段連貫靠 Motion Context、Context Frames、Latent Scale Lock 同生成音訊接續,仲可以將上一段已解碼嘅幀直接當下一段嘅 I2V/FL2V 輸入,避免每次都重新生成首幀。素材方面提供 Common References 同持久化 Material Library,圖、音、影片、提示詞都可以重複用。

另一個貼地嘅設計係 Selective Run——只要揀要重做嘅片段就得,唔使成條 pipeline 重跑,配合 MIXED 模式用,可以幾段文生、幾段圖生、幾段源影片剪輯混埋做項目。Director 本身係 OUTPUT_NODE,最尾嗰格就可以輸出畫面、音訊同 FPS 畀下游 ComfyUI 節點繼續接。後製方面內置 Global Refine、放大、可揀 NVIDIA RTX VSR / Deblur 同 Face Refine,不過 VSR/Deblur 要相容 NVIDIA VFX runtime,Face Refine 要 UI 揀好對應 detector/SAM 路徑。

適合要處理多鏡頭、有分鏡表、要保持視覺同音訊一致嘅創作者,例如廣告原型、MV 概念、敘事短片預覽,或者要把源影片做局部 V2V/RV2V 修補嘅後期流程。生成方面支援內建 sampling 或外部 ComfyUI SAMPLER + SIGMAS,方便想自己控制 noise schedule 嘅人。版本去到 v1.2.0,採用 GPL-3.0;硬件門檻就睇你揀嘅功能——基本生成跟返 ComfyUI 一般配置,想用 VSR/Deblur 或大尺寸放大就要 NVIDIA 顯卡同對應 runtime。

重點摘要:

  • 多段整合 Director 介面:T2V/I2V/FL2V/R2V/V2V/RV2V 同一畫面揀,逐段切換唔使重拉 workflow
  • Selective Run + Mixed Mode:只重跑指定片段,唔使成條 pipeline 由頭嚟
  • 跨鏡頭連貫:Motion Context、Context Frames、Latent Scale Lock 同音訊接續,仲可以重用上一段解碼幀
  • 內建 Live Preview 與三層檢視:Director 介面直接睇 Segment/Multi Segment/Final Result
  • 後製選項齊全:Global Refine、放大、可選 RTX VSR/Deblur 與 Face Refine,對硬件有特定要求

GitHub

Categories: 開源, ComfyUI, AI productions, NVIDIA, Video, 框架, , MiniMax

ComfyUI-CGlide:MiniMax H3 短片創作者的自訂節點

這是一套給 ComfyUI 用的 MiniMax H3 影片生成自訂節點,把提示詞拼裝、即時預覽、寫檔與續接四步壓成四個節點,特別適合用 H3 拍短片的人。

Repository image for CGlide/ComfyUI-CGlide

想做 H3 短片但不想在 ComfyUI 裡堆十幾個 loaders 同 text box 嘅人,可以留意 CGlide 嘅呢套自訂節點。佢將成個 H3 影片生成流程拆成四個節點:拼裝 prompt 同 conditioning、邊取樣邊預覽當下鏡頭、寫出影片檔,以及將續寫片段接返去原本嘅 clip。H3 Studio 更加將九張圖、三段影片、三段聲音同 prompt 全部塞入一個面板,但保留原本嘅 sampler 同步數,唔會插手推 sampling。

安裝好簡單,喺 ComfyUI Manager 搵 CGlide 或者 git clone 入 custom_nodes就得,不過官方提醒 ComfyUI 一定要更新,因為低 VRAM 嘅 w4a8 路徑要 0.31.0 或以上,否則會出黑畫面有聲冇畫,唔彈 error。模型要從 Comfy-Org 嘅 MiniMax H3 repo 拎,reference-to-video 或 first-last-frame checkpoint 入 diffusion_models,text encoder 入 text_encoders,影片同音訊 VAE 就擺去 vae。VRAM 唔夠嘅話可以用 Kijai 嘅 w4a8 版同 int8_convrot video VAE,大約 11.8 GB 就推到,原 workflow 唔使改。

H3 Studio: prompts, projects and clip extension for MiniMax H3

呢套節點嘅 chain 機制用 source_video 同 guide_frames 兩個輸出做接駁,比較啱做有連貫性嘅敘事短片,作者就用呢套工具完成咗 THE RECITATION。PyAV、torchaudio 同 ffmpeg 屬於依賴項目,PyAV 多數已經裝好,ffmpeg 放上 PATH 就夠,Glide Video 內部會 shell out 畀佢用。

對習慣 ComfyUI 節點工作流、又想用 H3 拍短片或敘事片段嘅創作者嚟講,呢套節點減少咗重複接線嘅時間,亦令低顯存方案更易落地。

重點摘要:
四節點設計:拼 prompt、即時預覽、寫檔、續接,分工清晰。
H3 Studio 整合面板:九圖三影片三音訊同 prompt 集中管理,但唔干預 sampling。
低 VRAM 路徑:w4a8 加 int8_convrot VAE 約 11.8 GB,但要 ComfyUI 0.31.0 以上。
chain 輸出:source_video 同 guide_frames 支援敘事鏡頭接駁。
作者實戰驗證:用同一套工具完成短片 THE RECITATION

GitHub

Categories: 開源, ComfyUI, AI productions, 模型, 多模態模型, Video, Audio, 提示詞, 工具, Content Creator, Clone, MiniMax

Atlas 世界模型一次處理文字、圖片、影片與 3D

World Labs 推出 Atlas,聲稱是目前首個原生同時處理文字、圖像、影片與 3D 的「omni」世界模型,能從一張相機路徑推算未見過的視角,並重建真實場景。

Og image

World Labs 公開了新一代世界模型 Atlas。它的特別之處在於從訓練階段就同時處理四種輸入——文字、圖像、影片、3D——並把它們整合到同一個空間脈絡裡,再以多模態自迴歸擴散 Transformer 推算下一個畫面。這意味著 Atlas 不只是「看得更多」,而是嘗試理解世界怎樣呈現、怎樣變化,並把想像中的場景渲染出來。

從使用場景來看,Atlas 主要涵蓋四類工作:相機控制生成、空間重建、空間時間模擬,以及純文字生圖與 360 度全景。其中相機控制生成支援 1 至 6 張輸入圖片,可輸出最高 1440p、最長約 1 分鐘的影片,並以像素級精度的相機幾何作為輸入,而不只是粗略的文字描述。

重建方面,Atlas 只需要 1 張到幾十張相片,就能還原真實場景並產出新視角的影像幀與明確的 3D 輸出。團隊指出,這項表現優於專門做 3D 重建的同類模型。空間時間模擬則可從影片重新取景,生成電影級視覺效果,並支援 Real-to-Sim 流程,供機器人規劃動作。

以下幾點值得留意:

  • 原生多模態:文字、圖片、影片、3D 一開始就共享同一空間脈絡,並非後期拼接。
  • 像素級相機控制:把精確相機幾何列為原生輸入,能逐格構圖、逐段運鏡。
  • 超越專用模型:3D 重建表現優於專門訓練的模型。
  • 支援 Real-to-Sim:能把真實影片轉成可模擬的世界,供機器人規劃。
  • 規模持續擴展:團隊表示表現會隨訓練算力提升,並預期這個趨勢會延續下去。

World Labs 表示,Atlas 將驅動他們自家 Marble 的未來版本及其他產品,現已開放早期使用的申請。

項目主頁

Categories: AI productions, 多模態模型, 世界模型, 模型訓練, API, Video, Image, 影像模型, Robotic, 3D

FastH3 Live:單張消費級 GPU 跑出無限 AI 直播

FastH3 Live 將 MiniMax-H3 蒸餾成 4 步模型,配合重定時與 ComfyUI 串流伺服器,用一張 RTX 5090 就能長開 448×448 18fps 嘅無限影片加音訊直播。

Hero image preview

喺消費級硬件上長開一段無止境嘅 AI 影片頻道,一直係文字轉視頻工作流嘅痛點——雲端成本高、本地生成速度慢,仲要面對提示詞同角色一致性嘅限制。FastH3 Live 就係圍繞呢個矛盾設計:佢將 MiniMax-H3 經過 4 步 DMD2 蒸餾成 FastH3,配合一套本地串流伺服器,令生成同播放可以同步進行,前一段影片播放期間,模型已經喺度產出下一段。

整個項目以 ComfyUI 作為運行環境,並喺單張 RTX 5090(32GB、Windows 11)上完成測試。v1.1.0 版本將解析度提升至 448×448、幀率達到 18fps,相比 v1.0.0 嘅 512×288 12fps 有明顯進步。音訊部分亦同步串流,用戶只要用 VLC 指向本地 URL,就可以一直接收新嘅短片,支援多位觀眾同時連線同斷線重連。

對於內容創作者、ComfyUI 用戶或者想試文字轉視頻嘅人來說,呢套工具最直接嘅吸引力係「無限直播」呢個使用場景。項目內附 321 個場景提示詞、503 個已驗證可用嘅角色清單,使用時可以快速組合出唔同長度嘅段落,唔需要每次由零開始寫 prompt。

需要注意嘅限制亦都幾清楚:相關權重屬於 MiniMax-H3 社群授權,適用範圍排除歐盟、英國、韓國同美國,下載前需要確認所在地。

項目主頁 · 數據集

Categories: 開源, ComfyUI, Agentic, 視頻模型, Video, Dataset 數據集, MiniMax

H3-World 讓鍵盤控制生成影片世界

H3-World把鍵盤輸入轉成可控制的未來畫面,展示互動式世界模型由理解指令走向操控環境。

Repository image for Danzer1xxxxChan/H3-World

按下 W、A、S、D 控制角色,或以 I、J、K、L 操控鏡頭,H3-World 便會由初始畫面生成相應的動作影片。這個項目屬於互動式世界模型,實際處理的是角色與鏡頭動作如何連貫地影響後續畫面,適合遊戲代理、視覺模擬及 Computer-use agents(CUAs)相關研究。

H3-World 建基於 MiniMax-H3,將每個鍵盤狀態轉換成對應未來 video latent 的語言指令,再透過 directed attention routing 把指令綁定到相應的 latent 區間。模型以 8,000 段 ABot-World-Explorer-500h gameplay clips 訓練,只學習 65.6M 個 Low-Rank Adaptation(LoRA)參數,約佔 33B backbone 的 0.199%,在保留大型模型能力與控制專用訓練成本之間取得折衷。

目前資料提供的重點包括:
– 角色控制使用 W、A、S、D;鏡頭控制使用 I、J、K、L,F 代表快速鏡頭移動。
– H3-World LoRA 是 MiniMax-H3 的 delta,不能直接套入未修改的 MiniMax-H3 pipeline。
– 推理需要約 135 GB 的 MiniMax-H3 base weights,以及 H3-World 的 directed-attention patch。
– 公開資料沒有列出明確的畫質、延遲或成功率比較,因此未能判斷它在不同世界模型之間的性能差距。

儲存庫提供 Python 3.10、CUDA 12.8、PyTorch 2.10.0 和指定版本 DiffSynth-Studio 的配置要求;模型權重及 LoRA checkpoint 則分別放在 Hugging Face 指定位置,訓練另需 ABot-World-Explorer-500h。研究團隊、遊戲代理開發者及需要可控影片生成的視覺模擬項目較容易受益,但硬件容量、專用 patch 和模型授權條款都是採用前必須核對的條件。

項目主頁 · GitHub · 模型

Categories: 開源, Agentic, AI productions, 多模態模型, 視頻模型, 模型訓練, NVIDIA, Video, Python, MiniMax

ComfyUI-OCIO:ComfyUI 直通 ACES 與 HDR 的色彩管理節點

由模型輸出到 ProRes、EXR 或 HDR 交付,ComfyUI-OCIO 保留更多影像色彩與亮度資訊。

OCIO Nodes for ComfyUI - by AI VFX NEWS, Slava Sexton

由 LTX、Flux 或其他影像流程產生的 HDR、Cineon 及 10-bit 影片,可以在 ComfyUI 原生 VIDEO wire 內完成色彩管理、ACES 調色及輸出。ComfyUI-OCIO 屬於 ComfyUI 自訂節點項目,處理的是模型解碼後容易被截斷、降位深或轉成 4:2:0 的影像資料。

核心差異在於 OCIO VAE Decode 以 float32 解碼,而且不會把數值夾到固定範圍;低於 0 的值亦會保留,讓超出工作色域的顏色和場景線性動態範圍交由 OpenColorIO 轉換。普通 SDR 生成不會因取消 clamp 自動變成 HDR,素材本身沒有相關範圍時,收益亦會有限。

LTX-2.5 可經由 ACEScct 路徑接入其 HDR path,補足 ComfyUI 原生流程未能直接觸及的部分。輸出可包括 32-bit float EXR、ProRes 4444 10-bit 4:4:4、DPX log,以及 Rec.2100 PQ/HLG;FFV1 才能做到無損保存,ProRes 讀回則以 12-bit 處理並承載 10-bit 資料。

ComfyUI-OCIO 提供的單一 LTX-2.5 測試中,模型浮點母片有 2304 個亮度級別,該項目的 ProRes 4444 版本保留 3520 個可辨識級別,與母片可辨識差異為 0.0001%;原生 10-bit 流程則為 882 級,出廠流程只有 220 級。安裝所需依賴包括 OpenColorIO、OpenCV、tifffile、Pillow、numpy 及 FFmpeg,但資料未提供完整圖形化操作步驟;較適合熟悉 ComfyUI、ACES 和影片編碼的 VFX、影片生成及後期團隊。

  • 保留 float32 解碼結果,不強制限制亮度範圍
  • 支援 ACES、HDR、Cineon、LTX、Flux 及 10-bit 影片流程
  • 可在原生 VIDEO graph 內讀取序列、調色及寫出影片
  • LTX-2.5 可經 ACEScct 進入其 HDR path
  • FFV1 適合無損保存,ProRes 4444 適合交付

GitHub

Categories: 開源, ComfyUI, AI productions, Video, LTX

[教學影片] Seedance 2.5 逼近寫實 AI 影片生成

Seedance 2.5 走向超寫實 AI 影片生成,重點放在畫面真實感同創作效率。這類工具適合想快速做出貼近真人拍攝效果嘅內容製作者。

Og image

Seedance 2.5 透過影片生成能力,主打把 AI 片段做得更貼近真實拍攝感,適合內容創作者、短片製作同需要快速試片嘅工作流。片段描述雖然唔多,但方向好清楚:重點唔係花巧效果,而係提升畫面可信度同整體觀感。

對一般創作者嚟講,呢類模型最有用之處係可以縮短由構思到成片嘅時間,尤其係要做概念片、廣告草稿、社交平台短片,或者先行測試視覺風格嘅時候。它強調 ultra realistic,代表畫面一致性、材質細節同動態自然度會係主要賣點。

不過,原始資料只提到示範與推廣用途,未有交代訓練細節、評測指標、輸入限制或實際可否隨意下載使用,所以唔適合自行推斷佢嘅開放程度。現階段較合理嘅理解係:Seedance 2.5 係一個面向高寫實影片生成嘅模型/服務,重點在於實用視覺效果,而唔係提供完整技術規格。

  • 主打超寫實 AI 影片生成
  • 適合短片、概念片同視覺草稿
  • 核心價值係提升真實感同創作效率
  • 原始資料未交代下載、開放程度同技術細節
  • 內容明確偏向影片模型與線上服務場景

項目主頁

Categories: Video, 提示詞, 教學

Lucida:用「解析、生成、放置」三步把實景變成可編輯的模擬場景

字節跳動 Seed 團隊把真實室內環境拆解成獨立物件資產,透過閉環姿態修正讓重建結果能直接用於模擬。

Og image

從一段真實拍攝的室內影片,要還原成可以模擬、可逐個編輯嘅場景,一直都係 3D 重建嘅痛點:擺位、遮擋同殘缺幾何往往令資產難以重用。Lucida 就係針對呢個矛盾提出嘅方案,屬於實景到模擬(real-to-sim)類嘅場景建模系統。

整個流程分成三步。第一步 Parse 揀選有用嘅關鍵幀,跨視角對應實例並建立場景圖,輸出遮擋、局部點雲同參考視圖等證據。第二步 Generate 利用每組證據合成無遮擋嘅物件影像,再提升成完整、可編輯嘅 3D 資產。第三步 Place 先粗略初始化,再用 GizmoAct 喺閉環中反覆執行姿態編輯,直到渲染結果同觀察對齊。

GizmoAct 係呢套系統嘅核心控制器,由視覺語言模型(VLM)操作 3D 編輯器,每一步根據渲染觀察、點雲疊加同正交視圖等線索,落一個可執行嘅姿態修正。同一條策略可應付由 Boxer、Any6D* 到 SAM 3D 等不同初始化,並以最多 4 個視圖同 12 步修正完成對齊。

Lucida 喺 R2S、CA-1M 同 Aria Digital Twin 數據集上都提升咗場景級 3D 物件檢測、姿態估計同完整場景重建指標。重建出嚟嘅場景以一組獨立、可編輯嘅 mesh 呈現,每件物件都準備好進入模擬階段。

對從事機器人模擬、室內數據合成或場景理解嘅團隊,呢套閉環做法比起傳統單次擬合更能容忍幾何誤差同遮擋問題,令實景資產更易直接落落去模擬器使用。

重點摘要

  • 三步流程:Parse、Generate、Place 把實景拆解成可重用物件資產
  • GizmoAct 閉環修正:VLM 操作 3D 編輯器,反覆落姿態編輯直到對齊
  • 初始化容忍度高:同一策略兼容 Boxer、Any6D*、SAM 3D 等不同起點
  • 輸出可直接模擬:每件物件係獨立、可編輯 mesh
  • 多數據集提升:喺 R2S、CA-1M、Aria Digital Twin 都有指標改進

項目主頁

Categories: 北京大學, 字節跳動, 視覺模型, Video, Image, 3D

Page 4 of 21
1 2 3 4 5 6 21