
想從影片另一個鏡頭角度觀看同一場景,這個 LoRA 可直接處理方位角(azimuth)及仰角(elevation)偏移。它基於 MiniMaxAI/MiniMax-H3 微調,屬於 Ref2VA 影片生成用途,並非獨立的完整模型。
模型會同時讀取兩段影片:經過 CrossView Warp 的深度變形片段負責提供場景幾何,原始片段則保留人物身份與外觀。深度資訊由 MoGe Inference 產生,再交給 ComfyUI-CrossViewWarp 節點處理;生成結果對未被原片覆蓋的區域仍需要提示詞引導,因此新視角越大,畫面補全的不確定性亦可能增加。
使用流程集中於 ComfyUI:安裝 CrossViewWarp node,先取得 MoGe 幾何資料,再把 warp 與 source 調整至相同尺寸;載入 MiniMax-H3_Ref2VA-LoRA-CrossView-Warp_v1_3500.safetensors 到 ref2va checkpoint,並以 MiniMax H3 Add Guide 和 MiniMax H3 Reference To Video 串接,frame_idx 設為 0。LoRA strength 建議由 0.8 開始,頁面建議範圍為 0.8 至 1.0,觸發詞是 crossview。
- 已確認的基礎模型:
MiniMaxAI/MiniMax-H3 - 主要檔案:
MiniMax-H3_Ref2VA-LoRA-CrossView-Warp_v1_3500.safetensors - 頁面未列出 GGUF 檔案、量化級別、mmproj、檔案大小或量化建議,因此不能推斷 Q4_K_M 等本地推理配置
- 頁面只明確提供 ComfyUI 工作流程,未確認 llama.cpp、Ollama、LM Studio、MTP draft speculation 或效能基準支援
它把 CrossView-Warp 概念移植到 MiniMax-H3,核心價值在於以幾何變形和原片外觀互補,協助影片生成模型維持場景連貫性。頁面提供多個 compare_* 影片作為 warp、原片與結果的並排示例;授權則標示為 minimax-h3-community-license。