DanceOPD:多能力影像生成的場景蒸餾框架

DanceOPD 提出 on-policy 生成場景蒸餾方法,將不同影像能力整合到單一模型,同時保持 T2I 與編輯表現。

ByteDance Seed

DanceOPD 是一個針對 flow-matching 模型設計的 on-policy 生成場景蒸餾框架,目標是讓單一影像生成模型同時具備文字生成影像(T2I)、局部編輯與全域編輯等多種能力。核心做法是將每個來源能力視為一個速度場(velocity field),然後在學生模型自己產生的 on-policy 狀態上查詢這個場景,再以簡單的速度 MSE 損失進行訓練。

這套方法最值得留意的差異在於 hard-routed 設計:每個樣本只被路由到一個被選中的能力場,並且只查詢一個低噪聲的語義側狀態(semantic query),避免了對多個來源場景做平均而模糊語義身份的問題。同一套框架也能吸收 operator-defined fields,例如 classifier-free guidance,讓引導機制自然融入訓練。

在評估方面,DanceOPD 報告了多項指標,包含 GEditBench-avg 在 T2I + Edit Composition 上達到 5.347、GenEval Overall 達到 0.849 同時保持 T2I 表現,以及 Local + Global Edit Composition 的 5.498、CFG 吸收診斷中 5.833 的最佳值。

這項工作適合關注多能力影像生成整合、蒸餾方法以及 flow-matching 模型研究的開發者與研究者。由於 Code 標示為「Soon」,目前尚未提供源碼或模型下載,因此暫無可對應的安裝或使用步驟可分享。

主要重點:

  • 核心定位:flow-matching 模型的 on-policy 生成場景蒸餾框架
  • 方法差異:hard routing 單一能力場景加單一低噪聲語義查詢,避免場景平均造成的語義模糊
  • 支援能力:T2I、局部編輯、全域編輯,並能吸收 classifier-free guidance 等 operator-defined fields
  • 評估數字:GenEval 0.849、GEditBench T2I+Edit 5.347、Local+Global 5.498
  • 現有狀態:論文可在 arXiv 瀏覽,原始碼尚未公開

項目主頁: https://danceopd.github.io/

Paper: https://arxiv.org/pdf/2606.27377

Categories: 開源, 字節跳動, 模型, 模型訓練, Image, 影像模型, txt2img, 框架, 教學, Content Creator, 深度學習

DomainShuttle 開源:把主角穿梭到任何風格的影片

香港科技大學 C4G 團隊發表 DomainShuttle,以 14B 參數規模實作跨域主體一致性影片生成,並釋出權重與推理代碼。

teaser

DomainShuttle 是一個以 Wan2.2-T2V-A14B 為基底的 subject-driven text-to-video(主體驅動文字轉影片)框架,目標是讓用戶提供一張參考圖後,能在不同視覺風格與場景中維持同一角色的身份一致性。過去的 subject-driven 方法多在 in-domain(與訓練資料同域)下能保留主體細節,但一旦跨域到風格差異大的場景,主體往往走樣或失去身份特徵;DomainShuttle 把參考特徵與影片特徵解耦,並引入 domain attribute 建模與 intrinsic subject representation,試圖兼顧 in-domain fidelity 與 cross-domain editability。

開發團隊來自香港科技大學 C4G 實驗室,作者群包括 Nan Chen、Yiyang Cai、Rongchang Xie、Junwen Pan、Cheng Chen、Weinan Jia、Zhuowei Chen、Wen Zhou(項目負責人)、Zhenbang Sun 以及通訊作者 Wenhan Luo。等貢獻作者共同發表技術報告,並同時釋出 14B 規模的非官方權重與推理代碼。

先以 conda 建立 Python 3.10 環境並安裝 PyTorch 2.5.1(CUDA 12.4),接著執行 build_env_conda.sh。模型準備分兩步:先用 huggingface-cli 下載 Wan-AI 的 Wan2.2-T2V-A14B 作為基底模型,再下載 CNcreator0331/DomainShuttle_weight,最後將 VAE、configuration.json 等檔案移入指定的 ./models/Diffusion_Transformers/Wan2.2-DomainShuttle-A14B/ 目錄。原始資料未提供完整推論指令片段,相關細節需參考技術報告與項目頁面的後續說明。

從示範結果看,DomainShuttle 能在寫實人物、動漫風、Ghibli 風、3D 動畫風等不同域之間切換,同時保留臉部與服飾特徵,跨域 personalisation 效果明顯。適合短片創作、角色 IP 化、廣告分鏡與動畫預覽等需要「同一角色穿梭多場景」的團隊。需注意目前釋出的是非官方實作,且依賴 14B 規模的基座模型,部署對顯存要求較高。

重點摘要:

  • 類型:subject-driven text-to-video 框架,建基於 Wan2.2-T2V-A14B
  • 開發團隊:香港科技大學 C4G 實驗室,Wen Luo 為通訊作者
  • 核心設計:解耦參考與影片特徵、加入 domain attribute 與 intrinsic subject representation
  • 與同類差異:強調 cross-domain editability,補足過往方法跨域走樣的缺陷
  • 資源:已釋出 14B 權重、技術報告與推理代碼,需 CUDA 12.4 環境

GitHub: https://github.com/HKUST-C4G/DomainShuttle

項目主頁: https://cn-makers.github.io/DomainShuttle/

模型: https://huggingface.co/CNcreator0331/DomainShuttle_weight

Categories: 開源, 香港科技大學, 模型, 視覺模型, 視頻模型, NVIDIA, Stable Diffusion, Video, 框架, 香港, Content Creator, IDE, 3D, Python NLP, Python, 動畫

HyperFrame 配合 Claude Code 製作 Vox 風格影片

這段影片展示用 AI 工具整理敘事影片流程。重點在於把腳本、視覺與製作步驟串連起來。

Og image

現有資料主要來自 YouTube 標題與簡短描述,資訊不算完整,但仍可看出內容圍繞 HyperFrame 與 Claude Code 兩個工具,示範如何做出接近 Vox 風格的解說影片。讀者可先把它理解為一個 AI 輔助影片製作項目:由工具協助處理腳本、畫面規劃或製作流程,而不只是單一步驟生成。

這類項目想處理的問題,很可能是把資料整理、敘事結構、畫面設計與影片產出連成一條工作流。相比只用單一影片生成模型,這種做法更接近內容製作流程本身,重點不只是「出片」,而是如何把想法變成有節奏、有資訊層次的短片。

從標題判斷,Claude Code 可能負責文字、結構或流程協調,HyperFrame 則可能用於畫面或影片製作環節。不過頁面未提供更詳細技術內容、模型名稱或量化結果,因此未能確認兩者各自負責的步驟,也不能判斷成品質素是否穩定。

可先留意幾個重點:
– 這是一個偏向工作流整合的影片製作項目
– 目標風格是資訊密度較高的 Vox 式解說內容
– 適合內容創作者、營銷製作與短片腳本規劃
– 現有頁面缺少性能數據、成本與時間比較

如果想進一步測試,較可行的方法是先觀看原片,記錄它如何拆分腳本、旁白、畫面節奏與素材安排,再用同類工具重建其中一小段。以目前資料來看,這項內容較適合作為工作流觀察,而不是完整教學或技術評測。

項目主頁: https://www.youtube.com/watch?v=XVsGK99E9FA

Categories: AI productions, Video, Vibe Coding, 教學, 工具, Content Creator, 編程, Anthropic

FreeStyle:用社群 LoRA 做雙參考生圖

FreeStyle 不只放出資料,亦重整了雙參考生圖的訓練與評測方法。它的焦點是減少風格參考偷帶內容,同時保住畫風。

FreeStyle teaser

現時不少 style-reference 生成,只處理單一風格參考;至於 content + style dual-reference,常見難位是資料難整、風格長尾不足,兼且 style reference 容易把人物、物件等內容一併「滲」入結果。FreeStyle 把社群 LoRA 視為風格或內容概念的聚類中心,再配合自動生成與過濾流程,重組出可訓練的雙參考資料,連 benchmark 一起補上。

這不是單純模型,而是一個結合資料管線、benchmark 與 DiT-based model 的影像生成項目,目標是解決 SRef 與 CRef+SRef 兩類任務中,內容保持、風格對齊與 leakage suppression 很難同時兼顧的問題。文中提出 attention-level constraint,以及 RoPE low-frequency modulation,核心取向很清楚:寧可多做約束,也要壓住 style-reference content leakage。

資料規模是 FreeStyle 最有份量的部分。CRef+SRef dataset 提供 480K sequences,涵蓋 1,704 種 styles;SRef dataset 則有 619,302 sequences、622 種 styles。評測亦不只看靚唔靚,還加入 CSD、OneIG、DINOv2、CAS、CLIP-T、aesthetic predictors 及 VLM-as-judge,將 style similarity、content preservation、instruction following 同 leakage rejection 分開量度。

想理解怎樣測試這個項目,較合理的做法是分三層看:先用公開 dataset 與 benchmark 檢查資料結構;再看 repo 提供的 LoRA metadata 與 ComfyUI workflows,理解 triplet 怎樣生成與驗證;最後才研究 checkpoint 表現。它較適合研究團隊、做可控生圖的產品組,或者本身已在用 FLUX、Qwen、Illustrious 生態的人。

  • 把 Civitai、TensorArt、Liblib 的社群 LoRA 變成可用訓練訊號
  • 同時覆蓋 SRef 與 CRef+SRef,而非只做單一風格參考
  • 重點不是單純追求風格像,而是壓低內容洩漏
  • 提供 dataset、benchmark、workflow、checkpoint,便於重現整個流程

相關模型與基礎生態包括 DiT-based model、FLUX、Illustrious、Qwen,以及資料生成用的 ComfyUI workflow。若你關心的是商用穩定性,仍要留意它相當依賴社群 LoRA 品質與過濾流程;作者亦有講明,原始 LoRA 權重本身未必會隨項目再分發。

GitHub: https://github.com/Blue2Giant/FreeStyle

項目: https://blue2giant.github.io/FreeStyle/

Categories: 開源, 阿里巴巴, ComfyUI, 模型, 視覺模型, 多模態模型, 模型訓練, Qwen, Stable Diffusion, Image, 影像模型, 影像處理, 工具, Content Creator, Sora, Meta, Dataset 數據集

ARGAR 直指 AI 審稿可被包裝操控

ARGAR研究一個敏感問題:論文內容不變,只改寫法,AI審稿會否被帶風向。這個項目把問題做成可重複測試的實驗框架。

ARGAR

現時不少 AI reviewer 評測,默認接受論文的摘要、敘事結構與貢獻陳述,並直接輸出分數或意見;ARGAR 指出這種固定範式未必真正在看科學內容,而可能被 presentation-level content 牽動。作者因此提出 ARGAR(Adversarial Repackaging Gaming AI Review),用 adversarial repackaging 把「內容不變、包裝改寫」變成可反覆驗證的測試流程。

這個項目較像一個研究框架加實驗工具,而不只是單一資料集;它要解決的,是 AI reviewer 有沒有被 narrative structure、abstract 與 contribution statements 系統性影響。核心做法是 closed-loop iterative search:每一輪根據 AI reviewer feedback 改 LaTeX 文字與結構,再比較新版與 baseline 的審稿結果,但 scientific content held fixed。

若想測試它的思路,最合適是先看 round N/source、round N/reviews、judge result.json 和 attack log.json。這樣可以直接觀察同一篇論文在科學內容不變下,經過不同包裝後,AI review 怎樣波動,也能看清每一輪修改決策如何形成。

  • 類型定位:研究框架兼工具,用來檢驗 AI reviewer 是否容易被論文包裝影響
  • 方法重點:只改 abstract、framing、contribution statements、narrative structure,不改 scientific content
  • 輸出結構:保留每輪 LaTeX source、review 結果、pairwise judge 比較與跨輪 attack log
  • 適合場景:AI safety、LLM evaluation、學術審稿自動化研究
  • 限制提醒:項目明確反對把結果用於真實投稿操控,定位是 controlled experiments

創新之處在於它不是討論「AI 審稿準不準」的籠統問題,而是把舊範式拆開,專門測 presentation attack 對評分的影響。從儲存庫資料看,這種設計也方便研究者重播整個攻擊過程,比只看最終分數更有分析價值。

性能數字在這份儲存庫摘要未完整展開,因此不宜代作者下結論;不過評測設計本身已很有辨識度,因為它加入 pairwise judge 與多輪 review 作比較。相關模型方面,項目透過 LiteLLM 路由不同 LLM provider,可接 OpenAI、Anthropic、AWS Bedrock 等 reviewer model、attack model 與 judge model,亦配合 ICLR、NeurIPS、ICML 風格的 review generation。

GitHub: https://github.com/xyimatvoid/ARGAR

Paper: https://arxiv.org/pdf/2606.09813

Categories: 開源, 清華大學, Agentic, AI productions, 模型, OpenAI, 框架, 工具, Content Creator, IDE, , 安全, Anthropic, AGI, Dataset 數據集

RhymeFlow:加快影片生成的新路線

RhymeFlow 針對影片生成太慢的老問題,提出免訓練加速方法。它不只追求更快,亦嘗試保住畫面連貫度。

Repository image for Simon-Dcs/RhymeFlow

現時不少影片生成加速方法,主要仍沿用標準 diffusion pipeline:每一幀都要在所有 diffusion timesteps 完整做一次 dense denoising,再配合 sparse attention 或 KV-caching 減少單步計算。RhymeFlow 指出,這種固定範式忽略了相鄰影格內容與動作高度相關,令自然影片裡大量中間步驟其實屬於重複運算。

這是一個免訓練的影片生成加速框架,核心目標是替 DiT(Diffusion Transformers)影片模型減少推理延遲與運算成本。它將不同影格的 denoising trajectory 拆開處理:先找出主導語意變化的 keyframes,讓 keyframes 保持逐步去噪,非 keyframes 則逐步跳過部分步驟,再用 latent trajectory projection 補回時間一致性。

這個做法的創新,不在於單純把 attention 再稀疏化,而是直接挑戰「所有影格都要同步、密集去噪」的舊假設。論文描述,RhymeFlow 在現有 DiT-based video generation models 上,能同時取得更高 inference speed 與更好 visual quality;不過 GitHub 目前公開重點放在 Wan 2.1 adaptation,HunyuanVideo adaptation 仍在準備中。

如果你想試,較合理的切入點是把它當成 Wan 2.1 的加速實驗框架,比較 dense、svg、sap、rhyme、rhyme_sap 幾種方法輸出時間與畫面差異。環境要求偏高,文件列出 CUDA 12.4 / 12.8 與 PyTorch 2.5.1 / 2.6.0,亦牽涉 FlashInfer、flash-attn 和自訂 kernels,較適合已有 GPU 與 PyTorch 經驗的人。

  • 項目類型:training-free 影片生成加速框架,處理 DiT 影片模型推理太慢的問題
  • 方法重點:keyframes 做 dense denoising,非 keyframes 跳步處理,再用 latent trajectory projection 維持時序一致
  • 可比較方法:dense、svg、sap、rhyme、rhyme_sap
  • 相關模型:Wan 2.1 已有 adaptation,HunyuanVideo adaptation 尚未完整釋出
  • 適合場景:研究影片生成推理優化、比較不同加速策略、測試速度與畫質取捨

整體來看,RhymeFlow 的價值很明確:它不是改模型權重,也不是重新訓練,而是重排 denoising flow scheduling,從流程層面節省計算。對研究者與進階開發者而言,這類思路比單純堆硬件更有參考價值;對一般創作者來說,現階段門檻仍在部署與 GPU 環境。

GitHub: https://github.com/Simon-Dcs/RhymeFlow

Paper: https://arxiv.org/pdf/2606.06309

Categories: 開源, 清華大學, 騰訊, AI productions, 視頻模型, 模型訓練, NVIDIA, Video, 框架, Content Creator, Python, 深度學習

WordPress Jetpack AI (網站內容生成)

https://jetpack.com/ Jetpack Social 而家可以自動將你嘅 WordPress 內容分享到 Instagram、Mastodon、Facebook、LinkedIn同Tumblr! Jetpack Social 提供咗便利嘅功能,可以喺你發佈新文章時,自動將該內容同步到多個社交媒體平台上。依家你唔駛一一登入每個平台嚟分享你嘅內容,節省咗寶貴嘅時間同精力。 經過 Jetpack Social 嘅設置,你可以輕鬆選擇你想同步分享嘅社交媒體平台。唔論你係想喺 Instagram 上分享靚相,定係喺 Facebook、LinkedIn同Tumblr 上分享嘅文章,Jetpack Social都可以幫到你。只需一次性嘅設置,之後你嘅內容會喺發佈時自動同步分享到所選嘅平台上。 Jetpack Social 唔止可以自動同步分享內容,亦都可以同步噏互動。如果你係一個網站管理員,Jetpack Social 可以幫助你喺多個社交媒體平台上回覆留言、讚好、分享和關注。呢個可以增加你同社區嘅互動,並提高你嘅網站嘅曝光度。 使用 Jetpack Social 係非常容易嘅,只需要安裝同啟用 Jetpack 插件,然後去 Jetpack 設定頁面設置社交媒體帳號同步。之後,你就可以享受自動分享到各社交媒體。 WordPress Jetpack AI 是一個由 Automattic 開發的 WordPress 擴充套件,提供強大的人工智能功能。它可以在 WordPress 網站中實現自動化內容生成和修改的能力。Jetpack AI 可以通過內置的AI助手,根據用戶的要求生成和修改內容,並提供豐富的工具和功能來增強網站的運營效果。 Jetpack AI 的功能非常多樣化,可以用於自動生成部落格文章、提供內容建議和優化、修稿和校對文本、編寫 SEO 優化的摘要和元描述等。它還能夠分析網站數據,提供關於訪問量和用戶行為的洞察,從而幫助用戶改進和優化網站內容。 使用 Jetpack AI 非常簡單,只需要在 WordPress 網站中安裝和啟用 […]

https://jetpack.com/

Jetpack Social 而家可以自動將你嘅 WordPress 內容分享到 Instagram、Mastodon、Facebook、LinkedIn同Tumblr! Jetpack Social 提供咗便利嘅功能,可以喺你發佈新文章時,自動將該內容同步到多個社交媒體平台上。依家你唔駛一一登入每個平台嚟分享你嘅內容,節省咗寶貴嘅時間同精力。

經過 Jetpack Social 嘅設置,你可以輕鬆選擇你想同步分享嘅社交媒體平台。唔論你係想喺 Instagram 上分享靚相,定係喺 Facebook、LinkedIn同Tumblr 上分享嘅文章,Jetpack Social都可以幫到你。只需一次性嘅設置,之後你嘅內容會喺發佈時自動同步分享到所選嘅平台上。

Jetpack Social 唔止可以自動同步分享內容,亦都可以同步噏互動。如果你係一個網站管理員,Jetpack Social 可以幫助你喺多個社交媒體平台上回覆留言、讚好、分享和關注。呢個可以增加你同社區嘅互動,並提高你嘅網站嘅曝光度。

使用 Jetpack Social 係非常容易嘅,只需要安裝同啟用 Jetpack 插件,然後去 Jetpack 設定頁面設置社交媒體帳號同步。之後,你就可以享受自動分享到各社交媒體。

WordPress Jetpack AI 是一個由 Automattic 開發的 WordPress 擴充套件,提供強大的人工智能功能。它可以在 WordPress 網站中實現自動化內容生成和修改的能力。Jetpack AI 可以通過內置的AI助手,根據用戶的要求生成和修改內容,並提供豐富的工具和功能來增強網站的運營效果。

Jetpack AI 的功能非常多樣化,可以用於自動生成部落格文章、提供內容建議和優化、修稿和校對文本、編寫 SEO 優化的摘要和元描述等。它還能夠分析網站數據,提供關於訪問量和用戶行為的洞察,從而幫助用戶改進和優化網站內容。

使用 Jetpack AI 非常簡單,只需要在 WordPress 網站中安裝和啟用 Jetpack 擴充套件,然後在內容編輯器中添加 Jetpack AI 區塊,即可開始使用相關的功能。Jetpack AI 的使用使得網站內容的生成和修改更加高效和準確,同時還能夠節省用戶的時間和精力。

如何使用 Jetpack AI

Jetpack AI 是一個強大的人工智能助手,可以幫助您編寫內容、翻譯文字、生成摘要,以及提供自動修改和建議等功能。以下是使用 Jetpack AI 的幾個步驟:

  1. 安裝 Jetpack AI:首先,確保您已在 WordPress 上安裝並啟用 Jetpack 插件。然後,訪問您的 WordPress 網站後台,點選「Jetpack」並點擊「設定」。
  2. 設定語言:在 Jetpack 設定頁面上,您可以設定 Jetpack AI 的語言。請選擇 “繁體廣東話” 以開始使用這種語言的功能。
  3. 使用 AI 功能:Jetpack AI 集成在 WordPress 編輯器中,您可以在撰寫文章或頁面時使用它。在您的 WordPress 編輯器中,點擊「添加區塊」按鈕,然後在搜索欄中輸入 “Jetpack AI”。選擇該區塊後,您將看到 Jetpack AI 的界面。
  4. 提出請求:在 Jetpack AI 的界面上,您可以輸入您的請求或內容需求。請按下「執行」按鈕,Jetpack AI 將根據您的要求生成相應的內容。
  5. 獲取結果:Jetpack AI 會在右側面板中顯示生成的內容,您可以自由修改或使用該內容。同時,您也

* 對唔住,我講到一半無意識地用左普通話,我喺廣東話再繼續介紹多少少。(Jetpack AI)

  1. 獲取結果:Jetpack AI會喺右邊嘅欄度顯示生成嘅內容。你可以將呢個生成嘅內容直接插入你嘅文章或者頁面中,或者根據需要修改同調整。

Jetpack AI 非常強大,可以幫助你節省時間同改善你嘅內容。希望呢個簡單嘅介紹可以幫到你!如果你有任何問題,歡迎隨時向我提問。

如果您想要提高網站內容的質量和效率,我們強烈推薦您使用 WordPress Jetpack AI。詳細了解 Jetpack AI,請訪問https://jetpack.com/

Categories: Content Creator, 線上服務

Page 2 of 2
1 2