示範範例: https://SWivid.github.io/F5-TTS
GitHub - fudan-generative-vision/hallo2: Hallo2: Long-Duration and High-Resolution Audio-driven Portrait Image Animation Hallo2: Long-Duration and High-Resolution Audio-driven Portrait Image Animation - fudan-generative-vision/hallo2
GitHub - LituRout/RF-Inversion: Rectified Flow Inversion (RF-Inversion) (附 ComfyUI Node)Rectified Flow Inversion (RF-Inversion). Contribute to LituRout/RF-Inversion development by creating an account on GitHub.
構成了一種以安全且樣本高效的方式訓練強化學習 💎
超強AI擴圖!完全免費開源,diffusers-image-outpaint,附詳細本地安裝教程!- Diffusers Image Outpaint 是一種基於擴散模型的圖像生成方法。它根據現有圖像內容,生成圖像以外區域,使圖像看起來更自然和完整。
DiffSynth Studio 是個擴散引擎 重構了文字編碼器、UNet、VAE等架構,保持與開源社群模型的相容性,同時增強運算效能。
透過免持語音互動、語音中斷、Live2D 臉部辨識和跨平臺本地運行的長期記憶與任何 LLM 交談 LLM 推理後端、語音辨識和語音合成器均設計為可交換。此專案可以配置為在 macOS、Linux 和 Windows 上離線運行。也支援線上 LLM/ASR/TTS 選項。
GitHub - THUDM/CogVideo: Text-to-video generation: CogVideoX (2024) and CogVideo (ICLR 2023) Text-to-video generation: CogVideoX (2024) and CogVideo (ICLR 2023) - THUDM/CogVideo
本影片介紹如何使用開源模型執行 GraphRAG – Llama 3.1 和 Neo4j 作為圖形資料庫
本影片介紹如何使用開源模型執行 GraphRAG – Llama 3.1 和 Neo4j 作為圖形資料庫
一鍵進階ComfyUI 目前使用 Stable Diffusion 進行創作的工具主要有兩個:WebUI 和 ComfyUI。



