MS-Vid2Vid (Video-to-Video)高清視頻生成大模型

「MS- Video-to-Video」係一種深度學習模型,可以將一段視頻轉換成另一種風格、場景轉換、動作等操作。例如,可以將一段日本動畫轉換成中國水墨畫風格,或者將一段街頭表演轉換成動畫風格。

MS-Vid2Vid-XL 和 Video-to-Video 第一階段相同,都是基於隱空間的視頻擴散模型(VLDM),且其共享相同結構的時空UNet(ST-UNet),其設計細節延續我們自研 VideoComposer,具體可以參考其技術報告。

Categories: Video, 工具, 新聞

LM Studio 0.3.13

使用本地 LLM(Large Language Model) 的主要原因之一是隱私,LM Studio 就是為此而設計的。 LM Studio 不會收集數據,也不監視您的行為。

Categories: 軟件, 工具

Krita-ai-diffusion 實時 A.I. 生成式人工智慧繪圖

互動式工作流程,其中人工智慧生成僅用作繪畫時的一種協同工具。

  • Inpaint:使用 Krita 的選擇工具標記區域並刪除或取代影像中的現有內容。簡單的文字提示可用於指導生成。
  • Outpaint:擴展畫布,選擇空白區域並自動填入與現有影像無縫融合的內容。
  • 生成:透過用文字或現有圖像描述它們,從頭開始創建新圖像。支援SD1.5和SDXL。
  • 優化:使用強度滑桿優化現有影像內容,而不是完全取代它。這也非常適合透過繪製(粗略)近似值並以高強度進行細化來為影像添加新內容!
  • 即時繪畫:讓人工智慧即時解讀您的畫布以獲得即時回饋。影片
  • 控制:直接使用草圖或線條藝術指導圖像創建。使用現有影像或 3D 場景的深度或法線貼圖。從快照傳送角色姿勢。使用分割圖控制構圖。
  • 決議:在任何決議下都能有效率地工作。該插件將自動使用適合 AI 模型的分辨率,並縮放它們以適合您的圖像區域。
  • 升級:將影像升級並豐富至 4k、8k 以上,而不會耗盡記憶體。
  • 作業佇列:根據硬體的不同,影像產生可能需要一些時間。該插件允許您在處理圖像時排隊和取消作業。
  • 歷史:並非每張圖像都會成為傑作。隨時預覽結果並瀏覽前幾代和提示。
  • 強大的預設設定:多功能的預設樣式預設允許簡單的 UI 覆蓋許多場景。
  • 自訂:建立您自己的預設 – 選擇穩定擴散檢查點、新增 LoRA、調整取樣器等。

[英文] 詳細教學:

This One Simple Plugin Adds Realtime AI Assistance to Krita

Categories: Image, 軟件, 工具, 教學

Prompt for : Image


Categories: 工具


LLaVA 大型多模態模型

威斯康星 – 麥迪遜大學,微軟研究院,哥倫比亞大學的一群研究者發佈了LLaVA多模態大模型。LLaVA是一種新穎的端到端訓練的大型多模態模型,結合了視覺編碼器和Vicuna對於通用的視覺和語言理解, 實現令人印象深刻的聊天功能。

作者提供測試版 Demo,你可直接用手機測試。

(more…)
Categories: 軟件, 工具, 線上服務

T2I-Adapter – 類似 ControlNet 的可控性模型

T2I-Adapter

兼容 Stable Diffusion 1.6 及 XL 版。支援 T2I(Text-to-Image)、草圖、canny、線稿圖、深度圖以及 OpenPose 骨骼圖 …

T2I-Adapter 由騰訊 ARC 團隊開發,並於 2023 年 3 月在 GitHub 上開源。T2I-Adapter 是一個基於深度學習的模型,可以將文字轉換為圖像,同時保持一定的可控性。

T2I-Adapter 的工作原理是使用一個生成式對抗網路 (GAN) 來生成圖像。GAN 由兩個模型組成:一個生成器和一個判別器。生成器負責生成圖像,判別器負責判斷圖像是真是假。

T2I-Adapter 在一個包含大量文字和圖像的數據集上訓練。訓練過程中,生成器學習生成與文字描述相匹配的圖像。判別器學習區分真實圖像和生成圖像。

T2I-Adapter 可以生成各種圖像,包括風景、人物、物體等。它還可以生成具有特定風格的圖像,例如卡通、油畫等。

T2I-Adapter 的開發團隊由以下人組成:

  • 劉宇軒,騰訊 ARC 團隊的工程師
  • 劉洋,騰訊 ARC 團隊的工程師
  • 王鑫,騰訊 ARC 團隊的工程師
  • 王子航,騰訊 ARC 團隊的工程師
  • 張立峰,騰訊 ARC 團隊的主管

T2I-Adapter 是一個強大的工具,可用於各種創意應用,例如圖像生成、藝術創作等。

Categories: Stable Diffusion, 軟件, 工具

Wav2Lip (Lipsync 工具)

ChatGPT, Bard, Claude2 比較

[ACM Multimedia, 2020] Wav2Lip: Accurately Lip-syncing Videos In The Wild
Wav2Lip 簡介(英文)

Open In Colab

我從三個不同的 A.I. 平台嘗試找更多關於 Wav2Lip 的資料時出現如下的情況:

(more…)
Categories: 軟件, 工具

CapCut 全能 A.I. 創意平台

CapCut 是一個由人工智慧驅動的全能創意平台,提供視頻編輯和圖像設計功能。無論你是使用瀏覽器、Windows、Mac、Android 還是 iOS,都可以在 CapCut 上進行優質的視頻剪輯和圖像設計。不論你是想在社交媒體上製作精美視頻,還是需要設計專業的圖像作品,CapCut 都可以滿足你的需求。它的智慧 AI 技術讓創作變得更加簡單和有趣,讓你能夠輕鬆地添加特效、滤鏡、字幕等,製作出令人驚艷的視覺效果。無論你是專業的影像創作者還是想體驗一下創作的樂趣,CapCut 都是你的不二選擇。儘管只需要幾個簡單的步驟,CapCut 將幫助你打造出令人難以置信的作品!現在就開始使用 CapCut,展示你的創造力吧!

CapCut 的母公司是字節跳動,一家全球領先的科技公司。字節跳動成立於2012年,總部位於中國北京,並在全球各地擁有多個辦事處和研發中心。字節跳動以創新的技術和產品聞名,致力於為全球用戶提供豐富多樣的數字內容和娛樂體驗。

作為字節跳動的子品牌,CapCut 是其在全能創意平台領域的重要產品之一。CapCut 以其強大的人工智慧技術和精緻的設計工具著稱,為用戶提供了優質的視頻編輯和圖像設計功能。公司在數字內容創作和社交媒體領域擁有豐富的經驗和專業知識,致力於打造創新的產品,提供最佳的用戶體驗。

字節跳動和 CapCut 共同致力於推動數字創意和內容行業的發展,並不斷努力為用戶帶來更多創新和有趣的工具和功能。無論是專業的創作者還是剛入門的用戶,都可以在 CapCut 的平台上發揮創造力,展示獨特的視覺魅力。作為字節跳動的全能創意平台之一,CapCut 一直以來都深受用戶的喜愛,並持續影響著數字內容和創意領域的發展。

Categories: Video, 工具, 線上服務

適合初學者的 AI 工具瀏灠器 Pinokio

首先,Pinokio 完全與系統已安裝的軟件分離,獨立運作。因始完全不會影响你的操作系統。另外,它能夠提供個性化的A.I 工具瀏覽體驗。Pinokio 使用先進的人工智慧技術,根據使用者的喜好,自動安裝 A.I 工具。

Pinokio 具有以下特點:

(more…)
Categories: 軟件, 工具

Page 12 of 13
1 10 11 12 13