Infer News

Meta 推出開源 SAM 音訊

Meta 的 SAM Audio 是首個統一的多模態模型，能從複雜音頻或視頻中精準分離特定聲音。

SAM Audio 支持文字提示（如「狗叫聲」或「人聲」）、視覺選擇（如點擊視頻中樂手）或時間範圍提示，來隔離目標聲音並生成殘餘音頻。它適用於音樂、語音和一般環境音，超越傳統單一工具。

模型基於 Flow-Matching Diffusion Transformer，在 DAC-VAE 潛在空間運作，提供小（500M 參數）、基（1B）和大（3B）版本。它能同時生成目標與殘餘音軌，支援真實世界場景如去除背景噪音。

Categories: Python, 聲效, 開源

DreaMontage – 一鏡到底

DreaMontage 是一個由 ByteDance 開發的開源 AI 影片生成框架，專注於「任意幀引導的一鏡到底」（one-shot）長影片合成，能從多個圖片或短片片段自動產生連貫、流暢的敘事影片。

Categories: 字節跳動, 影像模型, 影像處理, 視頻模型

SemanticGen 加入語意生成影片

SemanticGen 首先在高層語義空間中生成視頻，然後在 VAE 潛在空間中細化細節。SemanticGen 的核心觀點是，鑑於影片中固有的大量冗餘訊息，視訊生成應首先在緊湊的語義空間中進行全局規劃，然後再添加高頻細節——而不是直接對大量的底層視訊標記進行建模。

Categories: 香港中文大學, 影像處理

InfCam 攝影機 outpaint 控制

InfCam，一個無需深度資訊、攝影機控制的視訊生成框架，能夠實現高姿態保真度。該框架整合了兩個關鍵組件：

架構包含同次引導自注意力層（homography-guided self-attention），輸入源視頻、目標及變換潛在表示與相機嵌入，確保時間對齊與旋轉感知推理。變換模塊處理旋轉後添加平移嵌入，將重投影簡化為相對於無限遠平面的視差估計，提升軌跡忠實度。

透過增強 MultiCamVideo 數據集生成 AugMCV，引入多樣初始姿態與焦距軌跡，解決現有 SynCamVideo 等數據集偏差。

實驗結果表明，在 AugMCV 與 WebVid 數據集上，InfCam 在相同/不同內參情境下，於姿態準確度與視覺保真度皆優於基準，尤其在真實世界數據泛化表現突出。

Categories: 影像模型, 影像處理, 視覺模型, 視頻模型, 開源

RePlan 圖像編輯框架

RePlan 是一個基於指令的圖像編輯框架，專門解決指令-視覺複雜度（IV-Complexity）挑戰，透過視覺語言規劃器與擴散編輯器結合實現精準區域編輯。

框架採用「規劃-執行」策略：VLM 規劃器透過逐步推理分解複雜指令，生成邊界框與區域提示；編輯器使用無訓練注意力區域注入機制，支援單次多區域並行編輯，避免迭代 inpainting。

Categories: 香港中文大學, 香港科技大學, 騰訊, Python, 影像模型, 影像處理, 新聞, 開源

PersonaLive 安裝教學 (12G VRAM)

影片將一步步帶你上手 PersonaLive，教你如何使用 AI 即時角色變換，在直播或影片中實現即時變身效果，全流程免費。

用 AI 即時變身女神｜免費

Watch this video on YouTube

Categories: Python, 影像模型, 影像處理, 數字人, 開源

Qwen Image Edit 2511 教學

在本機用 ComfyUI 跑 Qwen Image Edit 2511，包含 BF16、FP8 和 GGUF 量化版本，以及 Lightning 4‑step LoRA 的完整實戰示範。

Qwen Image Edit 2511–Local Image Editing in ComfyUI | Multi-Reference Style Transfer & GGUF Workflow

Watch this video on YouTube

Categories: 阿里巴巴, ComfyUI, 影像模型, 影像處理, 開源

輕鬆製作超逼真 AI 說話頭像影片

InfiniteTalk 完全免費、支援長影片，唇同步自然但需調參避免誇張；HeyGen 更親民但付費，兩者差異不大，InfiniteTalk 性價比高。適合 IT 顧問用於快速製作教程或演示影片，節省攝影成本。

NanoBanana Pro + InfiniteTalk: Say GOODBYE to Expensive Studios!

Watch this video on YouTube

Categories: ComfyUI, AI productions, Python, 影像處理, 數字人

蘋果開源SHARP AI模型，將照片轉換為3D場景

Apple 開源的 SHARP 能讓你輸入單張 2D 圖片，輸出場景的 3D Gaussian 表示（3DGS），可以之後用 3D Gaussian splatting 實時渲染不同視角。這個推論過程在標準 GPU 上小於一秒完成。

SHARP 能產生的 3D 表示是有公尺尺度的 metric representation，所以可以支援具物理意義的相機移動，而不是純視覺特效式的視差

Apple's SHARP Computer Vision Model - Install and Run Locally

Watch this video on YouTube

Categories: 影像模型, 影像處理, 開源

充分利用 NotebookLM 中的幻燈片的 8 種方法

Gemini 圖像模型 Nano Banana Pro 整合到資訊圖表和幻燈片製作功能中。Google 最終將這兩項功能添加到手機應用程式中，並擴大了存取權限，讓更多用戶能夠體驗這些功能。

NotebookLM 將從研究到設計的內容創作流程整合到一個單一的工作流程。它有助於製作出以前僅限於設計團隊才能完成的專業化、數據驅動型內容。

在 NotebookLM 中建立投影片時，您不僅利用了 Nano Banana Pro 的強大視覺功能，還使用了 NotebookLM 自帶的創意代理——這種底層原理也正是音訊和視訊概覽如此引人入勝的原因所在。正是這種結合，為您打造了強大的視覺敘事引擎。

Categories: Google, NanoBanana

Page 7 of 65

« Previous 1 … 5 6 7 8 9 … 65 Next »