Rest2Art 用單張靜態觀察重建可動 3D 物件

只見到物件關上的樣子,Rest2Art 仍可推回零件結構與關節。對數碼孿生、模擬和機械人操作都幾實用。

Og image

只見到抽屜關上、櫃門未打開,系統仍要估到哪些部分可以動、會沿哪個軸轉或滑,這正是 Rest2Art 想處理的難題。它屬於 articulated object reconstruction,目標是由單一 closed-state observation 重建出可直接放入模擬環境的 articulated asset,而不需要先拍到物件在不同狀態下的運動。

這個做法的價值,在於把原本要靠動態觀察先完成的工作,提前到靜態輸入就處理好。Rest2Art 會先用 vision-language model 與 segmentation model 互相校正零件層級和遮罩,再把結果對應回 mesh;之後再借助 video diffusion model 產生可能的 articulation hypotheses,但真正的 joint parameters 不是直接照抄影片,而是再用幾何一致性去驗證。

回應了一個很現實的限制:很多日常物件未必容易拍到完整開合過程,但建模、模擬與機械人任務仍然需要知道它如何運動。Rest2Art 用 explicit mesh 作為中介,方便跨模型比對與融合,最後再把各部分轉成封閉體積,令輸出不只是「睇得明」,而是可用於 physical simulation。

  • 單靠 single closed configuration 重建 part-level geometry 與 joint parameters
  • 結合 vision-language model、segmentation model 與 video diffusion model 補足缺少 motion cues 的問題
  • 以 explicit mesh 做 cross-model verification and fusion,減少不同模型輸出互相衝突
  • 可輸出 simulation-ready articulated asset,並支援 URDF 匯出

論文描述顯示,它在 reconstruction-based、generation-based 與 modular pretrained-model families 之間,都能做到有競爭力的表現,重建出的零件分解與關節亦具備 physical plausibility。對數碼孿生、虛擬場景整合、real-to-sim-to-real,以及機械人 policy learning 而言,這種由靜態觀察直接產生可互動資產的流程,明顯比只重建外形更進一步。

項目主頁

Categories: Video, 3D, 多模態模型, 影像處理, 視覺模型, Dataset 數據集, 框架

NanoVDR:70M 文字編碼器取代 2B VLM:視覺文檔檢索的輕量化新嘗試

NanoVDR 把 2B 參數嘅視覺語言模型蒸餾成 69–151M 嘅純文字編碼器,查詢時完全唔需要視覺模型,CPU 51 毫秒即可完成。

NanoVDR

處理幾十萬張文件圖片嘅時候,每次查詢都要過一次 2B 嘅視覺語言模型(VLM),開銷大到令人卻步。NanoVDR 想解決嘅就係呢個落差:文件索引由教師模型離線建好,查詢階段只用一個 DistilBERT 規模嘅純文字編碼器,CPU 上 51 毫秒出結果,2048 維嘅單一向量直接做點積,扔得入 FAISS。

佢嘅做法係將 Qwen3-VL-Embedding-2B 凍結做教師,提早把目標向量快取落嚟,學生只係學一個餘弦距離嘅 loss——即係 loss = 1 - cos(student, teacher)。訓練時冇相關性標註、冇負例採樣,兩邊完全解耦,所以查詢端同索引端可以分開換組合。DistilVDR 進一步把文件端都換走,做到成個流程都唔再需要教師。

對於做企業 RAG、法律文件搜尋、學術庫檢索嘅團隊,最大吸引力係每頁索引得 4 KB,比 ColPali 嗰類多向量檢索慳 64 倍儲存,而且唔使 GPU 即可頂住查詢負載。ViDoRe v1 上面,NanoVDR-S-Multi 拎到 82.2 NDCG@5,保留咗教師大約 95% 嘅能力,呢個取捨對批量部署嚟講好實際。

重點摘要:

  • 極輕量查詢端:文字編碼器僅 69–151M 參數,無需視覺模型參與查詢
  • 高效索引:每頁僅 4 KB(float16),比多向量方案節省約 64 倍儲存
  • 簡易整合:輸出為單一向量,FAISS 即可處理,無需 MaxSim 池化
  • 教師-學生解耦:目標向量預先快取,兩端可獨立訓練與組合
  • 完整資源:模型、訓練數據集、線上 Demo 同論文均已開源

多向量查詢塔嘅程式碼已就位,但 checkpoint 要等 NanoVDR-v2 先出齊,想要更高召回嘅人需要留意後續更新。

項目主頁 · GitHub

Categories: 開源, Qwen, Embedding, RAG, 多模態模型, 模型, 視覺模型

MiLMMT-v1.0:小米升級開源翻譯模型:支援至 46 種語言

小米把旗下開源多語翻譯項目 GemmaX 升級至 MiLMMT-v1.0,支援語言一舉擴至 46 種,並透過強化學習與模型合併提升翻譯品質。

gemmax

過去想用開源 LLM 做多語翻譯,往往要遷就 20 多種語言的覆蓋,遇上東歐、非洲或東南亞較少見的語種就容易撞牆。MiLMMT-v1.0 把覆蓋範圍一口氣推至 46 種,這個改變對做跨國內容本地化、跨境電商文案,或是需要處理多語客戶查詢的團隊尤其受用。

這個項目屬於多語翻譯模型(multilingual machine translation model),並非框架或工具,核心目標是讓 Gemma3 等開放權重模型在多語翻譯場景下,貼近商用翻譯引擎的水準。它以 Gemma3-1B 與 Gemma3-4B 為基底,先做持續預訓練,再用翻譯指令微調,最後透過強化學習(GRPO)配合 xCOMET、OpenLID、CometKiwi 等無參考指標作為獎勵訊號。

與傳統依賴大型封閉模型、或需要平行語料的監督式微調不同,MiLMMT 強調 reference-free 後訓練:不需要人工對照譯文也能用 LLM-as-judge 改善翻譯結果。同時配合模型合併(model merging),在 1B 規模的小模型上嘗試兼顧多語泛化與低資源語種的穩定性,這點對硬體資源有限、想自建翻譯服務的工作場景相當關鍵。

重點摘要:

  • 支援語言從 28 種擴展至 46 種,覆蓋更多低資源語種
  • 基於 Gemma3-1B / Gemma3-4B 開放權重,可離線部署
  • 採用 GRPO 強化學習搭配 xCOMET、OpenLID 等無參考獎勵
  • 提供 Hugging Face Spaces 線上 Demo,亦有 RL launcher 與獎勵服務腳本可重現訓練流程
  • 相關論文已上 arXiv,紀錄後訓練與模型合併的實證結果

對本地化團隊、開發者或研究人員而言,這個項目提供了一條毋須依賴商業 API 的多語翻譯路線,1B 等級的模型體積亦令自部署門檻大幅降低。

項目主頁 · GitHub · 模型

Categories: 開源, 模型, 中國, 小米-Xiaomi

Ex-Omni-2D 直接對話生成同步發聲與表情的數字人影片

Ex-Omni-2D 讓對話模型同時輸出文字、個人化語音與表情同步的頭像影片,以多碼本語音單元串接語音與畫面,並提供 Teacher 與 Prefix-Streaming Student 兩種部署模式。

Ex-Omni-2D framework

想讓 AI 數字人不只是「會打字」,而是真的「邊說邊演」?香港中文大學(深圳)與 LIGHTSPEED 合作開源的 Ex-Omni-2D,正是針對這個目標設計。它是一個開源對話框架,接受多模態查詢、參考圖像與參考音訊後,先由語言模型輸出一份結構化的 Visual Thought Plan(VTP),再依此生成文字回應、個人化語音,並產出嘴形與動作同步的頭像影片。

傳統做法通常把語音合成與人物影片視為兩條獨立管線,需要額外對齊文字、聲音與嘴形,容易出現時間錯位。Ex-Omni-2D 的差異在於採用 16 個 codebook 構成的原生多碼本語音單元,作為語音與影片共享的聲學與時序介面:同一組語音單元既驅動 TTS,也作為影片生成器的緊緻條件,從而降低跨模態錯位的風險。

影片生成路徑提供兩種互補模式:Full-sequence Teacher 採雙向注意力,追求最高畫質;Prefix-Streaming Student 則是蒸餾而來的少步數 block-causal 版本,支援 2、4、8 步串流推論,方便在工作站、GPU 伺服器甚至 Hugging Face Spaces 上做漸進式部署。

這個項目的重點:

  • 對話原生影片:視覺行為直接從多模態對話上下文規劃,不必再手動撰寫影片提示詞。
  • 結構化 VTP:明確定義首幀、場景、情緒、動作風格與動作細節,方便後續控制與除錯。
  • 共享語音介面:16 個 codebook 同步驅動語音合成與人物動作。
  • 品質與效率取捨:Teacher 負責最高畫質,Student 支援 2/4/8 步串流。
  • 彈性部署:同一套代碼可在個人工作站、GPU 伺服器或 HF Spaces 執行,並提供線上 Demo 試玩。

在串流場景中,作者指出 Prefix Streaming 從第 9 至 16 chunk 的一致性明顯較強,將 last-to-first consistency error 降低 21.4%,這對需要長時間維持角色身份一致的應用相當關鍵。論文亦提到 Prefix Streaming 能減少長序列累積形變,同時保留參考圖像的人物外觀。

較適合的對象包括需要快速打造可對話 AI 助手、虛擬主播、客服分身或教學數字人的團隊;對研究多模態對話、語音驅動動畫的人來說,這份開源代碼、模型權重與 arXiv 論文也是一個方便的起點。

項目主頁 · GitHub · 模型

Categories: 開源, Qwen, 香港, 香港中文大學, 騰訊, 文字轉語音, AI productions, 多模態模型, 數字人, 視頻模型, 語音

LTX-2.5 原生多鏡頭、4K HDR,一次看懂升級重點

LTX 最新開源基礎模型 LTX-2.5,主打原生多鏡頭銜接、4K HDR,並降低重試與算力成本,繼續走開放權重路線。

LTX-2.3 Examples Video

如果你是用開源模型做影片生成的開發者,LTX-2.5 這次更新解決的卡位頗明確:人物、環境、光線與聲音在多鏡頭之間斷裂的問題。它把多鏡頭生成變成原生能力,並加入自動時長預測,模型會按指令動作自行決定片段長度,省下人手剪接的麻煩。

對比起多數只能透過後製拼接的同類方案,LTX-2.5 在 prompt 跟隨度上也有明顯進步,能夠處理更複雜的創作指示,而且只需要更短的提示詞就能產生穩定結果。配合新的擴散影片解碼器,動態假影更少,畫面在高解析度與 HDR 下仍能逐格保持質感。

本地部署與微調是這次版本延續的核心承諾:開源權重可直接下載,預訓練基礎模型可在自家做 LoRA 微調,產出與後製則支援原生 RAW workflow,貼近專業調色與剪接流程。

從官方比較表來看,目前維持開放權重且不受地區限制的開源視頻生成選擇仍然有限,這也是 LTX-2.5 在定位上最值得留意的差異化。不過實際表現仍需視本地硬件配置與工作流整合程度而定。

重點摘要

  • 原生多鏡頭生成:人物、環境、光線與聲音在不同鏡頭間保持一致。
  • 自動時長預測:依據動作需要自動決定片段長度。
  • 4K HDR 與原生 RAW:支援專業調色與後製 pipeline。
  • Gemma 4 12B 文字編碼器:搭配自研提示詞增強器,提升 prompt 跟隨度。
  • 開源權重可下載:可在本地硬件運行,並支援 LoRA 微調。

項目主頁

Categories: 開源, Video, Image, AI productions, 多模態模型, 數字人, 模型訓練, 視頻模型, LTX

Grok Bot 登場:xAI 推出常駐 AI 同事,能自主操作電腦完成任務

Grok Bot 就像一隊永不登出的 AI 隊友,能登入你的軟件代勞長時間任務,從銷售外聯到支援工單都接力完成。

Og image

xAI 最新推出的 Grok Bot,把「Computer-use agents(CUAs)」這個概念包裝成一支可以分工的虛擬團隊。它擁有自己獨立運行的電腦環境,能像真人般登入 Zendesk 等 SaaS 工具、瀏覽網頁、操作軟件介面,並在背景 24 小時不中斷地接力完成任務。對需要處理大量例行工序的小團隊或一人公司來說,這類 agent 最直接的價值是把「等人按掣」的等待時間壓縮到接近零。

Grok Bot 強調幾個工作流設計:你可以同時叫多個 Bot 進入同一個對話串,分頭負責研究、公關、差旅等不同環節,Bot 之間會自行交接工作;只要你親自示範一次流程,它就能把步驟記成「routine」自動重複執行,並隨時間累積記憶,例如記下某客戶只簽年約、誰是決策人。對需要批量生成銷售名單、處理支援工單或長期追蹤項目進度的使用者而言,這種「邊做邊學」的能力比單純的 prompt 工具更貼近實際工作節奏。

定價方面,Grok Bot 綁定在 Cursor Ultra 月費 200 美元的方案內,包含其專屬電腦環境、跨裝置使用與排程執行;團隊版則額外提供 SSO 與共享用量分析。xAI 將其定位為企業 SaaS 的入口代理,但實際上能否取代 ClickUp、HubSpot 等內建自動化,仍要視乎它對接工具的覆蓋率與執行成功率。

重點摘要

  • 擁有獨立電腦,能像人類登入並操作 SaaS 工具完成長時間任務
  • 支援多 Bot 協作,在同一對話串內自行分工與交接
  • 用戶示範一次流程後,Bot 可記為 routine 自動重複執行
  • 隨時間累積記憶,保留客戶偏好、決策人等脈絡
  • 透過 Cursor Ultra(200 美元/月)方案提供,團隊版含 SSO 與共享分析

項目主頁

Categories: Agentic, API, 工具, 線上服務, IDE, Mac, 免費試用

NeMo Speech:NVIDIA 把 ASR、TTS、語音 LLM 收進同一條 PyTorch 生產線

NVIDIA 把語音研究最常碰到的 ASR、TTS 與 Speech LLM 整合成單一框架,研究員和工程師不用再東拼西湊,也能用預訓練權重快速微調與部署。

Repository image for NVIDIA-NeMo/Speech

語音 AI 的痛點往往不是模型不夠強,而是開發者要同時面對 ASR、TTS、串流識別等好幾套獨立工具鏈。NVIDIA NeMo Speech 把這些任務收進同一個 PyTorch 框架,並提供預訓練權重,讓研究員可以把精力花在實驗設計,而不是從頭搭建訓練流程。

從近期更新可以看到三個值得留意的方向:MagpieTTS v2607 把支援語言擴展到 12 種,新增阿拉伯文、韓文、葡萄牙文;Nemotron-3.5-ASR-Streaming-0.6B 在單一 H100 上能同時處理最多 2400 條串流,並允許把延遲控制在 80ms 到 1s 之間;Parakeet-unified-en-0.6b 則把離線與串流推理合併成一個英文模型,最短延遲 160ms。

Nemotron 3 VoiceChat 把 LLM、骨幹與 TTS 解碼器串成全雙工對話,能自然處理打斷與插話,這對於想建立語音助理的團隊是比較完整的一條路。Fastconformer 等快取感知架構是背後的工程功臣,讓長音訊串流不需要犧牲太多吞吐量。

訓練階段必須配備 NVIDIA GPU 與 CUDA 環境,推薦使用 PyTorch 2.7 或以上版本;現時倉庫正進行拆分,下一個主要版本預定 2026 年 6 月發佈,短期內穩定使用可以考慮 26.02 NGC container。對做客服、會議記錄、媒體字幕或有聲書生成的團隊,這套框架能把語音模型從原型走到部署的距離明顯縮短。

重點摘要:

  • 單一框架覆蓋三大任務:ASR、TTS 與 Speech LLM 都在 NeMo Speech 內,減少切換工具鏈的成本。
  • 串流效能突出:Nemotron-3.5-ASR-Streaming-0.6B 支援 40 種語言,單張 H100 可並行 2400 條流,延遲可調。
  • 多語 TTS 擴張:MagpieTTS v2607 覆蓋 12 種語言,並提供 Hugging Face 線上 demo。
  • 全雙工語音助理:Nemotron 3 VoiceChat 把 LLM 與 TTS 解碼器結合,支援自然打斷與低延遲對話。
  • 硬體要求明確:至少配備 80 GB 記憶體。訓練需 NVIDIA GPU 與 CUDA,PyTorch 2.7 或以上版本,推理可在 CPU 或 GPU 執行。

GitHub · 模型

Categories: 開源, NVIDIA, 文字轉語音, Agentic, Python, 語音, Dataset 數據集, 框架

NVIDIA Nemotron 3.5 Lightning:專為長期運行 Agent 而生的輕量 MoE 模型

AI Agent 大部分時間都在做工具呼叫、結果驗證等高頻次執行,而非高階推理。Nemotron 3.5 Lightning 以 30B MoE 架構瞄準這個執行層,速度比同級模型快 4 倍。

Og image

長期運行的 AI Agent 真正花時間的地方,往往不是規劃,而是工具呼叫、結果驗證、子代理分派這些高頻次的執行步驟。每一個小動作都用頂級推理模型去跑,會帶來明顯的成本與延遲壓力。NVIDIA 推出的 Nemotron 3.5 Lightning 就是針對這個「執行層」設計的開放模型,採用 30B 參數的 Mixture-of-Experts(MoE)架構,但每次只啟動 3B 參數,在維持效率的同時兼顧準確度。

與坊間常見做法不同,Nemotron 3.5 Lightning 並非要取代大型推理模型,而是與之分工——前者處理高頻執行,後者專注規劃與複雜推理。模型本身針對 agent harness(如 OpenClaw、Hermes Agent)做了訓練優化,並提供 speculative decoding、NVFP4 與 BF16 量化版本,宣稱輸出速度比同級模型快 4 倍。這對需要長時間在線、隨時待命的 Agent 來說,省下的不只是金錢,還有回應時間。

Nemotron Lightning - NVIDIA's Super Fast Agent MoE

NVIDIA 同時推出 NeMo Switchyard,一個負責任務分派的路由函式庫,能根據任務類型自動挑選最合適的模型。整個 Nemotron 系列定位有點像「模型版的軟件庫」,每次發佈都在累積可組合的元件。對於需要自己掌控成本與效能的開發團隊,這套組合提供了相當完整的權重、數據與訓練配方,加上寬鬆的開源授權,方便做深度客製化。

  • 專注 Agent 執行層:30B MoE 架構、3B 活躍參數,設計目標是高頻低延遲的工具呼叫與驗證。
  • 速度與成本取捨:相比同級模型,輸出速度提升達 4 倍,搭配 NVFP4 量化可在本地硬件運行。
  • 分層協作模式:與 Nemotron 3 Ultra 等大型推理模型分工,由 NeMo Switchyard 負責智能路由。
  • 完整開源:權重、訓練數據與配方一併釋出,授權寬鬆,方便客製與整合。
  • 生態整合:對應 NemoClaw 安全管理開源方案,支援 OpenClaw、Hermes Agent 等長期運行框架。

項目主頁

Categories: 開源, NVIDIA, Agentic, 軟件, 安全, , 模型, OpenClaw

NeMo Switchyard:幫 AI Agent 自動揀模型,慳成本又唔跌質素

NVIDIA 推出 NeMo Switchyard,等開發者用同一套 SDK 為 Agent 動態揀選最啱用嘅模型,兼顧成本、延遲同質素。

Og image

揀模型往往是部署 AI Agent 嘅最大難題之一。每一個請求嘅需要都唔同:有時要做分類,有時要做推理,亦可能只係簡單跟進任務。如果全部交俾最貴嘅模型,成本同延遲即刻飆升;硬揀細模型又會喺複雜任務上跌質素。NVIDIA NeMo Switchyard 就係為咗處理呢個矛盾而設計嘅 routing 框架。

開發者可以將 Switchyard 理解為一個智能分流器:每次有請求進入,router 會根據模型能力、成本同基建狀況等即時訊號,決定交俾邊個模型處理。整個判斷過程毋須事先大量微調,支援 tuning-free 同 tunable 兩種路由演算法,亦因為採用 provider-agnostic SDK,邏輯同具體模型供應商解耦,轉換模型時無需重寫應用。

Switchyard NVIDIA's Local Agent Router

呢套做法同「全部用一個模型」嘅常見做法相比,最大差異在於將選模型變成可調控嘅政策。LangChain 同 Cognition 等合作實測顯示,路由後既能維持高準確率,又能明顯降低成本。對於需要同時處理多類任務、又關心成本曲線嘅 Agent 工作流,呢種 system-of-models 嘅思維比起死鎖單一模型更貼近實際環境。

重點摘要:

  • 動態路由:根據每次請求嘅 context、能力、成本同延遲限制,即時揀選最合適嘅模型。
  • 彈性 SDK:provider-agnostic 設計令開發者無需為每個模型供應商重寫應用。
  • 支援兩種路由策略:由 tuning-free 到可微調演算法,畀開發者按需要調整。
  • 成本與質素平衡:實測顯示可以在保持高準確率嘅同時顯著降低開支。
  • 即時訊號驅動:用 runtime 訊號做調度,適合 production 環境嘅 agent workflow。

對於正在建構多步驟 Agent、又唔想被單一模型綁死嘅團隊,NeMo Switchyard 提供咗一個相對務實嘅選擇:將「揀模型」變成可觀察、可調校嘅環節,而唔係每次模型換代都要由頭來過。

項目主頁

Categories: NVIDIA, Agentic, API, LangChain, 模型訓練, 框架

ComfyUI_MiniMaxH3_Director:一次過生成多段影片的導演台

想做長片、多段生成又唔想逐段接節點,這個項目把 MiniMax H3 的分鏡、取樣和輸出收在同一個 ComfyUI 工作流核心。

MiniMaxH3Director 工作流截图

做長影片時,最麻煩往往唔係單段生成,而係分鏡、續接、音畫輸出要分開處理。AIMixer/ComfyUI_MiniMaxH3_Director 針對的正是這個卡位:它屬於 ComfyUI 的影片生成節點插件,將 MiniMax H3 的多段規劃、條件編碼、採樣解碼和匯出合併成一個導演台,讓長視頻與多段音視頻生成流程集中管理。

它的價值不只在於把功能堆在一起,而是把幾種常見工作流放進同一個操作面。無論是 t2v、i2v、fl2v、r2v、v2v 還是 rv2v,都可沿用同一套時間軸邏輯;當中首尾幀、參考素材組、源片改寫和選擇性重跑都已經整理好,對需要反覆改段落、補鏡頭或保留原聲的創作者會實用得多。

安裝方式也算直接,前提是 ComfyUI 要升級到 v0.30.0 或以上,並已具備官方 MiniMax H3 支援。之後可用 ComfyUI Manager 透過 Git URL 安裝,或手動放進 custom_nodes,再按需要補上 scenedetectopencv-python-headlessimageio-ffmpeg 這些依賴;模型權重與示例工作流則需另外下載。要留意的是,CLIP Loader 的 type 必須設為 minimax,而 fl2va / ref2va UNET 亦要按任務類型配對。

跟一般把多個節點逐個串起來的做法相比,這個項目明顯偏向把影片導演流程封裝成一個較完整的工作台,代價是你仍然要跟官方 MiniMax H3 節點規格保持一致,並理解不同模式背後用的是 MiniMaxH3ImageToVideoMiniMaxH3ReferenceToVideoMiniMaxH3SigmaShiftKSampler 與 AV 分離解碼鏈路。重點放在長片分段銜接、段間運動延續與原生立體聲輸出,較適合已經在 ComfyUI 內做影片生成、希望減少手動接線和重複操作的團隊。

  • 把多段時間軸、生成、解碼、匯出收進單一節點
  • 支援 t2v、i2v、fl2v、r2v、v2v、rv2v 多種模式
  • 可做選擇性重跑,未勾選片段可用快取或原片填補
  • 依賴官方 MiniMax H3 節點,環境版本與模型配對要設好
  • 原生輸出立體聲音頻,適合長片與多段音視頻工作流

GitHub

Categories: 開源, ComfyUI, MiniMax

Page 1 of 132
1 2 3 132