ConCor-1:一句標註都唔使畀,自動搵出圖文對應

ConCor-1 將視覺語言定位反轉成雙向概念對應,唔使預先指明想搵乜字句,畀一張圖同一段文字就會自動判定邊啲文字對應邊個物件。

Bidirectional concept correspondence: a caption, a referring expression and a category list all produce the same output

以往做視覺語言定位,多數流程都要你先講明想搵邊句字,模型再喺圖入面指出對應區域。ConCor-1 索性反轉呢個做法:畀一張圖同一段文字,無論係完整描述、指代表達,定係一列類別名,模型都會自己判斷邊段文字同圖入面邊個物件對得上,然後一次過畀齊文字遮罩、實例遮罩同對應分數。研究團隊由華盛頓大學、Allen Institute for AI 同 Meta FAIR 組成,模型基於預訓練視覺語言模型,再加上一組可學習嘅 bridge tokens 嚟代表候選對應。

呢種設計最大嘅實用價值,係省卻前置標註嘅工序。當你手上得一段長 caption 或者一大串類別名,傳統方法往往要逐句拆開再分批餵入,ConCor-1 直接當作一次對應預測處理,文字分割、影像分割、跨模態對齊三件事一齊做。佢將 phrase grounding、referring expression 同 open-vocabulary detection 收納成同一格式,等訓練同評測可以用統一數據集比較。

ConCor-1 喺長 caption 數據集上將 correspondence F1 提升 48%,喺零樣本 LVIS、即用大類別清單當文字輸入嘅場景亦提升 29%。Hugging Face 上已有模型權重、數據、Space Demo,源代碼以 Apache 2.0 發佈。對做細粒度理解、自動化標註,或者想整合長描述入視覺流程嘅團隊,呢個框架值得留意;想自行重現訓練嘅人就要再等等,現階段主要提供推論程式碼同評測即將推出。

重點摘要

  • 雙向概念對應:毋須預先指明文字,直接輸出文字遮罩、實例遮罩同對應分數
  • 統一格式:將 phrase grounding、referring expression、open-vocabulary detection 收成單一預測任務
  • 基於 bridge tokens:喺預訓練視覺語言模型上加可學習 token 代表候選對應
  • 顯著提升:長 caption F1 提升 48%,零樣本 LVIS F1 提升 29%
  • 開源配套:模型權重、數據、Space Demo 同推論程式碼已於 Hugging Face 同 GitHub 公開

適合需要從圖文配對中抽取結構化對應、做自動化標註、或研究視覺語言定位框架嘅讀者。ConCor-1 將文字分割、影像分割同跨模態對齊壓成單一任務,特別適合處理長描述或大類別清單等場景。

項目主頁 · GitHub · 模型

Categories: 開源, 多模態模型, 模型, 視覺模型, Meta, Dataset 數據集

RynnValue 用秒估計機械人完成時間

它不只判斷機械人有冇做對,仲會估計距離完成仲差幾多秒。呢種時間式價值訊號,令強化學習獎勵設計變得直接得多。

RynnValue overview

機械人操作最難的不只是識別動作成敗,而是要持續知道距離完成指令仲有幾遠。RynnValue 就是針對呢個空缺而來的模型項目:它把機械人影片連同文字指令一齊讀入,逐格預測剩餘完成時間,並輸出自然語言分析,讓進度估計、失敗偵測與 VLA(vision-language-action)policy 的獎勵建構可以共用同一套訊號。

它和常見進度分數或偏好標註做法的分野很清楚。RynnValue 不靠人工標出「較好」軌跡,也不把進度硬壓成 0 到 1,而是直接學習 goal-conditioned cost-to-go 的物理時間;標籤來自時間戳,配合子任務切分與 cutoff relabeling,於是能擴展到 7,000 多小時、約 300 萬段 instruction-conditioned clips 的異質機械人資料。這個取捨帶來的好處是可擴展,代價則是模型必須更好地處理長尾任務時長與不同視角、不同 embodiment 的差異。

RynnValue 連同完整工具鏈一併提供。你可以把它理解成一套由 HuggingFace 相容模型、影片推理示範,到 reward-model benchmark 與強化學習介面都包起來的研究型工具組;當中 RynnValue 建基於 RynnBrain,實作在 Qwen3-VL architecture 之上,除了預測 absolute 與 relative temporal value,亦會生成影片描述,並判斷 instruction–video 是否匹配、任務是否成功。

  • 核心能力是把「距離完成尚餘幾多秒」變成稠密 value signal
  • 訓練毋須 preference 或 progress annotations,較易放大量異質資料
  • 8B 版本在 RBM-EVAL-OOD 的平均 Kendall’s τₐ 達 0.675,高於文中對照的 fully preference-supervised 方法 0.655
  • 可直接接到 reward shaping,用作 policy ranking、evaluation 與 reinforcement learning critic

為免模型偷看序列位置去猜進度,作者加入 temporal-order shuffling、random temporal sampling,以及 value-isolation attention;消融結果亦顯示這些設計不是裝飾,拿走後指標會明顯下跌。再進一步,它把輸出的 value 轉成 potential-based shaping reward,在雙臂 Franka 的真實機械人學習中,無論 online 定 offline 都比最強 reward-model baseline 有更高成功率。

最受惠的會是做機械人操作、VLA 訓練、reward modeling 與 embodied AI 評測的團隊,尤其想減少人手標註成本、又需要跨資料來源泛化能力的人。限制同樣存在:這類時間距離訊號雖然比二元成敗更細緻,但對任務切分、影片品質與觀測覆蓋仍然敏感,而且它目前聚焦於 robot manipulation,不代表可直接外推到所有 agent 場景。

項目主頁 · GitHub · 模型

Categories: 開源, 阿里巴巴, Qwen, Agentic, Video, 多模態模型, 模型訓練, 視覺模型, Robotic, VLA, Dataset 數據集

Meta Muse Glimmer:為本地多模態代理而生

Muse Glimmer 30B 針對本地部署而設,把圖文理解和代理式操作放在同一個模型裡。它同時提供 BF16、GGUF 與 ExecuTorch 版本,方便不同裝置取用。

Meta

Muse Glimmer 30B 屬於多模態 agentic model,重點放在本地部署時的可用性。對需要在自己裝置上處理圖文輸入、又想保留代理式工作流的用戶來說,這種設計比只提供單一格式的模型更實用,因為可以按硬件環境選擇合適版本。

Meta 這次一口氣放出多種包裝,包括 BF16 權重、GGUF k-quants、ExecuTorch builds,還有一個較細的 assistant 版本。這代表它不是只面向單一推理環境,而是嘗試覆蓋桌面、本地推理引擎,以及流動裝置部署等不同需求。

從現有資訊看,Muse Glimmer 的核心價值在於把多模態能力和本地執行的彈性結合起來。GGUF 版本方便在本地執行推理,ExecuTorch 版本則指向更輕量的裝置端部署;對想控制資料流向、減少依賴雲端服務的工作流,會更有吸引力。

  • 支援多模態輸入,適合圖文混合任務
  • 針對 local deployment 設計,部署選擇較多
  • 提供 BF16、GGUF k-quants、ExecuTorch 等不同格式
  • 有 30B 主模型與較小的 3B assistant 版本
  • 適合需要本地推理、裝置端或代理式工作流的場景

現時公開資料較集中在模型包裝與部署形式。就定位而言,它更像是一個面向實用部署的多模態模型系列,而不是只靠單一規格吸引注意的發佈。

項目主頁 · 模型

Categories: 開源, Agentic, API, Image, LLaMa, 多模態模型, 安全, 模型, 視覺模型, Meta

MiniMax H3 Turbo:4 步加速的影音生成 LoRA

MiniMax H3 的 ComfyUI 加速 LoRA,把 10 秒影片生成壓到固定 4 步。它適合要在速度、畫質和可控性之間取平衡的 T2V 與 I2V 工作流。

Og image

MiniMax H3 Turbo 走的是 ComfyUI 用途的加速路線,核心價值在於把 MiniMax H3 的文本生成影片(Text-to-Video, T2V)和圖像轉影片(Image-to-Video, I2V)流程固定到 4-step Euler 推理。它不是獨立模型,而是要配合 Comfy-Org/MiniMax-H3 的 BF16 base model 使用;頁面未提供更完整的 base model 參數規模或訓練細節,所以不能再往下猜。

這種設計的取捨很直接:步數少,生成時間通常更短,但對動作細節和穩定性的容錯也會更窄。頁面列出的比較都在同一個 BF16 base model、同一輸入與 10 秒、約 0.9MP 解析度條件下做,LoRA strength 固定 1.0;不同場景下,時間大概落在 174 到 190 秒之間,速度提升存在,但不是壓倒性。

重點摘要:
– 支援 T2V 與 I2V,I2V 走第一幀路徑,亦可用最後一幀收尾
– 固定 4-step Euler,重點是縮短推理流程而非擴大模型能力
– 需要配對 Comfy-Org/MiniMax-H3 的 BF16 base model
– 頁面未列出 GGUF、mmproj、上下文長度或量化檔案資訊
– 與 lightx2v LoRA 的比較屬同級加速方案,差距主要體現在時間與輸出取向

從檔案描述看,這個項目是 LoRA,不是完整 diffusion checkpoint,所以它的定位比較像「推理策略補丁」而不是全新模型。頁面也沒有提供 llama.cpp、Ollama 或 LM Studio 的支援資訊,顯示它主要面向 ComfyUI 工作流,而不是通用本地推理框架。

檔案命名上,頁面強調這是 v2 類型的更新版本脈絡;因此可確認的只有它圍繞 H3 的 joint audio-video diffusion path,並以固定 4 步作為加速契約。若要和原始 base model 比,差別不在功能範圍,而在於把生成速度和步數控制收緊,換取更快的工作流回饋。

模型

Categories: 開源, ComfyUI, Video, Image, Audio, 數字人, 視覺模型, 視頻模型, MiniMax

SimWAM:把 AI 影片變成自動駕駛規劃

華中科大與東風研發團隊提出的 SimWAM,將影片專家和動作專家共同訓練,再丟掉影片分支只保留規劃器。它把未來畫面學到的動態先驗,轉成較低延遲的軌跡預測。

Overview of the SimWAM architecture with isolated attention

華中科技大學與東風研究團隊合作提出 SimWAM,重點是把影片生成的能力轉成自動駕駛規劃訊號,而不是在推理時硬做未來影像生成。它屬於 World-Action Model (WAM),直接處理端到端自動駕駛中的軌跡預測與規劃問題,目標是減少延遲,同時保留對交通動態的理解。

訓練時,系統會把預訓練影片專家和輕量動作 DiT 一起做 joint flow matching,讓未來畫面學到的動態先驗滲入動作表示。兩邊共享注意力流,但用 isolated attention mask 令未來片段和動作 token 不會互相偷看,推理時就可以直接丟掉影片分支,只留下動作專家。

  • 研究團隊來自 Huazhong University of Science & Technology 和 Dongfeng Research & Development Institute。
  • 推理階段不需要未來場景生成,也不需要額外動作模組。
  • 動作專家可獨立縮放,影片骨幹亦可替換,結構相對靈活。
  • 在 NAVSIM 上取得 91.5 PDMS,並可 zero-shot 遷移到 nuScenes。
  • 強化學習部分用 FlowGRPO 去優化組合式駕駛獎勵,只更新動作專家的 LoRA adapters。

它最值得留意的地方,不在於把模型堆得更大,而是把訓練用的影片訊號和部署用的規劃器切開,令系統在保留動態理解的同時減少推理負擔。官方沒有完整列出安裝步驟,因此較適合先按論文與程式庫說明理解其訓練和部署流程。

GitHub · 模型

Categories: 開源, 視覺模型, 中國, VLA

Wan-Animate-2 把角色動畫推向即時互動

同一張角色圖,已經可以跟住驅動影片做出更穩定動作,連鏡頭角度都可另外控制。Wan-Animate-2想解決的,不只是畫面靚唔靚,仲包括直播同數字人能否即時用。

Og image

一張角色圖片配合一段驅動影片,便可以生成動作自然、表情細緻的角色動畫,這正是 Wan-Animate-2 想處理的核心場景。它屬於角色動畫生成框架,重點不只放在畫質,還試圖解決身份容易走樣、動作細節流失,以及難以支援即時互動這幾個長期卡位。

跟不少依賴中間動作表示的方法不同,Wan-Animate-2 直接把 driving video 餵入重新設計的 Diffusion Transformer,避開 motion extractor 帶來的誤差與 identity drift。這種端到端做法的好處,是角色外觀保持得更穩,細微表情、複雜肢體動作,甚至角色與場景之間較合理的互動,都更容易保留下來。

它另一個值得留意的能力,是加入 text-driven viewpoint control,令輸出鏡頭角度可以跟驅動影片分開控制。對數字人、直播主持、虛擬角色演出這類互動工作流來說,這代表同一段驅動內容不一定要綁死原本視角,使用時更容易配合不同畫面需求。

  • 直接使用 driving video,而不是先抽取中間動作表示
  • 主打更穩定的 identity preservation 與 motion fidelity
  • 支援 text-driven viewpoint control,可分離鏡頭視角與驅動動作
  • 推出 Wan-Animate-2-Lite,目標是把推理延遲壓到即時門檻
  • 預告公開 Wan-Animate-2-Base 權重,方便社群延伸研究

為了走向即時應用,團隊亦提出 Wan-Animate-2-Lite,並用三階段訓練流程去降低 inference latency,包括 teacher forcing pretraining、error buffer mechanism,以及 Self-Forcing distillation 配合 chunk-wise backpropagation。現有結果與使用者研究顯示,它在多種角色和動作模式下都有不錯的高保真表現;不過目前公開資訊仍以研究展示為主,部署成本、硬件需求與長時間串流穩定性,仍要等更多公開細節驗證。

項目主頁

Categories: 阿里巴巴, Video, Image, 動畫, 視覺模型

Ego2Robot 把人類影片轉成機械人訓練數據

Ego2Robot將第一身人類操作影片轉化成大規模機械人訓練數據,改善 VLA 模型面對陌生環境時的泛化能力。

Ego2Robot pipeline overview

機械人要應付陌生場景,往往需要大量而且多樣化的示範數據;Ego2Robot選擇從第一身人類操作影片取材,將人手動作轉換成不同機械人形態可以使用的訓練資料。這個數據合成項目面向 Vision-Language-Action(VLA)模型預訓練,處理人類影片與機械人動作、視覺外觀不一致的問題。

流程分為動作對齊、視覺對齊和品質篩選三部分。系統會把拇指、食指、中指指尖及手腕等關鍵點重新映射到夾爪的 TCP、開合幅度和方向,再以 Savitzky–Golay 及 SLERP 平滑動作;視覺處理則結合 SAM 3、ProPainter、機械人底座姿態搜尋和 IK solving,把機械人手臂合成到已修補的人類場景中。

項目支援已有手部姿態標註的數據集,也可以從原始影片估算姿態,後者使用 WiLoR 逐幀重建和 DynHaMR 時序最佳化。統一流程可以平行產生 15 種 robot morphologies,累積 18,561 小時訓練數據,涵蓋較多任務、場景和機械人配置。

重點包括:
– 同時支援 curated datasets 和 in-the-wild videos
– 以多層 quality curation 篩走動作及視覺合成中的低質資料
– RoboTwin 2.0 加入視覺外觀、場景佈局、機械人形態和任務語義等干擾軸
– 與機械人數據聯合預訓練後,多種 out-of-distribution 情況下的泛化能力提升
– 改善效果亦在真實機械人部署中獲得驗證

對需要建立通用機械人操作模型的研究團隊,Ego2Robot提供了一條減少真人示範收集成本的路線。不過,合成數據的品質仍取決於手部姿態估算、動作重定向、逆運動學和場景合成是否準確,因此它較適合作為真實機械人數據的補充,而不是完全取代實體部署資料。

項目主頁

Categories: 阿里巴巴, Qwen, Video, 多模態模型, 模型訓練, 視覺模型, Robotic, 中國, VLA, Dataset 數據集

JoyAI 把即時串流影片編輯推向 720p

影片逐幀抵達便可按文字指令修改,JoyAI-Video-Edit 以 30.19 FPS 連接即時攝影與生成式編輯。

JoyAI-Video-Edit teaser

直播畫面或上載影片不必等到完整片段準備好,便能一邊輸入自然語言指令、一邊看到修改結果。JoyAI-Video-Edit 屬於開源影片生成及影像處理模型,處理的是影片串流中延遲高、必須預先知道片長,以及難以維持連貫性的編輯流程。

它支援主體修改、局部區域調整、背景替換、風格轉換、動作改變和參考影像引導,適合互動示範、直播效果及需要即時預覽的創作工具。系統以 Multimodal Large Language Model(MLLM)條件編碼器、causal video Variational Autoencoder(VAE)及 16B-parameter Multimodal Diffusion Transformer(MMDiT)組成,逐段處理新抵達的畫面。

同類影片生成方法往往先取得完整影片,再一次過進行離線處理;JoyAI-Video-Edit 改用 autoregressive diffusion,配合 aligned autoregressive distribution matching distillation、long-horizon optimization、bounded Key-Value state(KV-state)inference 和 deployment-oriented scheduling,換取串流速度。不過,這種設計仍要留意長時間輸出可能出現的 temporal drift,而且消費級 GPU 支援仍列為待辦工作。

部署基準在 720×1280 解像度達到 30.19 FPS end-to-end throughput,代表系統已接近互動式影片處理所需的速度,但不能直接等同於所有硬件和指令下都能保持相同表現。Hugging Face 提供 JoyAI-Video-Edit checkpoint,GitHub 同時提供部署程式碼和線上 Demo,較適合具備 GPU 資源、希望整合影片工作流,或研究 Computer Vision 與串流生成的團隊。

  • 即時串流:畫面逐幀處理,不要求預先提供完整影片或固定片長。
  • 指令範圍廣:涵蓋主體、局部、背景、風格、動作及參考影像編輯。
  • 速度指標:720×1280 下達到 30.19 FPS 的完整流程吞吐量。
  • 部署取捨:透過 bounded KV-state inference 控制計算量,但消費級 GPU 支援仍未完成。
  • 適用人群:影片工具開發者、直播創作者及需要即時預覽的研究團隊。

GitHub · 模型

Categories: 開源, Google, NVIDIA, Video, 多模態模型, 視覺模型, 視頻模型, 蘋果, Dataset 數據集

3DZip 把 3D VLM token 減少到 10 分 之一

3D 問答模型常被海量 token 拖慢,3DZip 用免訓練壓縮方法把負擔大幅減輕。速度提升接近兩倍,原有能力大致保得住。

3DZip logo

做 3D Question Answering 時,projection-based 3D vision-language models 往往要先把多視角 RGB-D 特徵投影到世界座標,結果每個場景會堆出幾千個 token,推理速度同記憶體壓力都會立即變成瓶頸。3DZip 屬於token compression 框架,處理的正正是這個問題,而且做法不是再訓練一個新模型,而是直接插進現有流程,先減重再回答問題。

它的判斷很清楚:3D token 的冗餘不只來自空間上太接近,還包括物件層級分佈不平均,所以單靠 2D VLM 常見的 attention 或語意相關性壓縮,未必保得住 3D 幾何結構。3DZip 用三步走處理,先做 voxelization 清走點級重複,再用 Determinantal Point Process(DPP)挑出特徵夠多樣的 anchor tokens,最後在空間限制下合併其餘 token,重點是保持 geometric coherence。

3DZip 提供 LLaVA-3D 的 inference 與 evaluation code,代表你可以把它理解成偏向研究驗證、效能比較同既有模型加速的項目,而不是即裝即用的完整產品。核心演算法放在 llava/model/multimodal_encoder/video_encoder.py3dzip pooling branch,部署思路也很直接:以 LLaVA-3D 為基礎模型,把壓縮流程接到 multimodal encoder,再用基準測試看 token 數、速度同回答質素之間的取捨。

3DZip 在三個 3D question answering benchmarks 上,壓到128 tokens之後仍保留94.7%原始表現,推理速度提升到1.92×。這類數字最適合需要在有限 GPU 記憶體內跑 3D VLM、又不想為加速重新訓練整個模型的研究團隊;代價是目前公開重點仍集中在推理與評估,Hugging Face 權重與更完整版本例如 3DZip++ 仍未釋出。

  • 免訓練設計,重點在於直接壓縮 projection-based 3D VLM 的 token 成本
  • 與 2D token compression 不同,3DZip 同時處理空間結構同特徵多樣性
  • 已公開 LLaVA-3D 的 inference 與 evaluation code,較適合研究與基準比較
  • 128 tokens 仍保住 94.7% 原始表現,推理速度可達 1.92×
  • 現階段較像演算法模組,未見完整產品化封裝

項目主頁 · GitHub

Categories: 開源, 3D, 多模態模型, 視覺模型, 框架

DEFT-RLVR 用延後曝光減少自動駕駛 VLM 誤判

自動駕駛 Vision-language-action models 唔少都會被正確軌跡「提示」到答啱。DEFT-RLVR想處理的,正是這種看似會推理、其實先知道答案的偏差。

Ground-truth trajectory exposure can induce post-hoc rationalization and hallucination.

自動駕駛 Vision-language-action models 一旦在推理前先見到真實未來軌跡,很容易把答案合理化,卻未必真係根據場景作判斷。DEFT-RLVR 屬於訓練與驗證框架項目,核心是把「先看場景作決定」同「之後再對照候選軌跡」拆開,減少 trajectory anchoring bias。

它的做法唔係直接生成開放式座標,而是先用 AD-MCQ 把規劃問題改成多選題,再用 DEFT 兩階段流程處理:模型先做 candidate-blind scene reasoning,之後先見到候選軌跡再揀答案。這種設計的好處,是答案可被精確核對;代價則是任務表述被收窄到候選集合之內,較接近「可驗證決策」而唔係完整路徑生成。

  • 針對的不是感知本身,而是推理監督被答案污染的問題
  • AD-MCQ 保留 braking、speed 同 lateral geometry 等差異,方便精確評分
  • DEFT-RLVR 用 GRPO 聯合優化,並且可選用 rubric 監督推理過程
  • RL 階段直接由 base VLM 開始,毋須 cold-start SFT
  • 模型採用 Qwen3-VL

部署門檻不算低。項目要求另行安裝支援 CUDA 的 vLLM,Waymo codebook reconstruction 還要額外用 Python 3.9 的 autovla waymo py39 環境;預設 recipe 亦明顯偏向大型多 GPU 節點,小型設備需要自行調整 tensor parallelism、batch size、sequence length 同 offloading。

目前公開資訊顯示,它在 AD-MCQ-500 上同時提升 trajectory selection 與 candidate-blind reasoning,較穩妥的判斷是:這套方法對研究自動駕駛 VLM/VLA 訓練可靠性、想避免「先知答案再解釋」的團隊尤其有參考價值;要落地到更開放的真實規劃流程,仍要看候選軌跡構建與算力成本能否接受。

GitHub

Categories: 開源, NVIDIA, Python, 多模態模型, 視覺模型, VLA

Page 1 of 17
1 2 3 17