Sana 把高解像生成壓到快 100 倍

logo

高解像圖片同影片生成最常見的卡位,不是效果做不到,而是算力、延遲同部署成本太難接受。NVlabs/Sana 屬於生成模型代碼庫,集中處理這個矛盾:在維持高解析輸出的前提下,把訓練與推理做得更省、更快,並且一路延伸到圖片、影片、世界模型等多條分支。

這個項目唔係單一模型,而是一個家族。SANA 主打最高到 4K 的 text-to-image,README 直接給出「比 Flux-12B 細 20 倍、快 100 倍」的定位;SANA-1.5 進一步處理訓練期與推理期的 compute scaling;SANA-Sprint 則把重點放在 one/few-step 生成,官方數字提到 H100 上 1024px 圖片可做到 0.1 秒級。取向很清楚:不是一味追最大模型,而是用效率換取更可部署的生成流程。

影片部分同樣值得留意。SANA-Video 與 SANA-Video 2.0 把焦點放在 720p 長序列生成,做法上用 hybrid linear attention 配合 Attention Residuals,目的是減少 full-softmax attention 的成本,同時盡量保住畫質與長序列表達能力。公開資料提到 SANA-Video 2.0 在單張 H100 上,720p/5 秒影片可做到 13.06 秒,VBench 總分 84.30,也強調比 Wan 2.2 14B 有大幅速度優勢,但這類數字仍要連同硬件、步數與設定一齊理解。

  • 同一庫內含 SANA、SANA-1.5、SANA-Sprint、SANA-Video、SANA-WM、SANA-Streaming、Sol-RL
  • 提供完整 training 與 inference pipeline,唔止展示模型效果
  • 可透過官方 demo、Hugging Face、ComfyUI 整合去理解生成表現與部署方向
  • 重點不是極限參數量,而是高解像生成的速度、成本同可擴展性

部署與測試路線相對清晰:已有官方文件、網頁 demo、Hugging Face 集合,亦見到 ComfyUI、SGLang、Replicate 等接點,代表它較適合研究團隊、影像工作流開發者,以及想把高解像生成放進產品流程的人。 SANA-WM 的 2.6B controllable world model、6-DoF camera control,同 Sol-RL 的加速收斂能力,則顯示這個項目不只做靜態出圖,而是朝更完整的生成系統推進。

項目主頁 · GitHub

Categories: 開源, NVIDIA, ComfyUI, Stable Diffusion, Video, Image, AI productions, txt2img, 模型訓練, 世界模型

Color Pass-Through 重新做色彩校準

Color Pass-Through teaser

想像你透過手機或頭戴裝置睇現場畫面,明明場景喺眼前,畫面顏色同亮度卻總有一層隔膜。Color Pass-Through 針對的正正係呢種 camera-display 不一致:它屬於影像處理研究項目,以端到端方式學習固定裝置上的 camera-display 路徑,目標唔係單獨校正相機或螢幕,而係令人經過裝置觀看時,感知上更接近真實場景。

作者明確反對傳統 ICC workflow 呢種兩段式校準範式。舊做法會先分開處理相機同顯示器,再靠預先定義的中介色彩空間接駁,誤差容易逐步累積;Color Pass-Through 改為直接學完整投影路徑,並為每位觀察者做 one-step calibration。呢個取向的好處係更貼近人眼最終見到的結果,代價就係它依賴特定 device pair,同時帶有 observer-specific 設定,泛化方式同傳統標準化流程唔一樣。

目前公開資訊顯示,項目已放出完整 training and inference pipeline,並提供兩款支援裝置的 pretrained checkpoints,所以較合理的理解方式係:它首先係研究原型,其次先係可重現的程式碼。資料集仲準備公開,Android toy example 亦仍在開發中,部署重點暫時仍然放喺已支援裝置上重現論文結果,而唔係即插即用地套入任何手機。

  • 核心改動係把 camera 與 display coupling,唔再經固定中介色域分開校正
  • 以每位使用者一次校準換取更貼近主觀觀感的色彩與亮度表現
  • 人類評分提升 +2.0 分(5 分制),亮度 4.32/5,色彩 4.03/5
  • 定量結果亦有明顯優勢,PSNR、ΔE、STRESS 在兩款商用手機上都優於列出的基線

同類方法很多時會加強 white balance、ColorChecker mapping,或者在既有 ISP 後面再補一層修正;這個項目則直接把問題重寫成特定裝置、特定觀察者的整體感知重建。對做 AR/VR pass-through、顯示校準、計算攝影研究的人最有參考價值,尤其當重點唔係標準色彩流程有幾完整,而係人眼最後見到的畫面到底似唔似真景。

項目主頁 · GitHub · Paper

Categories: 開源, 香港中文大學, 華為, 模型訓練, 蘋果, Dataset 數據集

TrajLoc 把路線描述對準衛星圖

A trajectory can be queried as dense video or as abstract language — both retrieve the same satellite tile.

只靠一張街景相去配對衛星圖,遇到轉彎、路口相似、視角受限時好容易失手;TrajLoc改為追蹤整段移動路線,將街景影片、自然語言路線描述,或者兩者結合後對應到帶地理標記的衛星瓦片。它屬於跨視角 geo-localization 模型連同 benchmark 項目,處理的是「把連續路徑準確放回地圖」這個問題。

現有 cross-view 資料多數停留在 single-image、video-only 或 text-only 範式,作者認為這樣會拆散同一條路線入面本來互相補強的時序線索與語意線索,因此一併推出 SeqGeo-VL。呢個 benchmark 收錄 38,863 組對齊的 video-text-satellite triplets,並有 91.8% human verification pass rate,重點不是再加大資料量,而是把 sequential 同 linguistic 兩種證據放入同一任務。

TrajLoc沒有另起一套龐大時序架構,而是由 pretrained CLIP ViT-L/14 延伸成 video、text 同 satellite encoders,再用 co-training curriculum 將三種查詢模式放入同一個表示空間。作者另外加入 TrajMod,將路線幾何資訊 tau={(Δx_i, Δy_i, θ_i)} 轉成 FiLM 的 scale/shift 參數,直接調節 query embedding;做法比單靠提示詞更明確,亦保留 frozen encoders 的可重用性。

  • 支援 video、plain language、video+text 三種查詢方式
  • SeqGeo-VL 是首個同時包含 sequential 與 linguistic cross-view benchmark
  • TrajMod 只用 waypoint offsets 與 headings,不靠 map 或 POI metadata
  • 項目提供 agent-ready tool interface、persistent Python API 同 JSON CLI

從示範與說明看,TrajLoc的定位很清楚:它不是通用多模態聊天模型,而是給 spatial reasoning、戶外機械人、導航研究同 multimodal agents 調用的專門工具。225 ms 的示例檢索速度對互動式流程有吸引力,但目前公開資訊主要集中在 benchmark 與檢索能力,部署前仍要留意資料覆蓋範圍、地區泛化,以及自己的工作流是否真有影片或路線文本可供查詢。

項目主頁 · GitHub · 模型

Categories: 開源, Qwen, Agentic, API, Video, Image, AI productions, Embedding, Python, 多模態模型, 模型訓練, Dataset 數據集

Self Gradient Forcing 補長影片一致性缺口

Self Gradient Forcing teaser

生成影片拉長到幾分鐘之後,角色樣貌、鏡頭方位同場景佈局愈來愈唔穩,往往不是畫質問題,而是模型早段寫入的歷史記憶愈來愈幫不到後面幀。Self Gradient Forcing(SGF)屬於訓練方法項目,核心是替自回歸影片擴散模型補回一段原本缺失的 context-gradient path,處理 long-video extrapolation 時常見的 identity drift、scene break 同 temporal instability。

作者點名現有做法多建基於 Self Forcing:模型用自己 rollout 出來的歷史作訓練,的確能減少 exposure bias,但 historical key-value cache 在後續生成裡只是 frozen rollout state,未能讓未來幀的損失回頭教早前的記憶應該怎樣寫得更有用。SGF 的做法是 bounded two-pass replay,第一輪先照推理方式無梯度 rollout,第二輪只重建抽樣步驟所需的 context-gradient,避開完整長序列反向傳播的成本,同時保住 causal memory 的可訓練性。

項目現時已放出訓練碼、推理碼同 checkpoint,底層接到 Wan2.1-T2V-1.3B 與 Wan2.1-T2V-14B,亦依賴 Causal-Forcing 的初始化權重。配置分成 framewise 同 chunkwise 兩路,預設推理可生成 963 個 latent frames,解碼後約 240 秒、16 fps,環境足夠時會用 8 GPUs,否則退回單卡串行生成;這個門檻說明它較接近研究與算力密集型內容生產流程,而不是輕量即開即用工具。

  • 針對 Self Forcing 的 historical context-gradient gap,而不是單純調參延長影片
  • 用 bounded two-pass replay 補監督,取捨在於訓練更複雜,但比全序列回傳梯度更可控
  • 同時提供 framewise 與 chunkwise 設定,方便比較不同長片生成路線
  • 依賴 Wan 基座模型與 Causal-Forcing 初始化,部署前要先備好對應權重

就已公開描述來看,SGF 的價值不在另起一套全新生成架構,而是在保留 native autoregressive training objective 的前提下,修正自生成記憶無法被未來損失有效監督的缺口。對研究 long-horizon video generation、需要單一 prompt 與 seed 維持數分鐘敘事一致性的團隊,這個項目有相當清晰的參考價值。

項目主頁 · GitHub · Paper

Categories: 開源, Video, 模型訓練, 視頻模型

SeededGrasp 用自然語言指揮機械人精準抓取雜亂物件

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments teaser figure

當桌面堆滿不同物件,機械人要聽得明「拎紅色杯旁邊嗰支筆」這類指令,難處不只在辨認物件,仲要同時算準 3D 空間位置同抓取角度。SeededGrasp 針對的正是這類語言引導抓取場景,重點不是端到端硬推整個動作,而是先找對目標,再生成穩定抓取姿態。

它的做法相當清晰:先用預訓練 Vision-Language Model(VLM)把文字指令轉成影像中的 2D 種子點,再投影到 3D 點雲,交給輕量的 flow-matching grasp model 產生 6DOF 抓取姿態。這種拆分方式把高層語意判斷同低層幾何執行分開,減少重新訓練整個系統的成本,也較容易支援多種 embodiment。

相比直接由 VLM 預測抓取,SeededGrasp 保留語言理解的直觀操作,同時補回空間推理不足;相比把 VLM 同抓取模型一併訓練,它對語言標註資料與算力的需求更克制。團隊亦公開多 embodiment 桌面抓取數據集,包含超過 2.56M 個 cluttered scenes 抓取姿態,涵蓋 Franka Panda、Allegro Hand 同 Robotiq 3-Finger。

  • 用簡單文字指令指定目標,適合雜亂桌面抓取情境
  • 以 2D 種子點連接 VLM 與 3D 抓取生成,降低端到端訓練負擔
  • 支援多種 embodiment,不限單一夾爪或手型
  • 公開 2.56M grasp dataset,補足多 embodiment 訓練資源
  • 模擬成功率達 72%,真實環境抓取實驗達 78%

對機械人操作、語言介面同 grasp planning 有興趣的讀者,會較容易感受到這個項目的價值:它沒有把所有問題塞進同一個大模型,而是用較節制的架構處理語意與幾何之間的落差。現階段重點仍在桌面雜亂場景抓取,但它已經展示出多 embodiment 擴展同資料效率上的實用方向。

項目主頁 · Paper

Categories: Google, 3D, 多模態模型, 模型訓練, 視覺模型, Robotic, 框架, Dataset 數據集

RIPO 直指 LLM 強化學習探索崩塌

Repository image for Aiolus-X/RIPO

訓練 LLM 做長鏈推理時,最麻煩的不只是算力,而是策略很容易愈學愈保守,最後卡在少數高機率答案附近。RIPO 屬於一個面向 LLM 強化學習的演算法研究項目,針對的正是 PPO-Clip 在後訓練階段常見的 exploration collapse,想解決罕見但關鍵動作愈來愈難被探索到的問題。

作者沒有沿用「再補幾個 heuristic」的路線,而是直接指出舊範式的核心錯位:PPO-Clip 以 Euclidean metric 量度 policy discrepancy,但 policy 本身更貼近一個 Riemannian manifold。呢個幾何不一致會令低機率區域更新過份保守、高機率區域又過份進取,最後令探索能力收縮;Riemannian Isometric Policy Optimization(RIPO)則改為追求等距的 policy update,嘗試同時守住 exploration 與 exploitation 的平衡。

論文描述中,RIPO 另一個重點是 bias-variance trade-off 較理想,令優化過程更穩定。成效方面,它在七個 competition-level benchmarks 上都優於既有 LLM RL algorithms,當中對 GRPO 在 AIME24 的提升最高可達 60%;這類結果相當吸引,但仍然要留意 benchmark 與訓練設置是否能完整轉移到你手上的模型與資料。

  • 核心批評很明確:PPO-Clip 的幾何假設不適合 policy update
  • 方法重心不是加獎勵技巧,而是重寫策略更新的度量方式
  • 對數學推理、長時序決策這類要靠探索找到解法的訓練場景較有價值
  • 成績亮眼,但更適合有能力重跑 benchmark 與訓練流程的研究團隊驗證

從提供的 GitHub 資訊看,儲存庫描述混入了 verl 這個 RL training library 的內容,因此閱讀與部署前要先分清:RIPO 是演算法與論文方向,verl 則較像承載 LLM RL 訓練流程的開源基建。較合理的理解方式,是把 RIPO 視為可整合進現有 LLM RL framework 的新策略更新方法;真正落地通常要配合既有訓練庫、GPU 叢集配置,以及像 GRPO、PPO 一類後訓練 dataflow 一起測試。

GitHub · Paper

Categories: 開源, 字節跳動, OpenAI, , 模型訓練, Anthropic, 清華大學, 框架, Dataset 數據集

Trace 用可驗證資料重做視覺推理訓練

trace mark

很多視覺推理資料集都只交付圖片同答案,模型答啱咗,未必代表推理過程真係站得住腳。Trace把重點放在可驗證 post-training:它屬於一個資料集兼生成環境,針對的問題是怎樣穩定產生 grounded visual-reasoning 任務,並且讓答案、標註與驗證流程互相對得上。

它採用一條很清晰的生成路線:domain → scene grammar → task program。現有做法常見是先有人手整理題目,或者由圖像與文字鬆散配對,再用最終答案做監督;Trace則用 deterministic seed 先建立 semantic scene state,再由 task program 從同一個狀態推導 typed answer、verifier state,最後才渲染圖片與提示。這種 shared-state 設計的分別,在於題目不是「生成完再補標註」,而是從源頭就把圖像、問題、答案同 execution trace 綁定。

對研究團隊來說,這個取向很有吸引力,因為它同時照顧訓練、檢查同重播。每個例子除了 image、prompt、typed answer,還有 image-space annotation、verifier metadata 同 execution trace;對想做 RLVR、後訓練驗證,或者想分析模型到底錯在觀察、計算還是規則理解的人,資料密度比一般 benchmark 高得多。

  • 收錄 11 個 visual domains、277 個 scene grammars、1,000 個任務
  • 已公開 66,000 個 generated examples,亦提供 Hugging Face dataset 與模型檢查點
  • 驗證不只看最終答案,還保留 verifier state 與 replayable execution trace
  • 以 Qwen2.5-VL-3B、Qwen2.5-VL-7B 做 post-training,兩個尺度都有明顯提升

數字上,它在 2,000 個未見過、但由同一批 task programs 生成的新例子上,將 Qwen2.5-VL-3B 由 24.45 提升到 41.05,Qwen2.5-VL-7B 由 34.25 提升到 51.55。這些結果首先說明 Trace對同分佈泛化有幫助;首頁亦提到用 64,000 個 Trace instances 訓練後,對 24 個外部 benchmarks 的 macro-average 也有改善,但摘要資訊未列完整分項,解讀時仍要看原始報告。

Trace最適合被理解為一個用來建構可核對視覺推理訓練資料的基礎項目,而不只是另一個出題庫。它的取捨也很明確:換來高度可驗證與可重播,代價是任務分佈由 scene grammar 同 task program 明確界定,較適合研究訓練方法、評測設計同模型行為分析,未必等同自然世界的開放式視覺理解。

項目主頁 · GitHub · Paper

Categories: 開源, Qwen, DeepSeek, Image, 多模態模型, 模型訓練, Dataset 數據集

xHC 點樣把 Transformer 殘差流擴到 16 路

xHC architecture overview

當 Hyper-Connections (HC) 想再往上加殘差流數量,卡位唔係理念,而係成本同資訊開始重複。xHC 屬於模型結構研究項目,針對 Transformer residual stream 擴展到更多平行 streams 時,點樣避免效益遞減同計算量暴增。

xHC 唔係把所有 streams 都密集更新,而係保留對全部 N=16 streams 的讀取,再只對 k=4 個 active streams 做稀疏更新。咁樣一來,HC-family 在 N>4 時常見的 O(N^3C) residual-mapping 成本,被壓到 O(k^3C);另一邊再用 temporal feature augmentation,補回單一 write-back vector 餵唔飽多路 streams 的問題。

xHC 是首個在 HC-family 裡面把有效擴展推到 N=16 的做法,主打場景係想喺 width、depth 之外,再增加一條 memory-scaling 軸。對研究 Transformer 架構、訓練大模型,或者想理解稀疏更新點樣換取更高擴展性的團隊,呢個項目有參考價值;而 xHC-Flash 則進一步為部署考慮,透過跨連續 sublayers 共用 full-state 運算,減少 memory traffic。

  • 模型結構,處理的是 Transformer 殘差流擴展到多路後的效率與有效性問題。
  • 主要差異在於「全量讀取、局部更新」;唔係盲目加 streams,而係控制真正需要更新的路數。
  • temporal feature augmentation 用 causal depthwise convolutions 提供多尺度局部特徵,令新增 streams 冇咁易變成冗餘。
  • xHC-Flash 反映項目唔只停留喺理論設計,而係有顧及較大規模訓練同部署時的記憶體流量。

重點放喺 18B scale 的訓練損失與下游表現。數字細節未在片段中完整展開,但方向很清楚:xHC 想證明,殘差流可以擴得更闊,而且唔需要用成倍密集更新去換。對關注模型結構創新的人嚟講,它最值得睇的地方唔係單一 benchmark 分數,而係把 HC 與 mHC 推過 N=4 之後,仍然維持可計算、可擴展。

GitHub · Paper

Categories: 開源, 模型訓練, Dataset 數據集

[入門教學文章]一文搞懂 CNN、RNN 與 Transformer

Og image

學深度學習最容易卡住的位置,往往不是模型太難,而是聽過 neural network、Deep Learning、CNN、RNN、Transformer,腦入面仍然分唔清邊個處理影像、邊個擅長序列、邊個適合長距離內容關係。這篇文章屬於入門教學,重點是用 mental model 幫讀者建立直覺,而不是一開始就掉出一堆數學式。

內容先把 AI(Artificial Intelligence)、ML(Machine Learning)同 Deep Learning 的層次關係講清楚,再解釋 neural networks 點樣透過多層表示學習資料特徵。文中亦提醒一個常見誤解:Deep Learning 入面的「deep」主要是指層數夠多,並不是指模型真的像人腦那樣理解世界。

之後的重點放在三類常見架構之間的差異:CNN 適合由局部特徵逐步組合出整體理解,常見於影像;RNN 會按次序處理資訊,較貼近文字或時間序列;Transformer 則更重視整段內容之間的關聯,成為近年自然語言處理與多模態模型的重要基礎。對初學者來說,這種比較方式比單獨背定義更容易入手。

  • 用直觀方式整理 Deep Learning 與 neural networks 的基本概念
  • 把 CNN、RNN、Transformer 放在同一條線上比較用途與取向
  • 強調模型強項來自資料處理方式,而不只是名稱不同
  • 文章亦提到 Keras,方便之後進一步動手建立模型

引用模型:CNN、RNN、Transformer。整體來說,這項內容適合剛接觸深度學習、想先建立整體地圖的人閱讀;有少量 Python 基礎會更易銜接到 Keras,但就算未寫過模型,也能先用它釐清觀念。

項目主頁

Categories: Python, 教學, 模型訓練, 深度學習, Dataset 數據集

UniVR:視覺推理訓練變成可控工作流

UniVR Overview

UniVR 係一個能理解我們視覺空間中的思考方式及其在統一視覺推理中的應用,它針對 Emu3.5 unified generative models 的訓練框架,處理的是視覺推理、長程規劃同結果判斷點樣一齊學。它唔係拿來直接做推理展示,而係俾你用自己的資料同獎勵訊號,去微調一個已經懂得處理圖像與文字的底座模型。

SFT(supervised fine-tuning)階段要提供統一格式的樣本:query image、textual instruction、visual reasoning trajectory;RL(reinforcement learning)階段則改成透過 HTTP reward server 送回分數。原始資料沒有提供完整安裝流程,所以目前可確定的只有要把自定義 PyTorch Dataset 接入 UniVR_SFT/train.py,以及把 reward function 換成自己的服務。

和一般只做單次微調的做法相比,UniVR 的取向更偏向「先教格式,再用獎勵修正推理」。它在 RL 端用 GRPO,並配合 HybridEngine 與 Emu3.5 的 vLLM patch,強調 rollout 效率;同時保留 LoRA 同 full-parameter training,適合資源與改動幅度唔同的團隊。

  • 支援多節點 SFT,兼容 LoRA 同 full-parameter training
  • RL 端基於 verl,同 GRPO 搭配自訂 HybridEngine
  • Emu3.5 的 vLLM no-CFG parallel inference 可做到約 2 倍 throughput
  • 獎勵設計分成 format reward、global reward,同 step-level 的視覺推理約束
  • 相關模型包括 Emu3.5 同作為評分器的 Qwen3-VL-30B

較容易受惠的情境包括做視覺代理、機械臂/操作規劃、長程任務推理,或者想將現成視覺模型轉成自己工作流的團隊。它的價值在於把「資料格式、推理軌跡、獎勵判斷」串成同一條訓練路線,令視覺任務唔再只靠靜態標註去學。

項目主頁 · GitHub · Paper

Categories: 開源, Qwen, 字節跳動, Gemini, DeepSeek, OpenAI, Image, Python, 多模態模型, 模型訓練, Dataset 數據集

Page 1 of 14
1 2 3 14