Agent Lightning v1.0:把代理訓練接回真實工具流

Agent Lightning v1.0 讓代理在保留工具、上下文和環境的情況下直接訓練。它也把 Kubernetes、程式編寫和獎勵防作弊流程一併整合起來。

logo

Agent Lightning v1.0 針對一個常見卡位:代理訓練往往要靠額外沙箱或改寫流程,令工具、控制流和環境脫節。這個項目把訓練直接接回真實 agent harness,代理可以經由 Agent Lightning v1.0 proxy 運作,而不用改動原本架構。

它的設計取向相當清晰,核心程式碼大約 3,500 行,重寫後把複雜度壓低。代理亦可直接作為 Kubernetes Jobs 執行,不必依賴外部 sandbox 服務,對要跑長時間 rollout 或分散式訓練的團隊會方便很多。

文檔同時提供完整的 coding-agent 訓練流程,涵蓋資料清理、reward-hacking 防護和訓練腳本。這代表它不只停留在概念層面,而是把一條可落地的訓練管線交到使用者手上。

  • 保留工具、上下文、控制流和環境在訓練迴圈內
  • 透過 proxy 接入現有 agents,減少改動成本
  • 原生支援 Kubernetes Jobs,部署更直接
  • 提供 coding agent 範例,連資料清理和防作弊流程都包進去
  • 適合做具互動工具、程式執行或多步推理的 agent 訓練

項目主頁

Categories: 開源, 微軟, DeepSeek, Agentic, API, Python, Vibe Coding, 模型訓練, 編程

GRNEdit 用少量參數做通用影片編輯

想改影片風格、背景或局部內容,又唔想整段重生成,GRNEdit 提出一條較慳參數的路線。它把可編輯範圍先用 binary evidence 拆清,再逐步細修畫面。

Xidian University

一段影片要改風格、換背景、刪走局部人物,最難通常唔係生成新畫面,而係改得準之餘,原本動作、主體身份同未編輯部分都要保持穩定。GRNEdit 屬於影片編輯框架,處理的正是這類通用影片編輯問題,而且走的是 Generative Refinement Networks 配合 binary evidence 的路線,不是靠大幅加參數去硬推效果。

GRNEdit 先用 binary evidence 分開哪些區域應該被改、哪些內容要盡量維持,之後再沿住 refinement 過程逐步生成目標語意、結構同細節。這樣做的取捨,在於它把編輯能力壓縮到相當輕量的增量上;公開資訊表示,相對 GRN backbone 只增加少於 3% 額外參數,但聲稱可跟領先的影片編輯模型競爭。

從示例看,GRNEdit覆蓋 global style、背景替換、local removal、加入新元素,以及移除字幕等多種任務,重點不是單一特效,而是同一套框架處理不同編輯指令。較適合研究影片生成、內容製作流程,或者想把多種編輯模式收斂到同一模型系統的團隊參考;不過目前公開內容仍以推理程式碼和預印本為主,training code 與 model weights 都未提供,部署與重現門檻仍然存在。

  • 以 binary evidence 先界定可編輯範圍,再逐步 refinement
  • 相對 GRN backbone,只需少於 3% 額外參數
  • 同一框架支援風格化、換背景、移除、添加與複合編輯
  • 公開資料主打推理與結果展示,完整訓練與權重尚未釋出

模型權重暫未開放,但有足夠資訊足夠理解它的方法定位。對關注影片編輯模型的人來說,GRNEdit最有意思的地方,是它把「改動範圍判定」放到生成前段處理,嘗試用更小的參數成本換取更穩定的時序保留與更通用的編輯能力。

項目主頁 · GitHub

Categories: 開源, 模型, 模型訓練, 視覺模型, 視頻模型

MOSS-VL 多模態模型系列,致力於實時視覺理解。

MOSS-VL 針對直播式影片理解而來,讓模型邊看邊答,不再只靠看完才回應。它同時提供即時、離線與基礎三個版本,適合不同工作流。

MOSS-VL

MOSS-VL 是一組 video-language model,核心解法是把長影片理解從「先看完再回答」改成連續影片流上的即時對話。MOSS-VL-Realtime 會在收到新畫面時同步做感知與文字生成,遇到資訊不足時還會先保持沉默,等場景有變化再回應,這比一般離線影片模型更貼近直播、監控和互動式分析的需要。

項目的三個版本分工清楚:MOSS-VL-Realtime 主打串流互動,MOSS-VL-Instruct 偏向離線長影片理解與深入對話,MOSS-VL-Base 則提供可再訓練的基礎表示。三者都屬於 11B 參數的 open-weight 模型系列,架構上採用 unified cross-attention,重點不是單純堆大,而是把影片、問題和回答放進同一條流裡處理。

  • 支援任意時間點提問,適合直播解析、即時巡檢與互動式看片
  • 會主動等待關鍵事件,再決定是否開口,減少過早下結論
  • 新畫面一到就可修正先前回答,較適合連續變化的場景
  • MOSS-VL-Instruct 適合長影片分析,MOSS-VL-Base 適合延伸訓練
  • 官方資訊有 Hugging Face、ModelScope、Web demo 與論文連結,但原始資料未提供完整本地安裝流程

同類做法多數仍是離線式理解,先把影片看完才輸出答案;MOSS-VL-Realtime 則把回應插進觀看過程,連延遲和中途修正都納入設計。這種取捨對需要即時判讀的團隊更實用,尤其是做影音監察、現場助理、互動式多模態應用,或要在長影片上做持續問答的情境。

項目主頁 · GitHub · 模型

Categories: 開源, Video, 多模態模型, 視覺模型

TRACE-Bench 拆解多參考生圖失誤來源

多張參考圖生成得似,未必代表每個要求都做對。TRACE-Bench把失誤拆成可追蹤能力,方便看清模型真正卡在哪裏。

Og image

生成圖片時同時引用多張參考圖,最難的地方往往唔係畫面夠唔夠完整,而係模型有冇準確保留指定主體、抽出正確屬性,再綁到啱嘅目標上。TRACE-Bench屬於 Multi-Reference Image Generation Benchmark,處理的正是這類「成品看似合理,但細節要求逐項出錯」的評估問題。它不再只用一個總分判斷好壞,而是把每條提示拆成可追蹤的能力步驟,讓研究者知道錯誤發生在身份保留、屬性抽離、屬性綁定,還是多元素構圖。

這個基準最核心的做法,是用四個原子操作統一資料建構、評分與診斷流程:Anchor負責鎖定並保留參考主體的身份特徵,Disentangle負責把某個屬性從原本載體抽離,Apply負責把抽出的屬性自然地套到指定目標,Compose則負責在空間、關係或整體場景限制下安排多個內容。TRACE-Bench把每個 prompt 表達成 compositional formula,令多參考生成不再只按「風格轉移」或「主體組合」這類粗分類來看,而是按能力需求逐層拆解。

它和常見 benchmark 的差異,在於評估單位由任務類型改成能力組合。原有做法容易出現覆蓋不足、案例難度難比較、失敗原因不透明等問題;TRACE-Bench則把同一套公式結構用於案例生成與對齊評分,並要求參考資訊有精準 grounding。資料規模方面,這個 benchmark 約有1,600個 evaluation cases、631個公式模板、約4,000張 reference images,覆蓋1至8個 operator slots,並評估了9個領先模型。現有結果顯示,真正的瓶頸主要落在 attribute disentanglement 同 binding,不是單純的場景級 composition。

對模型研究、影像生成工作流設計,甚至要挑選評測方法的團隊來說,TRACE-Bench的價值在於它能把「生成得唔錯」這種籠統印象拆成具體能力地圖。當案例失敗時,它還會用遞迴簡化方式做 diagnosis,逐步定位干擾來自哪一個參考需求。對於想改進多圖條件生成、測試 reference-following 能力,或者分析模型為何經常把屬性套錯對象的人,這種可追溯結構比單一總分更有用。

  • 用四個操作符描述多參考生成:Anchor、Disentangle、Apply、Compose。
  • 每個 prompt 都可寫成 compositional formula,方便控制複雜度與對齊評分。
  • 約1,600個案例涵蓋1至8個 operator slots,資料來自約4,000張參考圖。
  • 九個模型的評估結果指出,屬性抽離與屬性綁定比場景構圖更常成為瓶頸。
  • 原始資料聚焦 benchmark 設計與診斷方法,未提供一般讀者可直接下載或部署的完整使用流程。

整體來看,TRACE-Bench不是再增加一批「看圖感覺差不多」的測試題,而是把多參考生圖最難處理的依賴關係寫成可分析、可比較、可回溯的結構。當模型要同時記住誰是誰、哪個屬性要抽出、又要套到哪個實體上時,這套方法更能反映能力上限與失誤模式,也讓後續改進有更清晰的落點。

項目主頁

Categories: Image, AI productions, Dataset 數據集, 框架

[技術文章] Google DeepMind 用機器學習再推低矩陣乘法指數

呢篇研究唔係做新模型產品,而係用現代優化方法改寫數學證明入面最難解的一步。結果把矩陣乘法指數上界再推低少少,但背後代表這種優化已開始反過來幫理論電腦科學。

Hero image preview

由訓練大型模型到即時圖像運算,矩陣乘法都係底層最常見嘅核心操作,所以研究者一直想知道:計算兩個大型矩陣,理論上到底可以快到乜程度。呢篇來自 Google DeepMind 嘅論文,集中處理嘅唔係新硬件或者新程式庫,而係證明矩陣乘法上界時最關鍵、亦最難求解嘅優化問題,最後把矩陣乘法指數 omega(ω)嘅最佳已知上界,由 2.371339 改寫到 ω < 2.371177

現有做法過去四十年幾乎都建基於 laser method,而最新一輪進展主要依靠 combination loss analysis。作者指出,呢條路線嘅瓶頸唔係概念本身,而係當中需要解一個極大規模、而且屬於 non-convex optimization 嘅問題;參數一多,搜尋空間會急速膨脹,令更高設定難以處理。今次嘅改動,正正係把原本嘅優化問題重新表述,令求解器可以踏入更大嘅設定範圍,再配合以 Jax 實作嘅 gradient descent 與硬件平行化,把原先主流結果使用嘅最大遞迴層級由 ℓ = 3 推進到 ℓ = 4。

呢個差異不只是多試一層咁簡單。作者提到,當 ℓ* 由 3 升到 4,可優化參數數量會由大約 2.5 萬暴增到 700 萬,代表舊有方法難以負擔嘅搜尋空間,作者改用現代機器學習優化技術後開始變得可行。單靠呢套 gradient-based 方法,已經比前一個 state-of-the-art(SOTA)上界再前進約 0.97 × 10^-4;之後再用 AlphaEvolve 進一步改良優化演算法,增幅擴大到約 1.62 × 10^-4。

文章入面最值得技術讀者留意嘅,係佢展示咗一種幾具代表性嘅研究方向:機器學習不只是拿來做預測模型,亦可以直接介入數學與理論電腦科學入面高難度嘅搜尋與證明流程。作者處理嘅核心結構,仍然圍繞 Coppersmith-Winograd tensor、遞迴分解樹、分佈參數同可行解驗證,但真正令結果向前推進嘅關鍵,在於把呢些原本難以手動或傳統數值法有效搜索嘅自由度,交畀較大規模、可平行化嘅優化程序去探索,最後再對得到嘅 omega 上界做嚴格認證。

  • 研究焦點係 combination loss analysis 入面嘅非凸優化問題,唔係推出新應用產品。
  • 作者重新表述優化問題,令求解可以由 ℓ* = 3 擴展到 ℓ* = 4
  • Jax 配合 gradient descent 與硬件平行化,處理由約 2.5 萬升到 700 萬嘅參數規模。
  • 再用 AlphaEvolve 微調優化演算法,把最新已知上界推到 ω < 2.371177
  • 呢項成果最適合理解為「用現代優化幫理論證明前進」,而唔係直接改變一般軟件今日可見嘅運算速度。

最受用嘅讀者會係關心理論電腦科學、數值優化、機器學習方法點樣反哺基礎研究嘅人。重點係如何把大型優化程序嵌入 computer-assisted proof,並以嚴格方法確認所得上界。對研究者而言,價值唔止於再減細一個小數位,而係證明咗現代 optimization 同 AlphaEvolve 已經可以成為推進數學界限嘅有效部件。

Paper

Categories: Google

HarnessEval-W 讓世界模型評測留下可核查推理鏈

世界模型評測不再只給一個分數,HarnessEval-W把每次判斷拆成可追溯的證據樹,讓物理與因果錯誤更容易核對。

HarnessEval logo

當世界模型生成一段互動場景,真正難判斷的往往不是畫面是否漂亮,而是物理、因果和世界狀態有沒有隨行動正確演變。HarnessEval-W 屬於開源的 agentified benchmark,實際處理的是如何把這些需要理解上下文的評測工作,轉化成可檢查、可重現的判斷流程。

它借用 Large Language Model(LLM)生態常見的 harness 思路,先按每個 evaluation case 的初始世界、action 和 probe intent 分解問題,再由具備不同工具與上下文的 specialized sub-agents 分工判斷,最後由 parent agent 驗證證據並整合 verdict。每次評測都會留下 evidence tree,記錄測試內容、視覺依據和完整推理鏈,研究團隊可以追查分數由何而來,而不是只接受一個難以解釋的 scalar score。

  • 支援 330 個 evaluation cases、5,940 次 scored rollouts
  • 以 11 個 specialized evaluation skills 覆蓋品質、轉換與持續性
  • 涵蓋 18 個 world models,並提供 leaderboard 與可執行評測程式
  • 包含 harnesseval-metrics,以及 physical-plausibility backend harnesseval-pavrm

HarnessEval-W 在 intentional transition 上與人類 Bradley–Terry ranking 的 Spearman correlation 為 0.93;physical transition 的 pairwise accuracy 達 71.7%,高於 WBench 的 31.9%。重複評測的結果範圍亦較 WBench 窄 4.9 倍,但這些數字仍取決於案例設計、技能路由和代理判斷品質,不能直接視為所有世界模型任務的通用排名。

項目提供固定 plans、benchmark 資源、metric backends 和可延伸的 skill library;團隊可以先重現既有 cases,再提交新世界、新 action、新 probe family 或新 skill。它較適合研究世界模型、建立可審計評測流程,或需要比較物理合理性與狀態持續性的團隊;對只想快速取得單一分數的測試流程而言,完整證據樹會增加運算與整合成本,但換來更清楚的錯誤定位能力。

項目主頁 · GitHub

Categories: 開源, Agentic, , 世界模型, Skill 技能, Dataset 數據集, 北京大學

PACE-Bench:專測機械環境變化下的自我演化能力

PACE-Bench 針對環境突變後的適應力做評測,重點不是能否第一次做對,而是能否把原本成功的設計改到再次通關。你可以把它理解成一個用物理模擬驗證自我修正能力的基準。

S-01 Bridge Construction: source design passes, fails after mutation, self-evolves, and passes the target environment

PACE-Bench 是一個用來測試自我演化 agents 的基準,核心問題是:當原本可行的 code-driven design 因為環境改動而失效,系統能否靠互動回饋把它改回可行。它更像是在驗證適應能力,而唔只是看一次性解題。

這個項目把 144 組 source-to-target 配對放入 6 類物理場景,要求 agent 先在 source 環境成功,再在 hidden mutation 後的 target 環境重新修正。每次修訂都要經過執行驗證,JSON 會保存,--save-gif 亦可記錄每次通過驗證的嘗試動畫。

同類評測多數固定執行條件,PACE-Bench 直接把變化放進任務核心,逼系統面對失敗後的再設計。它用 OpenAI-compatible endpoint 跑模型,--base-url--model--api-key--workers 這些參數都對應實際部署需要,較適合拿來接自家推理服務做批量評估。

從公開結果看,Reflexion 在 Pass@2 上領先,但 Tree-of-Thoughts 在成本效率更高,說明多做自我修正不一定換到更好的性價比。這類基準特別適合做具身智能、仿真控制、研究自我修正流程的團隊,用來檢查模型在新條件下是否真能靠回饋改對,而唔係只係記住舊解法。

  • 針對環境突變後的適應能力,不是單次解題
  • 以執行驗證驅動每次修訂,結果可重現
  • 支援接入 OpenAI-compatible 服務做評測
  • 結果顯示準確率與成本效率未必同步提升
  • 適合研究 self-evolving agents、控制與物理模擬

項目主頁 · GitHub · 模型

Categories: 開源, Qwen, Agentic, API, Dataset 數據集

[技術文章] pixel-space 模型可以追平甚至超過 latent-space 對應模型

研究聚焦 pixel-space text-to-image diffusion models 的訓練卡位,找出點樣喺大規模條件下兼顧畫質同速度。作者用 latent-to-pixel 策略,令 pixel-space 模型更接近甚至超過 latent-space 表現。

Hero image preview

上圖是透過 pixel-space text-to-image diffusion models 的方法訓練的 Z-Image-Turbo (Pixel) 產生的圖像。在企業級 H800 GPU 上,推理延遲僅約 0.2 秒。

Pixel-space text-to-image diffusion models 一直有兩個吸引位:直接生成像素,唔受 VAE 壓縮上限限制,亦可以省去解碼步驟。但喺大規模訓練下,佢哋收斂速度明顯慢過 latent-space 模型,令「畫質、效率、可訓練性」三者之間嘅平衡一直唔夠成熟。

呢篇工作針對嘅正係呢個落差。作者先比較 pixel-space 同 latent-space 喺大規模 pre-training 下嘅行為,再提出 latent-to-pixel 策略:先喺 latent space 學到生成先驗,再轉去 pixel space 做 post-training,避免一開始就喺難度更高嘅像素空間硬推。

佢哋亦系統研究咗多個轉換設計,包括 weight initialization、data composition、prediction target、decoder architecture 同 noise schedule,整理出一套可行做法。結果顯示,做法調整得當之後,pixel-space 模型可以追平甚至超過 latent-space 對應模型,推理端仲有 3.18 到 4.75 倍嘅速度提升。

  • 直接處理 pixel-space diffusion models 喺大規模訓練時收斂慢嘅問題
  • 用 latent-to-pixel 路線,先學先驗,再轉入像素空間微調
  • 檢視多個關鍵訓練選項,搵出實用 recipe
  • 在畫質不退讓之下,換取更快的 end-to-end inference
  • 對想做高效文生圖系統、又在意生成細節保留嘅團隊最有參考價值

Paper

Categories: 阿里巴巴, 香港, 香港科技大學, Image, txt2img, 模型, 模型訓練, 南京大學

Tencent UI-Mate 桌面操作示範變成可重用工作流

開源權重的通用 GUI 智能體:環境驅動訓練 + 上下文演示學習——流程演示一次即可,不必把所有約定寫進提示。

UI Mate icon

很多桌面任務難寫成一段完整提示,問題不在指令太短,而是在檔名規則、視窗擺位、公司流程這些細節往往靠示範更容易講清。UI-Mate 就是朝這個位置切入的開源 GUI agent 項目:它在原生桌面看螢幕畫面,用鍵盤和滑鼠跨應用程式執行長流程工作,並且支援把一次人手操作示範轉成可重用工作流。

UI-Mate 把示範當成建議。當畫面內容、資料、視窗狀態或任務目標有變化,代理仍會按即時畫面重新判斷,避免變成只懂重播錄製腳本的 Computer-use agents(CUAs)。這個取捨很重要,因為它直接回應了 GUI 自動化最常見的失敗位:流程相似,但畫面從來不會完全一樣。

訓練方法亦反映它想處理真實環境,而不只是跑單一 benchmark。項目提到 closed-loop data engine,會串連任務合成、環境建構、rollout、驗證與 filtering,再用 capability tree 補回覆蓋不足的能力;同時支援 Ubuntu、Windows 和 macOS 的統一 rollout layer,並以 asynchronous group-relative optimization 處理長而且變化大的 rollout。整體方向很清晰:先把可執行環境和驗證機制搭好,再談代理怎樣學會跨系統做事。

公開結果亦有參考價值。UI-Mate 在 OSWorld-Verified 達到 77.0%,WindowsAgentArena 為 66.2%,而 OSWorkerBench 嚴格成功率 41.0%、progress 76.9%;加入一次 same-task demonstration 後,OSWorker self-demo strict success 由 17.2% 升到 35.4%。這些數字未必代表它已經能穩定接手所有桌面工作,但至少說明示範式引導不只是概念包裝,對長流程任務有明顯幫助。

  • 屬於開源 GUI agent 項目,重點是處理跨應用、跨作業系統的長流程桌面任務
  • 核心差異在於支援 in-context demonstrations,把一次示範整理成可重用工作流
  • 示範不是腳本重播,代理會按 live screenshot 即場重新規劃
  • 較適合需要固定流程但畫面與資料經常變動的團隊、營運與辦公自動化場景
  • 目前已公開模型與結果,但 OSWorkerBench 等配套仍有部分內容標示為 Coming Soon

部署與理解方式上,現有資料較接近研究原型加可試權重,而不是開箱即用的完整產品。官方已放出 code、weights、technical report 和 Try App,較合理的看法是先把它當成可驗證 demonstration-guided GUI agent 能力的開源基線,再看後續 benchmark、資料集與工具鏈是否補齊。對研究 GUI agent、企業桌面自動化,或者想比較文字指令與示範引導差異的團隊,這個項目很值得跟進。

項目主頁 · GitHub · 模型

Categories: 開源, 騰訊, Agentic, Linux, Mac, 模型, UI/UX, Dataset 數據集

ClawGym:為 Claw 類代理搭建可訓練環境

ClawGym 讓本地、帶狀態的工作空間可用來合成資料、訓練代理同評估表現。你可以把它理解成一套面向 Claw-style personal agents 的研究與實驗框架。

Og image

ClawGym 把原本分散的代理開發流程收攏到同一個工作框架內,重點是處理本地、帶狀態工作空間中的任務生成、訓練同評測。對做 agent 研究或想驗證 Claw-style personal agents 的人來講,佢解決嘅唔係單一模型能力,而係點樣有系統咁建立可重複的實驗流程。

它嘅做法唔係只提供一個執行環境,而係同時涵蓋資料合成、agent 訓練同 benchmark 評估。令研究者可以用同一套基礎去跑不同任務,再睇代理喺有狀態工作空間入面表現有幾穩定。

幾個重點值得留意:
– 針對 local、stateful workspace,適合需要保留上下文同操作痕跡的任務
– 同時涵蓋 synthesized data、training 同 evaluation,減少流程分散
– 聚焦 Claw-style personal agents,而唔係泛用式聊天代理
– 已釋出 ClawGym-Bench 同 ClawGym-SynData,方便做對照測試同資料實驗

從公開資訊睇,ClawGym 亦一路延伸到更大範圍的 RL on general agent tasks,甚至可以透過 OpenClaw、Claude Code 呢類較複雜的 black-box agent harness 去做統一訓練。對想比較不同 agent 工作流、或者研究黑箱代理強化學習的人,佢提供咗一個較完整的基座。

項目主頁 · 模型

Categories: 開源, Agentic, MCP, 軟件, Medical醫學, 安全, 模型訓練, OpenClaw, 中國, Dataset 數據集, Skill 技能

Page 1 of 136
1 2 3 136