VibeEdit:以畫布指令精準指定影像編輯位置

圈選、畫線或拖動就能指定修圖位置,VibeEdit 以空間標記處理相似物件難以辨認的問題。

VibeEdit enables image editing with canvas instructions, including circles, scribbles, short notes and drag gestures.

圈選物件、畫幾筆線,或在圖片上拖動指定位置,再補上一句短註記,便能要求模型新增、移除、替換、改變屬性或移動內容。VibeEdit 屬於影像編輯模型,處理的是文字提示難以準確指出相似物件和局部區域的問題。

它採用 Qwen-Image-Edit,以 layer-decoupled conditioning 分開編碼原圖與 canvas instruction,再配合 region-weighted supervised fine-tuning,以及 rubric-guided reinforcement learning(RL)改善局部修改、指令完成度和未編輯區域的保留。訓練資料包含 155 萬組 source–target edit pairs、物件遮罩和結構化編輯描述,畫布指令則由這些資料生成。

  • 支援新增、移除、替換、屬性修改及移動物件
  • 不要求獨立文字提示,空間標記直接表達目標位置
  • 以 419 個人工整理案例測試相似物件選取能力
  • VLM(Vision-Language Model)評分為 79.9,outside-region PSNR 為 32.8 dB
  • 對比 FireRed 的 67.4 分及 24.0 dB,局部編輯和區域保留均較佳

對需要精準修圖的設計、內容製作和研究團隊,畫布指令比長篇描述更容易表達「改哪一件」;但模型仍屬研究項目,程式碼標示為 Coming soon,暫時不能按儲存庫直接安裝或自行重現。評測規模亦只有 419 個案例,結果未必涵蓋所有圖片類型和複雜編輯情境。

項目主頁 · GitHub

Categories: 開源, 模型, 視覺模型, 多模態模型, 模型訓練, Qwen, Image, 庫, 強化學習

AgentGarten 以神經渲染器打造可演化的 AI 世界

AgentGarten 讓智能體在由程式控制狀態與規則、再由神經渲染器生成畫面的世界中反覆學習,兼顧可控性與視覺真實感。

MirroS logo

讓智能體在同一個世界反覆試錯,關鍵不只在模型能力,也在環境是否真的記得狀態、遵守規則,並以接近真實的畫面回應行動。AgentGarten 屬於面向 Agentic 系統的互動環境與神經渲染器項目,處理的是可執行世界難以同時兼顧規則一致性、視覺質感與即時速度的問題。

世界中的物件、目標和變化由程式保存,程式輸出的 depth 或 surface normals 則交給共享 neural renderer 生成智能體看到的畫面。renderer 以 NVIDIA Cosmos3-Nano 為基礎,先用 bidirectional rectified-flow 訓練完整影片,再以 autoregressive block-causal 方法配合 teacher forcing 或 diffusion forcing 生成後續畫面,最後透過 Adversarial Forcing 將模型蒸餾成較少步驟的學生模型。

目前公開內容集中在 neural renderer、訓練配方及 streaming inference;code worlds 和完整 agent practice loop 仍會逐步加入。試用需要 Python 3.11 或以上、PyTorch 2.9 或以上,以及 CUDA 主機,較適合研究智能體、模擬環境或自製互動遊戲的團隊,而非只想即時調用一個現成聊天模型的讀者。

  • 可控狀態:規則和世界變化留在可檢查、可修改的程式內。
  • 統一視覺介面:只要提供幾何條件,同一世界可以切換不同視覺風格。
  • 即時能力:官方資料指在單張 H100、480×832 解析度可超過每秒 30 幀。
  • 學習閉環:智能體每輪把經驗整理成 playbook,交給後續輪次繼承。

這種做法以幾何條件取代為每個世界重新製作完整視覺資產,換來較高彈性,但畫面質素仍取決於 renderer 訓練資料、條件輸出和硬件。項目展示的 shelter、bridge 及 companion dog 場景說明它可支援 self-play RL;不過完整程式世界尚未全部公開,現階段更適合作為研究原型和 renderer 實驗基礎。

項目主頁 · GitHub

Categories: 開源, Agentic, AI productions, 模型, 模型訓練, NVIDIA, Video, Python, 強化學習

AdvSim2Real 讓網頁爬蟲代理學懂抵抗提示注入

網頁爬蟲代理不能完全忽略頁面內容,AdvSim2Real 改用自我對抗訓練,令代理在保留操作能力之餘更能抵禦惡意指令。

AdvSim2Real overview

當網頁內文同時包含任務資料和惡意指令,要代理完全忽略非常重要。AdvSim2Real 屬於網頁代理安全訓練項目,透過動態產生任務和提示注入,處理代理被頁面內容帶偏的問題,並把能力提升帶到真實 Chromium 瀏覽器。

項目在凍結的 WebWorld-14B 中共同訓練任務課程、注入對手和網頁代理。課程專挑代理約有一半機會完成的任務,對手只有在注入令成功變成失敗時才獲得回報;每條操作軌跡再由凍結的 Qwen3.8-27B 評審。執行代理採用 Qwen3.5-4B,訓練後既提升正常任務能力,也減少對攻擊的敏感度。

元件論文配置/作用
ExecutorQwen3.5-4B;執行網頁任務
Curriculum產生符合 Agent 當前能力嘅訓練任務
Adversary產生令 Agent 偏離使用者目標嘅網頁注入內容
World modelWebWorld-14B;模擬每次動作後嘅下一個網頁狀態
JudgeQwen3.8-27B;判斷任務是否完成

150 項測試任務中,正常完成率由 74.89%升至 81.33%;面對三個訓練所得對手時,完成率由 48.07%升至 57.48%。對未參與訓練的 Kimi-K3 對手,完成率相對基礎代理提升 33.6%;在不呼叫世界模型的真實 Chromium 測試中,嚴格成功率則由 25.56%升至 44.44%。

  • 訓練方式:任務、攻擊和執行代理同步演化
  • 核心限制:結果高度依賴 WebWorld-14B 模擬質素及 LLM 評審準確度
  • 泛化能力:能抵抗未參與訓練的 Kimi-K3 對手
  • 驗證範圍:涵蓋 150 項網頁任務及真實 Chromium 測試

儲存庫提供程式碼、benchmark、訓練 checkpoint 和結果,較適合研究網頁代理安全、Computer-use agents 及強化學習的團隊重現。使用者不能把它當成即裝即用的瀏覽器防護工具;要重現訓練或比較結果,仍需按項目提供的模擬器、模型 checkpoint 和評審流程建立測試環境。

項目主頁 · GitHub · 模型

Categories: 開源, Agentic, 模型, 世界模型, 模型訓練, Qwen, Google, 工具, 庫, 安全, Dataset 數據集, Kimi, 強化學習