LEGO-Anything:由單張圖片生成可編輯 3D 世界

由一張圖片開始,coding agent 會逐步寫程式、渲染和修正,產出可查詢及編輯的 Blender 3D 場景。

Og image

由一張 RGB 圖片開始,coding agent 會自行規劃、執行 Blender 程式、渲染結果,再按視覺檢查持續修正,將參考畫面轉成可編輯、可查詢及可匯出的 3D 世界。LEGO-Anything 同時涵蓋 agentic scene reconstruction 的框架、評測基準 LEGO-Bench,以及協助分析建構過程的 LEGO-Plugin。

項目處理的核心問題,是如何讓模型不只生成一張相似圖片,而是建立具備幾何結構、鏡頭和物件狀態的可執行場景。Agent Workspace 管理產物,Action Space 提供操作,Blender Code Structure 保存可修改的場景狀態,Scene Construction Workflow 則把參考解讀、程式生成、渲染和驗證串連起來。

LEGO-Bench 收錄來自104個場景的208張圖片,涵蓋8個環境、17個主題及443項資產,並以 Indoor、Outdoor 和 Easy 至 Hard 的物件集合測試不同難度。評分同時考慮 Blender 場景是否有效、可見表面幾何重建,以及重新渲染後的色彩吻合度;無效提交或未能完成評估的案例會取得零分。

目前公開結果顯示,GPT-6-astra 在室內及戶外分別取得53.4%及39.6%的 Overall 分數,高於其他參與比較的 coding agents;戶外場景在各難度層級都較難處理,而場景有效率仍未代表幾何和視覺細節已經高度吻合。對需要可修改 Blender 資產、可重現場景或研究 Computer-use agents 3D 操作能力的工作流,這套框架提供了較完整的測試方式。

  • 由單張圖片生成可執行的 Blender 場景
  • 透過寫程式、渲染和驗證逐步修正結果
  • 同時評估場景有效性、幾何重建和外觀吻合度
  • LEGO-Bench 涵蓋室內、戶外及多級物件難度
  • 戶外場景和高視覺保真度仍是主要限制

項目主頁

Categories: 開源, Agentic, Image, 框架, Vibe Coding, 3D, 編程, Dataset 數據集