
Google Cloud AI Research 聯同 Washington University in St. Louis、Google Cloud、University of North Carolina at Chapel Hill 的研究人員,開發了 EnvHarness。這個開源框架處理的是大型語言模型(Large Language Model,LLM)代理面對靜態互動環境時,任務和回饋無法隨能力變化的問題;它保留原有環境及驗證器,改由外加層控制代理所見、可做的行動和起始狀態。
代理在同一批任務上反覆練習,往往會很快解完,環境卻不能因應弱點提供新挑戰。EnvHarness 是一個面向代理學習的開源框架,透過標準 reset/step 介面包裹固定環境,調整代理的起始狀態、可用行動與觀察內容,同時保留原有的成功判定器。
它把控制拆成三類可組合元件:Setup 負責重塑初始狀態,Rule 改變互動規則、行動限制及回饋,Link 則把另一個環境的任務接入目前流程。設計者代理會讀取目標代理的操作軌跡,診斷失誤,再以 Python 寫出元件、測試及修訂,令訓練環境隨代理能力一同調整。
• 不需修改 ALFWorld、WebArena、SWE-bench Verified 等環境的內部程式碼
• 任務與 verifier 保持來源 benchmark 的可信判定
• 元件可自由堆疊,適合針對特定弱點改造互動流程
• 可在項目提供的瀏覽器 Playground 以 Toy24Env 觀察環境狀態與代理視角
在 ALFWorld、WebArena 及 SWE-bench Verified 的 EnvHarness 訓練結果分別達到 68.3、41.6 及 52.6,展示相對基準最高 5.9 個百分點的提升。不過,效果取決於設計者代理能否準確診斷軌跡,以及改寫後的環境是否真的對應目標弱點,並非單靠套上元件就能保證改善。
它的取捨是把環境設計工作轉移到 Setup、Rule、Link 的程式編寫與反覆測試,換來跨 benchmark 重用和較低的環境改造成本。