
AI Agent 做長任務時,選錯方向可能要到多個步驟之後才看得出代價。Taste-Bench 是一套評測資料集,讓模型閱讀任務背景、分岔前的操作紀錄,以及兩個候選下一步,再判斷哪個選擇較好;它測試的不是單步答題,而是能否避免把時間和計算資源花在錯路上。
資料集有 502 題,從軟件工程與機器學習研究任務的操作軌跡中整理而成,沒有逐題由專家標註。題目分為兩類:不同嘗試在同一位置分岔,最後結果提供判斷依據;或同一次執行中,Agent 遇到失敗後放棄原路並恢復。研究團隊從 4,657 個候選分岔中剔除過於簡單或無法判定的題目,並以後續結果標示較佳方向。
測試時可從 Hugging Face 取得資料集,按題目提供的紀錄比較模型選擇;程式碼庫亦提供 Python 3.11 以上的快速開始方式。評分要求模型在兩種選項排列順序下都答對,減低單靠固定選位置取得高分的可能。較貼近方向判斷能力,但題目仍集中於 SWE-bench、SWE-bench Pro,以及 METR 的 MALT 研究軌跡,未必涵蓋所有長任務場景。
14 個前沿模型中,最高平均正確率為 59.7%,仍有約四成題目判斷錯誤;當關鍵證據要到更後段才出現,準確率會由 62.3% 降至 21.0%,增加推理預算亦未能改善結果。研究亦報告,透過事後答案蒸餾訓練的 Qwen3.6-27B,在未見任務上的正確率由 30.0% 升至 47.9%;用它提供建議後,SWE-bench Pro 成功率由 14.6% 升至 33.7%。這些結果顯示評測不只用來比較模型,也提供了改善 Agent 決策的訓練方向。
- 評測核心:在結果尚未揭曉時,從兩個下一步中選出較佳方向。
- 題目來源:軟件工程與機器學習研究任務的真實操作軌跡。
- 主要限制:目前 502 題的領域與任務來源有限,不能代表所有 Agent 工作。
- 適合對象:研究長任務 Agent、比較模型決策能力,或訓練工具使用策略的團隊。