
SkillGate 是一套用來訓練 agent 選技能的開源方法,處理的是長鏈任務裡「揀啱技能」比「做完動作」更難學的問題。它把技能讀取視為中途決策,避免單靠結果獎勵去反推整條路徑,令選擇技能的 token 不再被後段執行訊號沖淡。
SkillGate 同時分出兩條互不干擾的信用路徑:結果分數只回傳到執行 token,而動作局部的優勢值只回到技能名稱 token。這樣做的目的,是讓模型在讀技能文件時得到更直接的學習訊號,而不是等整段任務成敗去間接修正。
作者做了 12,800 條訓練軌跡分析,指出技能選擇 token 的損失權重中位數只有 0.14%,而且不少樣本的優勢值會因為後段失敗而變成負值。這類「selector credit starvation」問題,正是 SkillGate 想修正的核心。
在五個 agentic 基準上,9B 規模版本錄得 53.2% 試驗成功率,屬於同級裡較強的結果。資料集和模型都已公開,訓練與評估亦配合字節對齊的實際提示詞流程,適合做 agent 訓練、技能庫管理,或者研究長鏈強化學習的人參考。
- 把技能選擇同任務執行分開計分,減少信用稀釋
- 針對 mid-episode 技能讀取決策,不只看最終成敗
- 9B 版本在五個 agentic 基準上有 53.2% 成功率
- 公開了模型同資源,方便重現同類訓練流程
- 對需要大量技能庫的 agent 系統較有參考價值