demystify-agent-skills:Agent Skills 點樣幫到代理,又會喺邊度失手

呢個研究項目唔係再做一個新 agent,而係拆解 Agent Skills 真正幫緊乜、又會喺邊一步開始失靈。這項目讓你會更易判斷技能封裝值唔值得放入自己嘅自動化流程。

Offline retrieval precision

當你想將一段成功經驗整理成可重用指引,最麻煩唔係有冇記錄,而係代理之後會唔會真係拎啱、用得啱。demystify-agent-skills 係一個研究型程式碼項目,圍繞 Agent Skills、Workflow Memory 同 raw trajectories 做受控比較,集中處理代理經驗應該點樣封裝,先至更有機會幫到後續任務。

佢吸引嘅地方不只是話「技能有用」,而係拆開幾層去驗證。相同來源經驗同相同目標任務之下,Skill 成功率有 61.9%,高過 Workflow Memory 嘅 55.9%,差距係 6.06 個百分點;但增益主要來自 procedural anchoring,佔 65.7%,唔係靠明示成功或失敗標籤去灌輸知識。

  • 同一批 agent trajectories 會被整理成 raw、Workflow Memory 同標準化 SKILL.md,再放返去同一類 target tasks 測試
  • retrieval、agent selection 同 real execution 係分開檢查,唔當成單一路徑
  • skill pool 由 5 增加到 100 時,embedding top-1 precision 由 88.3% 跌到 76.9%
  • parsed actual-use precision 會由 29.6% 進一步跌到 3.3%,但 downstream success 仍大致維持喺 36% 至 39%

「識得檢索」同「真係用對技能」原來係兩回事。項目指出 invocation 本身會帶來新失敗邊界:Skill 案例入面,有 10.0% 係誤用或者忽略技能指引,明顯高過 Raw 嘅 0.8% 同 Workflow Memory 嘅 0.4%。換句話講,技能格式改善咗執行穩定度,卻同時引入另一個決策風險。

呢個項目較適合研究 Agentic workflow、做 AI agent 評測,或者想建立可重用 skill library 嘅團隊重現。並非安裝一個即用產品,而係沿住 raw traces、matched artifacts、retrieval diagnostics 同 target task evaluation 去重跑實驗;對正在設計 Computer-use agents、CUAs 或其他多步代理流程嘅人,呢份分析比單看總成功率更有參考價值。

項目主頁 · GitHub

Categories: 開源, Agentic, Embedding, , Skill 技能

HarnessEval-W 讓世界模型評測留下可核查推理鏈

世界模型評測不再只給一個分數,HarnessEval-W把每次判斷拆成可追溯的證據樹,讓物理與因果錯誤更容易核對。

HarnessEval logo

當世界模型生成一段互動場景,真正難判斷的往往不是畫面是否漂亮,而是物理、因果和世界狀態有沒有隨行動正確演變。HarnessEval-W 屬於開源的 agentified benchmark,實際處理的是如何把這些需要理解上下文的評測工作,轉化成可檢查、可重現的判斷流程。

它借用 Large Language Model(LLM)生態常見的 harness 思路,先按每個 evaluation case 的初始世界、action 和 probe intent 分解問題,再由具備不同工具與上下文的 specialized sub-agents 分工判斷,最後由 parent agent 驗證證據並整合 verdict。每次評測都會留下 evidence tree,記錄測試內容、視覺依據和完整推理鏈,研究團隊可以追查分數由何而來,而不是只接受一個難以解釋的 scalar score。

  • 支援 330 個 evaluation cases、5,940 次 scored rollouts
  • 以 11 個 specialized evaluation skills 覆蓋品質、轉換與持續性
  • 涵蓋 18 個 world models,並提供 leaderboard 與可執行評測程式
  • 包含 harnesseval-metrics,以及 physical-plausibility backend harnesseval-pavrm

HarnessEval-W 在 intentional transition 上與人類 Bradley–Terry ranking 的 Spearman correlation 為 0.93;physical transition 的 pairwise accuracy 達 71.7%,高於 WBench 的 31.9%。重複評測的結果範圍亦較 WBench 窄 4.9 倍,但這些數字仍取決於案例設計、技能路由和代理判斷品質,不能直接視為所有世界模型任務的通用排名。

項目提供固定 plans、benchmark 資源、metric backends 和可延伸的 skill library;團隊可以先重現既有 cases,再提交新世界、新 action、新 probe family 或新 skill。它較適合研究世界模型、建立可審計評測流程,或需要比較物理合理性與狀態持續性的團隊;對只想快速取得單一分數的測試流程而言,完整證據樹會增加運算與整合成本,但換來更清楚的錯誤定位能力。

項目主頁 · GitHub

Categories: 開源, Agentic, , 世界模型, 北京大學, Dataset 數據集, Skill 技能

ClawGym:為 Claw 類代理搭建可訓練環境

ClawGym 讓本地、帶狀態的工作空間可用來合成資料、訓練代理同評估表現。你可以把它理解成一套面向 Claw-style personal agents 的研究與實驗框架。

Og image

ClawGym 把原本分散的代理開發流程收攏到同一個工作框架內,重點是處理本地、帶狀態工作空間中的任務生成、訓練同評測。對做 agent 研究或想驗證 Claw-style personal agents 的人來講,佢解決嘅唔係單一模型能力,而係點樣有系統咁建立可重複的實驗流程。

它嘅做法唔係只提供一個執行環境,而係同時涵蓋資料合成、agent 訓練同 benchmark 評估。令研究者可以用同一套基礎去跑不同任務,再睇代理喺有狀態工作空間入面表現有幾穩定。

幾個重點值得留意:
– 針對 local、stateful workspace,適合需要保留上下文同操作痕跡的任務
– 同時涵蓋 synthesized data、training 同 evaluation,減少流程分散
– 聚焦 Claw-style personal agents,而唔係泛用式聊天代理
– 已釋出 ClawGym-Bench 同 ClawGym-SynData,方便做對照測試同資料實驗

從公開資訊睇,ClawGym 亦一路延伸到更大範圍的 RL on general agent tasks,甚至可以透過 OpenClaw、Claude Code 呢類較複雜的 black-box agent harness 去做統一訓練。對想比較不同 agent 工作流、或者研究黑箱代理強化學習的人,佢提供咗一個較完整的基座。

項目主頁 · 模型

Categories: 開源, Agentic, MCP, 軟件, Medical醫學, 安全, 模型訓練, OpenClaw, 中國, Skill 技能, Dataset 數據集

LittleLearner 把語言模型的知識邊界控制在小學五年級

LittleLearner 透過受控課程資料訓練模型,研究能力究竟來自學習,還是只是被提示引出。

Hero image preview

模型能否回答問題,不一定代表它真正學過相關知識。LittleLearner 將語言模型(Language Models,LMs)的預訓練資料限制在美國小學 K–5 課程,建立一個可觀察知識邊界的研究沙盒,讓研究者分辨能力是從資料中獲得,還是只是在提示下被引出。

項目的核心是 LittleCurriculum,一個由 FineWeb-Edu 蒸餾而成、約 880 億個 token 的語料庫。資料經過五階段篩選,並按照 Common Core standards 對齊,明確排除五年級以上教授的概念、事實和詞彙;模型則從零開始訓練,並配備使用相同架構、token 數量和訓練配方的 Unfiltered control,方便作出乾淨比較。

LittleLearner 提供 0.6B、1.3B 和 5B 三種規模,另有 Base、GRPO 及 Chatty 版本。研究測試 scaling、SFT+GRPO post-training 和 in-context learning 後發現,這些方法可以放大課程範圍內的能力,卻未能明顯提升範圍以外的表現,顯示預訓練資料可能設定了有效能力上限。

重點包括:
– 88B-token LittleCurriculum 將知識暴露範圍控制在 K–5 課程
– 三種模型規模均設有匹配的 Unfiltered control
– scaling 可改善課程範圍內表現,外推能力只有限度增加
– SFT+GRPO 和 in-context learning 未能突破知識邊界
– 網頁提供 5B 模型的瀏覽器聊天介面、Dataset 和 Model checkpoints

對研究模型能力來源、知識遷移和 post-training 效果的人,LittleLearner 提供了較容易重現和比較的實驗基礎;對一般使用者而言,瀏覽器內的 live chat 則可直接感受一個受控知識範圍模型的回答方式。

項目主頁 · 模型

Categories: 開源, 模型, 模型訓練, Dataset 數據集, Skill 技能

playwright-skill 技能讓代理即寫即跑瀏覽器流程

這個項目把 Playwright 自動化包進 Agent Skill,適合要把瀏覽器操作變成可重跑程式的場景。它偏向 code-first,重點是把測試、截圖、網絡攔截和多步流程直接交給代理生成。

Repository image for lackeyjb/playwright-skill

面對要反覆驗證頁面流程、抓截圖、做網絡攔截,或者把操作保留下來重跑的情境,這個項目提供的是一套給 coding agents 用的 Playwright 自動化技能,並同時包成 Claude Code Plugin,安裝與接入都比較直接。

它不是單純的瀏覽器控制工具,而是讓代理按需要寫出真正的 Playwright 程式,再即場執行。官方也明講,若只是一般互動式瀏覽,Playwright CLI 或 playwright-mcp 會更合適;這個項目更適合 code-first 工作流,當自動化本身就是要保留的產物。

安裝方式以 Vercel 的 skills CLI 為主,支援全域或指定項目安裝;結構上把 skill 放在 plugin 的 skills 目錄,方便不同 agent 讀取。它也主打可見瀏覽器預設開啟、穩定的模組解析、臨時檔安全清理,以及按需載入完整 API,減少代理一次讀入太多內容。

  • 適合要寫、執行、重跑 Playwright 腳本的工作流
  • 支援單步頁面測試,也支援多步流程與多個 context
  • 可用於 screenshot、video、network interception 等任務
  • 和純工具式控制相比,更重視可保存的程式碼結果
  • 受益較多的通常是做自動化測試、爬取流程驗證、代理工作流的人

整體看來,這個項目把「讓代理操作瀏覽器」提升成「讓代理產出可維護的 Playwright 程式」。它的價值不在於包辦所有瀏覽器需求,而在於把可視化執行、程式化控制和可重用性放到同一條工作流裡。

GitHub

Categories: 開源, Agentic, API, MCP, 編程, Skill 技能

DeepSeek Harness 把 Agent 變成插件

DeepSeek Harness 想解決的唔係單一 Agent 功能,而係點樣把模型、工具同工作流拆開重組。對想長期調整 Agent 流程的團隊,呢個方向比單次 demo 更有參考價值。

Repository image for deepseek-ai/deepseek-harness

DeepSeek Harness 把 dsh 做成一個面向開發者的 Agent harness,重點不在於再包一層聊天介面,而是把模型、工具、技能、會話、沙箱、存儲、循環、調度同 UI 全部拆成插件,讓團隊用配置去換件、重組,同時保留可追蹤的執行過程。它處理的是 Agent 進入真實工作流後,經常要改工具鏈、換模式、查執行軌跡的維護問題。

你可以直接用 npx @deepseek-ai/dsh web 啟動 Web UI,也可以從原始碼安裝;兩種方式都指向同一件事:DeepSeek 並非只想交付一個可試玩的介面,而是提供一個可延伸的開發底座。現階段它仍屬 developer preview,兼容性破壞會持續出現,較適合願意跟住 API 與插件生態一齊迭代的團隊。

跟不少把能力寫死在框架內的做法相比,DeepSeek Harness 把 Cordis 放在核心位置,內核只負責插件載入、卸載與依賴關係,Agent 能力則交由插件之間透過服務與事件協作。好處是替換模型、工具或 preset 時毋須大改源碼;代價是系統理解成本較高,穩定性亦未到可安心鎖版的階段。

它提供標準模式、PTC 模式、極簡模式同創造模式,反映出同一套底層同時照顧編碼 Agent、基準測試同自訂 preset。當中較值得留意的是 Trajectory 視圖與僅追加式會話日誌,系統會記錄提示詞、工具調用、結果、子 Agent 調度與上下文注入,對除錯、回放、分叉同檢索都幾有用,但官方未提供明確基準分數,現時較難直接用量化結果同其他 Agent 框架比較。

  • 用 Cordis 作核心,將 Agent 各層能力拆成可替換插件
  • 可經 Web UI 快速測試,亦可由原始碼部署到自訂環境
  • Trajectory 與事件流日誌有助追查每一步決策與工具操作
  • developer preview 階段變動頻密,較適合開發者與研究型團隊
  • 重點價值在可組合工作流,而唔係單一模型能力展示

項目主頁 · GitHub

Categories: 開源, DeepSeek, Agentic, API, 工具, UI/UX, Skill 技能

MiniMax-Music3 的音樂描述改寫技能

這個項目把短音樂描述整理成更穩定的提示文字,方便後續生成或編修。它也支援帶標籤歌詞,讓內容更貼近音樂創作流程。

Og image

MiniMax-Music3 的 music-caption-rewriter 屬於一個 Skills 項目,重點是把簡短的音樂描述,連同可選的標籤歌詞,改寫成更適合後續處理的文字。它處理的不是旋律本身,而是前期描述太短、太散,難以直接拿去做音樂生成或整理的問題。

這類寫法對內容創作者、音樂生成工作流,或要把零散想法轉成較一致提示文字的人特別有用。它的價值在於先把描述整理好,再交給後續模型或工具,減少輸入太模糊而導致結果飄移的情況。

文件目前可見的資訊主要集中在用途說明,沒有完整交代安裝步驟、執行流程或評估數據,所以較適合把它理解成一個針對文字前處理的技能模組,而不是一個獨立應用。從命名和描述來看,它和一般直接輸入短句就生成的做法不同,重心放在改寫與結構化,讓輸入更一致。

  • 處理短音樂描述的改寫
  • 可搭配 tagged lyrics 一起輸入
  • 目標是讓後續音樂生成更穩定
  • 文件未提供安裝與評測細節
  • 適合音樂生成前的文字整理工作流

項目主頁

Categories: 開源, Agentic, 音樂, Skill 技能, MiniMax

Google DeepMind 把手語 AI 放進用戶手中 涵蓋 30 種 ASL 詞彙

Google DeepMind 將手語識別 AI 整合到日常應用,讓失聰與健聽人士的溝通更自然。

A person signs with one hand while holding a smartphone, demonstrating the Gboard sign-to-text dictation feature.

聾人手語使用者日常面對的最大卡位,是怎樣讓手機或視訊鏡頭直接「讀懂」手語並即時翻譯。Google DeepMind 近期把手語 AI 從實驗室帶到實際產品中,覆蓋約 30 個美式手語(ASL)詞彙並透過 Gemini 模型支援即時回應,目標是讓聾人朋友毋須依賴真人翻譯就能完成基本對話。

這套技術並非單純的影像分類,而是結合姿態估計、語境理解與大型語言模型的能力,把手語動作轉成自然語言並維持對話節奏。比起過去只能辨識孤立詞彙的系統,現時更著重處理連續手語與多輪對話,使翻譯過程貼近真實交流節奏。

DeepMind 同時強調負責任部署,與聾人社區合作收集訓練數據,並透過小規模詞彙起步降低誤譯風險。對於依賴視訊通訊的聾人用戶來說,這項能力讓 Zoom、Meet 等場景下的溝通體驗更貼近健聽人之間的對話節奏。

這項功能適合手語使用者、聾人家屬,以及需要服務聾人客戶的企業。它並非要取代真人翻譯,而是作為日常輕量溝通的輔助工具,降低手語學習門檻並促進更即時的互動。

重點摘要:

  • 覆蓋範圍:支援約 30 個 ASL 詞彙,涵蓋日常問候與基本對話。
  • 技術核心:結合姿態估計與 Gemini 大型語言模型,處理連續手語與上下文。
  • 部署方式:整合到 Google Meet 等視訊應用,即時翻譯手語為文字或語音。
  • 負責任設計:與聾人社區協作訓練數據,從小規模詞彙起步降低誤譯風險。
  • 使用場景:聾人用戶日常視訊通話、聾人家庭成員溝通、企業客服聾人客戶。

項目主頁

Categories: Google, Gemini, Agentic, Video, Audio, 安全, Robotic, 世界模型, Skill 技能

spark-to-paper-skills:14 個 Claude Code 技能把點子直出論文 PDF

由一句想法走到可編譯論文,連引用、圖表同數字來源都一併追蹤。呢個 Claude Code 插件瞄準的,不是寫草稿,而是把研究寫作流程拆成可驗證工序。

spark-to-paper-skills

研究寫作最麻煩的地方,往往不是起草,而是引用會唔會失真、圖表能否修改、數字有冇來源可追。spark-to-paper-skills 把呢件事做成 Claude Code 插件型工具鏈,用 14 個可組合技能,將一句想法推進到可編譯 PDF,處理的是論文生成流程入面最容易出錯的核對與整理工作。

它吸引人的地方,在於唔靠獨立 app 或伺服器,而是直接掛入 Claude Code 會話。安裝前提相對簡單,重點是有 Claude Code,另外部分圖像流程需要 Python 3.10+ 同指定依賴;換句話說,這不是雲端代寫服務,而是偏向本機、插件式、可拆件調用的研究寫作工作流。

  • 14 個技能可分步串接,涵蓋資料整理、成稿到 PDF 編譯
  • 引用強調 verified,數字強調 traced to source,主打可追溯性
  • v1.2.0 加入 PaperBanana+ figure engine,圖可重畫成原生 editable vector figures
  • 新版支援 Claude Code plugin 自動載入,部署方式比早期版本完整

同類做法多數把重點放在生成速度,這個項目則把可信度同後續可編輯性放得更前。PaperBanana+ 的做法幾值得留意:先由官方 PaperBanana 產生候選圖,再用 ts-figure-svg 學習該渲染風格,根據論文事實原生重繪,並以 stdlib-only geometry audit 反覆修正至少 4 輪,換來的是圖像更容易進一步編修,但流程也明顯比單次出圖更講究。

目前公開資訊較多集中在工作流完整度。它已展示 7 篇跨 6 個領域的端到端樣本,並支援 ICML 2025、NeurIPS 2025 風格輸出,足以說明這套技能並非只停留在片段 demo。較適合研究助理、學術團隊、技術內容作者,或者需要快速整理初稿但又唔想放棄引用與圖表可追蹤性的人;最終學術品質,仍然要視乎輸入構想、來源材料同人工審稿力度。

GitHub

Categories: 開源, Python, Anthropic, Skill 技能

WeClawArena:當多個 AI Agent 共用工作流,誰來守住邊界

這個項目把多個個人 AI Agent 放在同一個沙盒裡合作做任務,再刻意注入攻擊,檢視它們會否洩密或越權。它想回答的是:當 Agent 開始互相呼叫,安全性該怎麼量度。

WeClawArena and its bargaining, bidding, travel, SWE-Workspace, clinical, and trading domains

當 AI Agent 不再是單兵作戰,而是要在共享任務裡交換訊息、互相呼叫工具,真正的風險往往不在模型本身,而在邊界有沒有人守。WeClawArena 是一個開源基準與可審計的運行沙盒,它模擬每個「人類擁有者」各自帶著一個 Agent、私有資源、角色專屬工具與本地規則,再讓這些 Agent 一起完成跨擁有者的任務。沙盒會全程記錄訊息、工具呼叫、資源操作與治理決策,方便事後追查誰在什麼時候越了界。

與一般針對單一 Agent 的安全測試不同,這個項目刻意把「協作失敗」與「攻擊成功」拆開評估。它在六個領域共 124 個基礎任務、620 個變體上,加入無攻擊組作對照,並針對協作、安全、私隱、治理四類攻擊條件各自打分,得出任務成功率(TSR)與攻擊成功率(ASR)兩組指標。Bargaining、Bidding、Travel、SWE-Workspace、Clinical、Trading 這幾個場景覆蓋了採購談判、軟件工程協作、臨床團隊、投資俱樂部投票等高利害情境。

對從事 Agent 安全研究、紅隊測試,或要部署多 Agent 協作流程的團隊,這套沙盒提供了一個可重現、可審計的環境。從 README 與 HF Papers 頁面可見,作者 Prince Zizhuang Wang 等人已把論文、數據集與 v2.0.0 版本代碼同步公開,採用 Apache-2.0 授權代碼、CC BY-NC 4.0 授權數據。

重點摘要:

  • 邊界為核心:每個 Agent 只看得到自己擁有者的資源與工具,跨邊界行為會被記錄與計分。
  • 雙軌評估:任務成功率(TSR)與攻擊成功率(ASR)分開計算,避免「任務完成」掩蓋「已被入侵」。
  • 四類攻擊條件:協作、安全、私隱、治理各有一組匹配變體,可針對性分析 Agent 弱點。
  • 六個領域 620 變體:涵蓋商業談判、SWE 流程、臨床、投資等高風險協作情境。
  • 可審計沙盒:peer 訊息、工具呼叫、決策路徑都有跡可循,方便事後歸因。

項目主頁 · GitHub

Categories: 開源, Agentic, 安全, Skill 技能

Page 1 of 4
1 2 3 4