GLM-5.3 強化程式與安全分析能力

GLM-5.3 把重點放在寫程式、做 agent 同安全分析,並沿用 GLM-5.2 的架構與參數量。它同時帶來更強的開發表現與漏洞發現能力。

Og image

GLM-5.3 走的是實用取向,重點放在複雜軟件工程、agent 工作流同 cybersecurity。對要處理程式審查、漏洞發現、工具調用,或者生成較完整應用的團隊來講,它提供的是更穩定的能力提升,而不只是加大模型規模。

Z.ai 亦將它定位為旗艦模型,並強調 GLM-5.3 同 GLM-5.2 用同一個 base model,改進主要來自 post-training。這代表它嘅提升集中喺後訓練階段,而唔係重新改架構;同時,Open-Source Shield initiative 亦反映出它想推廣防禦型用途,並限制高風險濫用。

  • 在 Z.ai Code Bench 上,GLM-5.3 較 GLM-5.2 有 50% 的編碼提升。
  • 在 Terminal-Bench 3.0 同 Agents’ Last Exam (CLI) 上,取得開源 SOTA 成績。
  • 在 CyberGym 上達到 SOTA,漏洞發現能力明顯加強。
  • 在 exploit benchmarks 上,表現超過 GLM-5.2 一倍以上。
  • 它支援 1M context length 同 128K maximum output tokens,適合長流程任務。

官方亦列出多種能力,包括 Thinking Mode、streaming output、function calling、context caching、structured output 同 MCP,方便接入外部工具同資料源。對要做長對話、複雜任務編排,或者把模型接入現有系統嘅使用場景,這些功能比單次問答更有實際價值。

文中提到,GLM-5.3 在 coding、frontend design、backend logic、simulations 同 complex app generation 都有明顯進步;在 KingBench 3 上得分 73/80,即 91.25%,排到第 1。整體來看,佢更像一個偏向開發同防守用途的強力開源模型,而唔係只靠單一 benchmark 造勢的版本。

項目主頁

Categories: Agentic, MCP, API, 編程, Dataset 數據集

Mechanist:把整個科研鏈串起來

Mechanist 把模型內部機制研究串成一條自動化流水線,從文獻檢索到實驗驗證都能接手。對做可解釋性、假設檢驗同 GPU 實驗的人,相當有價值。

Mechanist Logo

Mechanist 係一個面向 LLM mechanistic interpretability 的 Autonomous Research Agent,重點唔係幫你寫報告,而係幫你把研究問題拆成可驗證的實驗流程,再逐步產出有證據支撐的結論。它適合需要反覆查文獻、提假設、跑 GPU 實驗、再做 robustness validation 的工作,特別係做模型內部機制分析嘅研究人員同團隊。

使用方式偏向研究工作流而唔係單點工具:先準備 task.md,再喺 Claude Code 入面啟動 /auto,系統會接住做 literature retrieval、hypothesis formulation、experiment implementation 與 execution。項目同時提供 /msearch 同 /mhistory,方便查文獻同追蹤主題脈絡;安裝資料提到要配合 Claude Code、uv,同埋設定 external review model,但 README 亦提到詳細步驟要參考 Quick Start,同時未有完整列出所有命令細節。

它的取捨幾清晰:比起只做文獻整理或者只跑單次實驗,Mechanist 會把整個研究鏈條串起來,仲會喺 GPU budget 內自動縮放實驗規模,唔夠資源時會直接停低並回報。這種做法令佢更像一個可執行的研究夥伴,而唔係純粹的查詢介面。

  • 支援把研究問題轉成可重複驗證的實驗流程
  • 會做文獻檢索、假設生成、實驗執行同穩健性檢查
  • GPU budget 係硬限制,資源不足會明確停機回報
  • 適合做 mechanistic interpretability、模型分析同研究自動化的人
  • 目前以 Claude Code plugin 形式提供,Codex 支援屬於後續方向

項目主頁 · GitHub

Categories: 開源, Agentic, Anthropic, Dataset 數據集

MiniMax-Music3 的音樂描述改寫技能

這個項目把短音樂描述整理成更穩定的提示文字,方便後續生成或編修。它也支援帶標籤歌詞,讓內容更貼近音樂創作流程。

Og image

MiniMax-Music3 的 music-caption-rewriter 屬於一個 Skills 項目,重點是把簡短的音樂描述,連同可選的標籤歌詞,改寫成更適合後續處理的文字。它處理的不是旋律本身,而是前期描述太短、太散,難以直接拿去做音樂生成或整理的問題。

這類寫法對內容創作者、音樂生成工作流,或要把零散想法轉成較一致提示文字的人特別有用。它的價值在於先把描述整理好,再交給後續模型或工具,減少輸入太模糊而導致結果飄移的情況。

文件目前可見的資訊主要集中在用途說明,沒有完整交代安裝步驟、執行流程或評估數據,所以較適合把它理解成一個針對文字前處理的技能模組,而不是一個獨立應用。從命名和描述來看,它和一般直接輸入短句就生成的做法不同,重心放在改寫與結構化,讓輸入更一致。

  • 處理短音樂描述的改寫
  • 可搭配 tagged lyrics 一起輸入
  • 目標是讓後續音樂生成更穩定
  • 文件未提供安裝與評測細節
  • 適合音樂生成前的文字整理工作流

項目主頁

Categories: 開源, Agentic, 音樂, MiniMax, Skill 技能

OpenART:把 Agent 安全測試搬進可演化環境

OpenART 將工具型 code agent 的安全評估做成可重現的 Docker 工作流,重點不是跑單一任務,而是觀察環境變化如何累積成風險。你可以把它理解成一個用來做 agent red teaming 的開源框架。

Repository image for AI45Lab/OpenART

OpenART 把工具型 code agent 的安全測試,拉到一個更貼近長流程工作的環境裡。它不是單純驗證模型會不會答對,而是看 agent 在共享狀態、連續工具操作與環境演化之下,會不會慢慢走偏,這對做安全研究、紅隊測試或 agent 平台驗證的人都更有參考價值。

整個項目是 Docker-native 的框架,安裝後可先跑本地 smoke task,確認容器、評估器和路徑都正常,再切換到高複雜度任務。README 內也提供 target-only 與 attacker 兩種跑法,方便對比單看目標 agent 與加入 OpenCode-compatible attacker 的差異;任務圖會從 openart-tools 自動選取所需工具,使用方式偏向可控實驗而不是即插即用服務。

它的取捨很清楚:OpenART 把重點放在可重現、可擴展的安全評估,而不是包裝成一個面向終端用戶的產品。項目保留可執行 runtime、少量高複雜度示例與管理過的工具子集,卻刻意不放批次實驗驅動、生成結果和私有場景語料,代表它更像研究與測試底座,適合需要自行編排實驗的人。

論文背景提到,OpenART 提供超過 10,000 個已驗證 stateful scenarios,涵蓋 50 個領域,並支援 75 種 agent-model 配置的統一評估;EMHA(Evolutionary Markov Hypergraph Attack)則是用來推動環境演化的黑箱策略,無需更新參數。文中亦指出,複雜環境下,環境演化比只改指令更容易揭示安全失誤,這正是它相對一般短任務 benchmark 的關鍵差別。

  • 支援先做本地 smoke run,再轉入高複雜度任務驗證
  • 以 Docker 與任務圖管理工具,便於重現與隔離環境
  • 可比較 target-only、attacker 與不同 agent-model 配置
  • 適合做 agent 安全、紅隊測試與平台兼容性檢查
  • 強調長流程與 stateful 環境,較能暴露累積性風險

GitHub

Categories: 開源, 上海人工智慧實驗室, Agentic, 安全, Dataset 數據集

MBA:把商業點子變成多模態評測題

MBA 將商業點子生成拉回真實場景,讓模型不只看文字,還要理解圖片、情境同市場證據。它同時提供評測基準同兩個 agent 訓練版本,方便比較不同取捨。

teaser

MBA(Multimodal Benchmark and Agents for Real-World Business Ideation)把原本偏文字的商業構思流程,改成要連圖片、場景同市場證據一齊理解的多模態任務。對做產品構思、創業點子篩選或研究 agent 的團隊來講,重點唔係生成幾多答案,而係點樣喺真實視覺線索下提出夠新意、又講得通的方案。

這個項目同時提供 MBA-Bench 同兩個 agent,MBA-b 同 MBA-k。前者偏盲測設定,後者會利用已知標準,兩者都用 LoRA-based supervised fine-tuning,再接 group relative policy optimization,並加入 creativity、feasibility 等獎勵去訓練。

官方資料提到,MBA-Bench 有 30K 筆樣本,涵蓋六個有明顯視覺線索的領域,評估亦用多個商業向準則去看答案是否具體、可行、具差異化同可擴展。這代表它不只是比模型「講得靚」,而是逼系統在多個限制之間作取捨。

倉庫提供環境設定、資料準備、訓練同推理流程;資料亦可從 Hugging Face 取得,適合想重跑基準、改 reward 設計,或者把 multimodal agent 套到商業 ideation 工作流嘅研究者同工程團隊。現階段最它把 business ideation 由純文本任務,推向更接近現實訊號的評測框架。

  • 同時有 benchmark 同 agent,方便做訓練、比較同復現
  • 強調圖片與市場證據,唔再只靠文字提示
  • 以 creativity 同 feasibility 作核心獎勵
  • MBA-b 同 MBA-k 對應 blind 與 known 兩種設定
  • 適合做多模態 agent、產品構思同商業研究的團隊

項目主頁 · GitHub

Categories: 開源, Agentic, 多模態模型, 模型訓練, 框架, Dataset 數據集

WorldClaw 把一句提示詞變成可編輯 3D 世界

WorldClaw 將開放式描述轉成可探索、可修改的 3D open-world scene,重點不只在生成,還在把世界結構交到使用者手上。它適合想快速做場景原型、互動展示或內容雛形的團隊。

teaser

WorldClaw 是一個 agentic 3D 生成框架,處理的問題很直接:把一句開放式提示詞,變成一個可以走進去、調整、再延伸的 3D open-world scene。它的價值不在於單次出圖,而是把「生成」和「可編輯」連在一起,令內容創作更接近真正可用的場景製作流程。

這個項目目前更像研究原型與方法展示,重點放在論文、項目頁與流程圖;README 沒有提供完整安裝指令,使用者主要應透過論文和項目頁理解它的工作方式。它由 Tencent-Hunyuan 團隊提出,核心方向是把 agentic 流程套進 3D 世界生成,讓模型不只產生外觀,還能維持場景可探索性與修改空間。

  • 由單一提示詞推進到可互動的 3D 世界,不是只生成靜態資產。
  • 強調 editable 與 explorable,較適合做場景原型和概念驗證。
  • 內容定位偏研究與展示,公開資訊未見完整部署流程。
  • 相比一般 3D 生成方法,它更重視世界結構與後續修改。
  • 對遊戲原型、虛擬場景、數字內容團隊較有參考價值。

從命名和定位看,WorldClaw 把自己放在 3D 生成與 agentic workflow 的交界位,關心的不是單一模型輸出,而是生成過程怎樣逐步組裝成世界。現階段公開材料主要講方法與成果,沒有明確性能表格可供直接比較;讀它時,重點應放在它如何把開放式描述轉成可操作場景,而不是當成現成工具包看待。

項目主頁 · GitHub

Categories: 開源, 騰訊, Agentic, 3D

NCP-Bench 把電影故事變成可逐輪檢查的互動環境

這個基準把電影故事變成可逐輪檢查的互動環境,重點不是講得順,而是能否守住既定事實與劇情承諾。你可以把它理解成用來測試 LLM agent 會否在長對話中改寫故事的工具。

NCP-Bench overview: data construction, interaction history, and evaluation framework

NCP-Bench 是一個 benchmark,加上一套固定 evaluator,用來測試 Interactive Narratives 裡的 Narrative Commitment Preservation (NCP)。它處理的問題很直接:當玩家自由輸入動作時,Narrator agent 會不會偷改已建立的世界事實,或跳過本來應該出現的劇情節點。

使用方式偏向研究與評測流程:每個電影 synopsis 會被轉成 stateful environment,內有 initial fact ledger、narrative commitments 同 ordered reference trajectory;agent 每回合回應後,固定 evaluator 會檢查 fact、commitment 同 player-input conflicts,再更新狀態。儲存庫同時提供 100 個 benchmark environments、方法無關的 episode runner,以及 Baseline 和 HiAgent 參考方法,方便直接比較。

這套做法的價值在於,它不只看文字是否自然,還逼系統在長 horizon 內維持一致性。和只看單輪生成的測試比,NCP-Bench 更接近互動式敘事真正會遇到的拉扯:玩家可以亂入,但系統仍要守住已承諾的劇情骨架。

較適合關心長對話敘事、互動式故事生成、角色扮演型 agent 的研究者與團隊。若要部署,重點不是訓練一個新模型,而是接上既有 narrator,再用 repo 提供的環境規格同 evaluator 跑整個 episode,觀察違反事實、承諾和劇情順序的情況。

  • 100 個 movie-level environments,涵蓋 18 個 genres
  • 每個環境都有 YAML 規格,包含 metadata、facts、commitments 同 trajectory nodes
  • 評測核心是逐回合檢查一致性,而非只看最終輸出
  • 提供 Baseline 與 HiAgent,方便和論文結果對照
  • 適合做長篇互動敘事、Narrative agent 與一致性評測

GitHub

Categories: 開源, Agentic, 框架, Dataset 數據集

Google DeepMind 把手語 AI 放進用戶手中 涵蓋 30 種 ASL 詞彙

Google DeepMind 將手語識別 AI 整合到日常應用,讓失聰與健聽人士的溝通更自然。

A person signs with one hand while holding a smartphone, demonstrating the Gboard sign-to-text dictation feature.

聾人手語使用者日常面對的最大卡位,是怎樣讓手機或視訊鏡頭直接「讀懂」手語並即時翻譯。Google DeepMind 近期把手語 AI 從實驗室帶到實際產品中,覆蓋約 30 個美式手語(ASL)詞彙並透過 Gemini 模型支援即時回應,目標是讓聾人朋友毋須依賴真人翻譯就能完成基本對話。

這套技術並非單純的影像分類,而是結合姿態估計、語境理解與大型語言模型的能力,把手語動作轉成自然語言並維持對話節奏。比起過去只能辨識孤立詞彙的系統,現時更著重處理連續手語與多輪對話,使翻譯過程貼近真實交流節奏。

DeepMind 同時強調負責任部署,與聾人社區合作收集訓練數據,並透過小規模詞彙起步降低誤譯風險。對於依賴視訊通訊的聾人用戶來說,這項能力讓 Zoom、Meet 等場景下的溝通體驗更貼近健聽人之間的對話節奏。

這項功能適合手語使用者、聾人家屬,以及需要服務聾人客戶的企業。它並非要取代真人翻譯,而是作為日常輕量溝通的輔助工具,降低手語學習門檻並促進更即時的互動。

重點摘要:

  • 覆蓋範圍:支援約 30 個 ASL 詞彙,涵蓋日常問候與基本對話。
  • 技術核心:結合姿態估計與 Gemini 大型語言模型,處理連續手語與上下文。
  • 部署方式:整合到 Google Meet 等視訊應用,即時翻譯手語為文字或語音。
  • 負責任設計:與聾人社區協作訓練數據,從小規模詞彙起步降低誤譯風險。
  • 使用場景:聾人用戶日常視訊通話、聾人家庭成員溝通、企業客服聾人客戶。

項目主頁

Categories: Agentic, 世界模型, Google, Gemini, Video, Audio, Robotic, 安全, Skill 技能

spark-to-paper-skills:14 個 Claude Code 技能把點子直出論文 PDF

由一句想法走到可編譯論文,連引用、圖表同數字來源都一併追蹤。呢個 Claude Code 插件瞄準的,不是寫草稿,而是把研究寫作流程拆成可驗證工序。

spark-to-paper-skills

研究寫作最麻煩的地方,往往不是起草,而是引用會唔會失真、圖表能否修改、數字有冇來源可追。spark-to-paper-skills 把呢件事做成 Claude Code 插件型工具鏈,用 14 個可組合技能,將一句想法推進到可編譯 PDF,處理的是論文生成流程入面最容易出錯的核對與整理工作。

它吸引人的地方,在於唔靠獨立 app 或伺服器,而是直接掛入 Claude Code 會話。安裝前提相對簡單,重點是有 Claude Code,另外部分圖像流程需要 Python 3.10+ 同指定依賴;換句話說,這不是雲端代寫服務,而是偏向本機、插件式、可拆件調用的研究寫作工作流。

  • 14 個技能可分步串接,涵蓋資料整理、成稿到 PDF 編譯
  • 引用強調 verified,數字強調 traced to source,主打可追溯性
  • v1.2.0 加入 PaperBanana+ figure engine,圖可重畫成原生 editable vector figures
  • 新版支援 Claude Code plugin 自動載入,部署方式比早期版本完整

同類做法多數把重點放在生成速度,這個項目則把可信度同後續可編輯性放得更前。PaperBanana+ 的做法幾值得留意:先由官方 PaperBanana 產生候選圖,再用 ts-figure-svg 學習該渲染風格,根據論文事實原生重繪,並以 stdlib-only geometry audit 反覆修正至少 4 輪,換來的是圖像更容易進一步編修,但流程也明顯比單次出圖更講究。

目前公開資訊較多集中在工作流完整度。它已展示 7 篇跨 6 個領域的端到端樣本,並支援 ICML 2025、NeurIPS 2025 風格輸出,足以說明這套技能並非只停留在片段 demo。較適合研究助理、學術團隊、技術內容作者,或者需要快速整理初稿但又唔想放棄引用與圖表可追蹤性的人;最終學術品質,仍然要視乎輸入構想、來源材料同人工審稿力度。

GitHub

Categories: 開源, Python, Anthropic, Skill 技能

360CityArena 把城市導航基準拉近真街景

想測試 Embodied Agents 喺城市場景到底識唔識搵路,360CityArena 提供咗一個更貼近真實街區的基準,但結果亦直接揭示現時模型離人類判斷仲有一大段距離。

360CityArena teaser showing a panoramic Akihabara scene and an embodied navigation agent

喺模擬城市入面叫 Embodied Agents 認路、數物件、跟地圖行,難度一向唔低;換成秋葉原的 360 度真實街景之後,問題就由「會唔會做任務」變成「可唔可以喺複雜環境保持判斷」。360CityArena 屬於 benchmark,核心用途係評估 multimodal large language models 喺 embodied navigation 同 visual reasoning 上,到底有幾接近真實城市探索需求。

呢個項目最有意思的地方,在於它唔係靠乾淨的 3D 合成地圖,而係用 602 段 360° 影片重建東京秋葉原 85 條街道,再放入 Unity 環境,用 pose graph 方式讓 agent 沿既定節點移動。換句話說,代理唔可以自由行去任何 3D 座標,也唔涉及實體互動;它測的是在受限移動下,模型能否理解街景、地圖、語言提示同空間關係。

公開版本有 175 個人工設計任務,涵蓋 localization、landmark search、counting、map navigation、language guided navigation 同 relational spatial reasoning。部署方式亦算清楚:Unity 6.5 負責環境,Python runner 接模型 API、送出相機與地圖觀察,再把每次執行結果寫入 outputs/<run_id>/,因此它比較適合研究團隊或評測項目直接重跑同對照。

  • 用 360° 真實街景而唔係純合成場景,城市細節更接近真實導航
  • 任務覆蓋找地標、看圖尋路、數物件、按文字指示前進等七類能力
  • Unity 環境配合 Python runner,方便接駁不同 MLLM API 做可重現測試
  • agent 只可沿 pose graph 移動,限制更明確,同時保留城市探索的推理壓力

最值得留意的是結果並唔樂觀。官方比較指出,Gemini 2.5 Flash 目前在整體任務只有 17.1%,人類則有 77.3%,差距大到足以說明:現時多模態模型即使已經能看圖和讀指令,一旦放入連續街景、地圖對位與空間推理混合的場景,穩定性仍然不足。對做 Agentic、Robotic、世界模型相關研究的團隊來講,360CityArena 的價值正在於它唔再只測單步理解,而係把城市級導航的瓶頸攤開畀人直接比較。

項目主頁 · GitHub

Categories: 開源, Agentic, 多模態模型, Gemini, API, Robotic, 3D, Python, Dataset 數據集

Page 12 of 35
1 … 10 11 12 13 14 … 35