RA-Bench 直指危機假影片檢測盲點

危機事件影片最麻煩之處,不是合成得花巧,而是看起來太像真。RA-Bench把檢測器拉回真實傳播場景,專門測試這個落差。

RA-Bench: Can we defend against generated crisis videos?

當一段災難、戰事或公共事故影片本身已有真實事件做錨點,檢測器往往無法只靠內容違和感分辨真偽。RA-Bench屬於影片檢測基準資料集,針對的正是 AI 生成危機影片貼近真實新聞片段後,現有偵測方法還能否守得住。

它的做法有一個關鍵判斷:不再拿脫離情境的合成片去測,而是把真實危機影片與對應生成版本配對,並且涵蓋四個開源與五個閉源生成器。資料規模有 17,886 段影片,當中包括 1,830 段 real anchors、16,056 段生成片,另設 RA-Bench-HumanProof 與 RA-Bench-LastMile,前者收錄連人工審查者都一致誤判為真的 633 段影片,後者再測試影片經過連續傳播處理後,檢測器會否失準。

這個項目把「像真」、「會誤導人」、「經社交傳播後失真」三件事放在同一套測試裡。相對於只看配對樣本的資料集,它多了一層來源泛化與傳播鏈穩健性的要求;代價是資料權限較複雜,完整版本有部分 real anchors 只提供原始 URL,未必人人都能直接重跑 full 軌道。

  • public-media 只評估可重新分發的真實錨點配對,較適合公開重現與初步比較
  • full 依照完整論文清單評估,也要求處理只提供 URL 的真實來源
  • Hugging Face 釋出公開媒體約 93.8 GB,生成影片完整提供,真實素材則經權利審核後部分保留來源連結
  • 評估採用 source-matched evaluation,會把每個生成來源放回其對應真實錨點脈絡判斷

對做影片鑑識、內容審核、新聞驗證與多模態安全研究的團隊,RA-Bench的價值很直接:它不是教模型辨認「很像假片的假片」,而是逼它面對會在人類審查與傳播流程中混過去的片段。限制也同樣清楚,這仍是 benchmark,不是現成檢測器;要得出可比較結果,仍要先準備預測輸出、下載資料,並處理部分真實來源無法重分發的存取條件。

項目主頁 · GitHub

Categories: 開源, 香港科技大學, OpenAI, Video, 多模態模型, Dataset 數據集

Qwen3.8-2.4T-A95B 超大型開放權重文字推理模型

Qwen3.8 把 Qwen-Max 級別能力帶到開放模型,強項不只是答題,而係更穩定完成多步驟工作。

Og image

Qwen3.8-2.4T-A95B 把 Qwen-Max 級別的能力開放出來,而且明確建基於 Qwen3.5 的架構底層,BF16 safetensors 格式及1M上下文。定位上屬於 Causal Language Model,面向文字生成、編程、研究工作與長流程 Agentic 任務;相比只追求單輪回答,它更著重規劃、接收環境回饋,以及把多步驟工作做完。

Qwen3.8-2.4T-A95B 的核心規格相當進取:總參數 2.4T(2.4 trillion)參數,但每次啟動 95B,屬於典型大型 Mixture of Experts(MoE)路線,用較高總容量換取較可控的推理成本。模型經過 Pre-training 與 Post-training,並採用 Qwen3.5 架構延伸而來的層設計,包括 Gated DeltaNet、Gated Attention 與 MoE 組合,重點不是單純堆大,而是提升長鏈推理與任務完成的穩定性。

Qwen3.8-2.4T-A95B 主要來自兩個控制點:reasoning_effort 可調整推理深度,preserve_thinking 可保留歷史訊息中的 reasoning context。這代表它比較適合需要反覆修正、逐步執行的工作流,而唔係只看一次輸出的場景。頁面亦提到它對常見 harness 與開發工具有更廣泛支援,模型檔案可配合 Transformers、vLLM、SGLang、TokenSpeed 等推論堆疊。

  • 基礎模型可確認是建基於 Qwen3.5 architectural foundation。
  • 已知開放的是 Hugging Face Transformers 格式的 post-trained 權重。
  • 官方另有 Qwen3.8-Max 版本,功能更多,包含 vision input、non-thinking support、內建工具,以及預設 1M context length;但這些能力屬於官方服務版本,不應直接視為此頁權重全部具備。
  • 從已公開資訊看,它的優勢在於長流程 Agent 執行與專業工作可靠度提升;限制是硬體需求、完整上下文長度與量化部署細節未在此頁交代,離本地輕量部署仍有距離。

跟一般只強調 benchmark 分數的模型相比,它更強調任務完成率、規劃能力與工具鏈兼容性。由於缺少量化版本、推理記憶體需求與更完整評測數字,現階段較適合把它理解成面向高階推論服務與大型基建環境的開放權重,而不是即插即用的本地模型項目。

模型

Categories: 開源, Qwen, Agentic, API, LLaMa, Ollama, 模型訓練, 編程, Dataset 數據集

GLM-5.3 強化程式與安全分析能力

GLM-5.3 把重點放在寫程式、做 agent 同安全分析,並沿用 GLM-5.2 的架構與參數量。它同時帶來更強的開發表現與漏洞發現能力。

Og image

GLM-5.3 走的是實用取向,重點放在複雜軟件工程、agent 工作流同 cybersecurity。對要處理程式審查、漏洞發現、工具調用,或者生成較完整應用的團隊來講,它提供的是更穩定的能力提升,而不只是加大模型規模。

Z.ai 亦將它定位為旗艦模型,並強調 GLM-5.3 同 GLM-5.2 用同一個 base model,改進主要來自 post-training。這代表它嘅提升集中喺後訓練階段,而唔係重新改架構;同時,Open-Source Shield initiative 亦反映出它想推廣防禦型用途,並限制高風險濫用。

  • 在 Z.ai Code Bench 上,GLM-5.3 較 GLM-5.2 有 50% 的編碼提升。
  • 在 Terminal-Bench 3.0 同 Agents’ Last Exam (CLI) 上,取得開源 SOTA 成績。
  • 在 CyberGym 上達到 SOTA,漏洞發現能力明顯加強。
  • 在 exploit benchmarks 上,表現超過 GLM-5.2 一倍以上。
  • 它支援 1M context length 同 128K maximum output tokens,適合長流程任務。

官方亦列出多種能力,包括 Thinking Mode、streaming output、function calling、context caching、structured output 同 MCP,方便接入外部工具同資料源。對要做長對話、複雜任務編排,或者把模型接入現有系統嘅使用場景,這些功能比單次問答更有實際價值。

文中提到,GLM-5.3 在 coding、frontend design、backend logic、simulations 同 complex app generation 都有明顯進步;在 KingBench 3 上得分 73/80,即 91.25%,排到第 1。整體來看,佢更像一個偏向開發同防守用途的強力開源模型,而唔係只靠單一 benchmark 造勢的版本。

項目主頁

Categories: Agentic, API, MCP, 編程, Dataset 數據集

Mechanist:把整個科研鏈串起來

Mechanist 把模型內部機制研究串成一條自動化流水線,從文獻檢索到實驗驗證都能接手。對做可解釋性、假設檢驗同 GPU 實驗的人,相當有價值。

Mechanist Logo

Mechanist 係一個面向 LLM mechanistic interpretability 的 Autonomous Research Agent,重點唔係幫你寫報告,而係幫你把研究問題拆成可驗證的實驗流程,再逐步產出有證據支撐的結論。它適合需要反覆查文獻、提假設、跑 GPU 實驗、再做 robustness validation 的工作,特別係做模型內部機制分析嘅研究人員同團隊。

使用方式偏向研究工作流而唔係單點工具:先準備 task.md,再喺 Claude Code 入面啟動 /auto,系統會接住做 literature retrieval、hypothesis formulation、experiment implementation 與 execution。項目同時提供 /msearch/mhistory,方便查文獻同追蹤主題脈絡;安裝資料提到要配合 Claude Code、uv,同埋設定 external review model,但 README 亦提到詳細步驟要參考 Quick Start,同時未有完整列出所有命令細節。

它的取捨幾清晰:比起只做文獻整理或者只跑單次實驗,Mechanist 會把整個研究鏈條串起來,仲會喺 GPU budget 內自動縮放實驗規模,唔夠資源時會直接停低並回報。這種做法令佢更像一個可執行的研究夥伴,而唔係純粹的查詢介面。

  • 支援把研究問題轉成可重複驗證的實驗流程
  • 會做文獻檢索、假設生成、實驗執行同穩健性檢查
  • GPU budget 係硬限制,資源不足會明確停機回報
  • 適合做 mechanistic interpretability、模型分析同研究自動化的人
  • 目前以 Claude Code plugin 形式提供,Codex 支援屬於後續方向

項目主頁 · GitHub

Categories: 開源, Agentic, Anthropic, Dataset 數據集

OpenART:把 Agent 安全測試搬進可演化環境

OpenART 將工具型 code agent 的安全評估做成可重現的 Docker 工作流,重點不是跑單一任務,而是觀察環境變化如何累積成風險。你可以把它理解成一個用來做 agent red teaming 的開源框架。

Repository image for AI45Lab/OpenART

OpenART 把工具型 code agent 的安全測試,拉到一個更貼近長流程工作的環境裡。它不是單純驗證模型會不會答對,而是看 agent 在共享狀態、連續工具操作與環境演化之下,會不會慢慢走偏,這對做安全研究、紅隊測試或 agent 平台驗證的人都更有參考價值。

整個項目是 Docker-native 的框架,安裝後可先跑本地 smoke task,確認容器、評估器和路徑都正常,再切換到高複雜度任務。README 內也提供 target-only 與 attacker 兩種跑法,方便對比單看目標 agent 與加入 OpenCode-compatible attacker 的差異;任務圖會從 openart-tools 自動選取所需工具,使用方式偏向可控實驗而不是即插即用服務。

它的取捨很清楚:OpenART 把重點放在可重現、可擴展的安全評估,而不是包裝成一個面向終端用戶的產品。項目保留可執行 runtime、少量高複雜度示例與管理過的工具子集,卻刻意不放批次實驗驅動、生成結果和私有場景語料,代表它更像研究與測試底座,適合需要自行編排實驗的人。

論文背景提到,OpenART 提供超過 10,000 個已驗證 stateful scenarios,涵蓋 50 個領域,並支援 75 種 agent-model 配置的統一評估;EMHA(Evolutionary Markov Hypergraph Attack)則是用來推動環境演化的黑箱策略,無需更新參數。文中亦指出,複雜環境下,環境演化比只改指令更容易揭示安全失誤,這正是它相對一般短任務 benchmark 的關鍵差別。

  • 支援先做本地 smoke run,再轉入高複雜度任務驗證
  • 以 Docker 與任務圖管理工具,便於重現與隔離環境
  • 可比較 target-only、attacker 與不同 agent-model 配置
  • 適合做 agent 安全、紅隊測試與平台兼容性檢查
  • 強調長流程與 stateful 環境,較能暴露累積性風險

GitHub

Categories: 開源, Agentic, 安全, 上海人工智慧實驗室, Dataset 數據集

MBA:把商業點子變成多模態評測題

MBA 將商業點子生成拉回真實場景,讓模型不只看文字,還要理解圖片、情境同市場證據。它同時提供評測基準同兩個 agent 訓練版本,方便比較不同取捨。

teaser

MBA(Multimodal Benchmark and Agents for Real-World Business Ideation)把原本偏文字的商業構思流程,改成要連圖片、場景同市場證據一齊理解的多模態任務。對做產品構思、創業點子篩選或研究 agent 的團隊來講,重點唔係生成幾多答案,而係點樣喺真實視覺線索下提出夠新意、又講得通的方案。

這個項目同時提供 MBA-Bench 同兩個 agent,MBA-b 同 MBA-k。前者偏盲測設定,後者會利用已知標準,兩者都用 LoRA-based supervised fine-tuning,再接 group relative policy optimization,並加入 creativity、feasibility 等獎勵去訓練。

官方資料提到,MBA-Bench 有 30K 筆樣本,涵蓋六個有明顯視覺線索的領域,評估亦用多個商業向準則去看答案是否具體、可行、具差異化同可擴展。這代表它不只是比模型「講得靚」,而是逼系統在多個限制之間作取捨。

倉庫提供環境設定、資料準備、訓練同推理流程;資料亦可從 Hugging Face 取得,適合想重跑基準、改 reward 設計,或者把 multimodal agent 套到商業 ideation 工作流嘅研究者同工程團隊。現階段最它把 business ideation 由純文本任務,推向更接近現實訊號的評測框架。

  • 同時有 benchmark 同 agent,方便做訓練、比較同復現
  • 強調圖片與市場證據,唔再只靠文字提示
  • 以 creativity 同 feasibility 作核心獎勵
  • MBA-b 同 MBA-k 對應 blind 與 known 兩種設定
  • 適合做多模態 agent、產品構思同商業研究的團隊

項目主頁 · GitHub

Categories: 開源, Agentic, 多模態模型, 模型訓練, 框架, Dataset 數據集

S2R 用物理模擬解決影片反光

隔住玻璃拍片常見嘅反光,會令畫面難睇又影響後續辨識。S2R 把合成、去反光同評測串成一條流程,重點是先補足可信訓練資料。

Og image

隔住玻璃拍攝時,反光往往唔只影響觀感,仲會干擾偵測、辨識同追蹤等後續視覺工作。S2R 屬於影片去反光項目,重點唔係單靠清理單幀畫面,而是同時處理資料不足、時間連貫性同評測基準缺位三個卡位。

呢個項目用一個閉環流程連接 S2R-Synthesis、S2R-Removal 同 S2R-Benchmark。前段先以 Physics-Grounded Augmentation 與影片擴散生成方法合成成對影片,控制玻璃粗糙度、反射率、厚度等性質;後段再把 pretrained video diffusion prior 調整成適合去反光的模型,加入 reflection-aware latent adaptation 同 one-step pixel-geometric refinement,減少殘影並維持時序一致。

它跟常見做法最大分別,在於先把反光結構同外觀拆開處理。S2R-Synthesis 會從 FLUX-generated pseudo videos 學習較真實的反光外觀,再把兩段乾淨影片經 Physics-Grounded Augmentation 融合,生成可配對訓練資料,避免只靠傳統合成或少量真實資料,令模型較難學到穩定的影片反光模式。

  • 用物理約束方式合成反光影片,補足 paired video data 不足
  • 以 diffusion-based video dereflection 處理影片,強調跨幀一致性
  • 提供 S2R-Benchmark,兼顧 full-reference 評估同真實場景人類感知評估
  • 在 OpenRR-1k 的結果中,加入完整 PGA 後,PSNR 與 SSIM 都比基線再提升

現有資料顯示,S2R 特別適合需要穿玻璃拍攝的內容整理、監控視覺流程,或者任何重視畫面可讀性與後續分析品質的工作流。項目亦反映一個明確取捨:先花力氣建立可信的反光合成與評測系統,再用 diffusion-based 方法做移除,換來較完整的訓練閉環,但最終表現仍會受真實場景複雜反射型態影響。

項目主頁

Categories: Stable Diffusion, Video, Image, 小米-Xiaomi, Dataset 數據集, 框架

NCP-Bench 把電影故事變成可逐輪檢查的互動環境

這個基準把電影故事變成可逐輪檢查的互動環境,重點不是講得順,而是能否守住既定事實與劇情承諾。你可以把它理解成用來測試 LLM agent 會否在長對話中改寫故事的工具。

NCP-Bench overview: data construction, interaction history, and evaluation framework

NCP-Bench 是一個 benchmark,加上一套固定 evaluator,用來測試 Interactive Narratives 裡的 Narrative Commitment Preservation (NCP)。它處理的問題很直接:當玩家自由輸入動作時,Narrator agent 會不會偷改已建立的世界事實,或跳過本來應該出現的劇情節點。

使用方式偏向研究與評測流程:每個電影 synopsis 會被轉成 stateful environment,內有 initial fact ledger、narrative commitments 同 ordered reference trajectory;agent 每回合回應後,固定 evaluator 會檢查 fact、commitment 同 player-input conflicts,再更新狀態。儲存庫同時提供 100 個 benchmark environments、方法無關的 episode runner,以及 Baseline 和 HiAgent 參考方法,方便直接比較。

這套做法的價值在於,它不只看文字是否自然,還逼系統在長 horizon 內維持一致性。和只看單輪生成的測試比,NCP-Bench 更接近互動式敘事真正會遇到的拉扯:玩家可以亂入,但系統仍要守住已承諾的劇情骨架。

較適合關心長對話敘事、互動式故事生成、角色扮演型 agent 的研究者與團隊。若要部署,重點不是訓練一個新模型,而是接上既有 narrator,再用 repo 提供的環境規格同 evaluator 跑整個 episode,觀察違反事實、承諾和劇情順序的情況。

  • 100 個 movie-level environments,涵蓋 18 個 genres
  • 每個環境都有 YAML 規格,包含 metadata、facts、commitments 同 trajectory nodes
  • 評測核心是逐回合檢查一致性,而非只看最終輸出
  • 提供 Baseline 與 HiAgent,方便和論文結果對照
  • 適合做長篇互動敘事、Narrative agent 與一致性評測

GitHub

Categories: 開源, Agentic, Dataset 數據集, 框架

360CityArena 把城市導航基準拉近真街景

想測試 Embodied Agents 喺城市場景到底識唔識搵路,360CityArena 提供咗一個更貼近真實街區的基準,但結果亦直接揭示現時模型離人類判斷仲有一大段距離。

360CityArena teaser showing a panoramic Akihabara scene and an embodied navigation agent

喺模擬城市入面叫 Embodied Agents 認路、數物件、跟地圖行,難度一向唔低;換成秋葉原的 360 度真實街景之後,問題就由「會唔會做任務」變成「可唔可以喺複雜環境保持判斷」。360CityArena 屬於 benchmark,核心用途係評估 multimodal large language models 喺 embodied navigation 同 visual reasoning 上,到底有幾接近真實城市探索需求。

呢個項目最有意思的地方,在於它唔係靠乾淨的 3D 合成地圖,而係用 602 段 360° 影片重建東京秋葉原 85 條街道,再放入 Unity 環境,用 pose graph 方式讓 agent 沿既定節點移動。換句話說,代理唔可以自由行去任何 3D 座標,也唔涉及實體互動;它測的是在受限移動下,模型能否理解街景、地圖、語言提示同空間關係。

公開版本有 175 個人工設計任務,涵蓋 localization、landmark search、counting、map navigation、language guided navigation 同 relational spatial reasoning。部署方式亦算清楚:Unity 6.5 負責環境,Python runner 接模型 API、送出相機與地圖觀察,再把每次執行結果寫入 outputs/<run_id>/,因此它比較適合研究團隊或評測項目直接重跑同對照。

  • 用 360° 真實街景而唔係純合成場景,城市細節更接近真實導航
  • 任務覆蓋找地標、看圖尋路、數物件、按文字指示前進等七類能力
  • Unity 環境配合 Python runner,方便接駁不同 MLLM API 做可重現測試
  • agent 只可沿 pose graph 移動,限制更明確,同時保留城市探索的推理壓力

最值得留意的是結果並唔樂觀。官方比較指出,Gemini 2.5 Flash 目前在整體任務只有 17.1%,人類則有 77.3%,差距大到足以說明:現時多模態模型即使已經能看圖和讀指令,一旦放入連續街景、地圖對位與空間推理混合的場景,穩定性仍然不足。對做 Agentic、Robotic、世界模型相關研究的團隊來講,360CityArena 的價值正在於它唔再只測單步理解,而係把城市級導航的瓶頸攤開畀人直接比較。

項目主頁 · GitHub

Categories: 開源, Gemini, Agentic, API, 3D, Python, 多模態模型, Robotic, Dataset 數據集

Rest2Art 用單張靜態觀察重建可動 3D 物件

只見到物件關上的樣子,Rest2Art 仍可推回零件結構與關節。對數碼孿生、模擬和機械人操作都幾實用。

Og image

只見到抽屜關上、櫃門未打開,系統仍要估到哪些部分可以動、會沿哪個軸轉或滑,這正是 Rest2Art 想處理的難題。它屬於 articulated object reconstruction,目標是由單一 closed-state observation 重建出可直接放入模擬環境的 articulated asset,而不需要先拍到物件在不同狀態下的運動。

這個做法的價值,在於把原本要靠動態觀察先完成的工作,提前到靜態輸入就處理好。Rest2Art 會先用 vision-language model 與 segmentation model 互相校正零件層級和遮罩,再把結果對應回 mesh;之後再借助 video diffusion model 產生可能的 articulation hypotheses,但真正的 joint parameters 不是直接照抄影片,而是再用幾何一致性去驗證。

回應了一個很現實的限制:很多日常物件未必容易拍到完整開合過程,但建模、模擬與機械人任務仍然需要知道它如何運動。Rest2Art 用 explicit mesh 作為中介,方便跨模型比對與融合,最後再把各部分轉成封閉體積,令輸出不只是「睇得明」,而是可用於 physical simulation。

  • 單靠 single closed configuration 重建 part-level geometry 與 joint parameters
  • 結合 vision-language model、segmentation model 與 video diffusion model 補足缺少 motion cues 的問題
  • 以 explicit mesh 做 cross-model verification and fusion,減少不同模型輸出互相衝突
  • 可輸出 simulation-ready articulated asset,並支援 URDF 匯出

論文描述顯示,它在 reconstruction-based、generation-based 與 modular pretrained-model families 之間,都能做到有競爭力的表現,重建出的零件分解與關節亦具備 physical plausibility。對數碼孿生、虛擬場景整合、real-to-sim-to-real,以及機械人 policy learning 而言,這種由靜態觀察直接產生可互動資產的流程,明顯比只重建外形更進一步。

項目主頁

Categories: Video, 3D, 多模態模型, 影像處理, 視覺模型, Dataset 數據集, 框架

Page 2 of 20
1 2 3 4 20