REA:讓 AI 逆向拆解 App 功能至二進制層面

想複製別人 App 的功能,REA 讓 AI 代理在沒有原始碼下調查行為、保留證據,並協助重建。

REA launching its analysis bridge inside Hopper while inspecting a native binary

想知道一個 App 的功能點樣運作,卻拿不到原始碼,REA 讓 AI 代理直接檢查應用程式、原生二進制檔案及執行時行為,再用證據解釋結果。它屬於開源逆向工程工具,實際處理的是由功能觀察、底層分析到重建實作的工作流程。

REA 以 Model Context Protocol(MCP)把分析工具接入代理,代理可按步驟展開調查,讀取工具結果、管理 sessions,並將 snapshots 匯出或匯入。對產品團隊而言,價值不只是找出某個功能的表面行為,而是把調查所得轉化為自己項目的實作參考;不過分析結果仍取決於可取得的執行環境、工具支援及代理判斷,不能視為自動產生的完整原始碼。

How To Use REA To Clone Any Software In Minutes

使用時可先透過 Node.js 設定 agent registration 和 provider,再檢查單一 agent 或 analysis engine 的 readiness。CLI 提供 provider 選擇、證據管理、退出狀態及診斷功能,MCP contracts 和 agent prompts 則用來固定工具回傳格式及引導調查流程。

EP424 - 一句話逆向任何 App?AI 逆向工程 REA,這代表什麼

可留意的重點包括:
– 支援 native binaries、應用程式及 runtime behavior 的逆向分析
– 在沒有 source code 的情況下展示調查證據
– 透過 MCP 連接代理、工具、providers 和 sessions
– 提供 snapshots、import/export、readiness troubleshooting 及 CLI catalog
– 適合產品仿製研究、相容性分析及安全研究,但不保證每次都能還原完整功能

REA 比單次檢查工具更接近一套可重複的代理工作流,適合需要比較競品功能、研究封閉軟件或建立相容版本的工程團隊。項目仍在按 roadmap 擴展能力,採用前應先確認目標平台、分析工具及 provider 是否獲支援。

GitHub

Categories: 開源, Agentic, MCP, 軟件, 工具, 編程, 安全

JEPA 以潛在世界模型加速機器人決策

JEPA 不再逐幀生成畫面,而是在抽象特徵中預測世界如何變化,降低機器人規劃的算力成本。

Og image

機器人或自動駕駛系統需要預測動作帶來的後果,單靠文字推理難以掌握物體移動、空間關係與物理變化。聯合嵌入預測架構(Joint Embedding Predictive Architecture,JEPA)屬於潛在動態世界模型,直接在抽象特徵空間推演未來狀態,避開逐步生成高解析度畫面的成本。

世界模型通常要完成渲染、模擬與規劃三類工作,JEPA 主要集中於模擬和預測。它不重建像素,而是從視覺或感測資料抽取高層次表徵,再預測下一個潛在狀態;這種做法有助減少噪聲影響,亦讓智能體能在較低成本下進行多步策略推演。

文章將世界模型分為三大類:直接生成未來觀測的模型、在潛在空間運作的模型,以及明確表示物件、深度和幾何佔據的結構化模型。JEPA、I-JEPA、V-JEPA 和 DINO-WM 屬於預測表徵路線,Dreamer 和 PlaNet 則以重構型狀態空間支援想像式訓練。

  • JEPA 適合機器人快速規劃及強化學習 roll-out
  • 不生成像素,換取較低算力需求和較高推演效率
  • 視覺生成模型較擅長畫面還原,JEPA 偏向狀態預測
  • 自動駕駛仍可能需要結合 OccWorld 等空間幾何模型

選擇架構時要視乎瓶頸在視覺逼真度、運算預算,還是 3D 空間與物理精準度。JEPA 能有效處理抽象動態,但若項目需要可視化未來畫面或精確描述物體幾何,便可能要配合觀測生成模型或結構化世界模型。

項目主頁

Categories: AI productions, 多模態模型, 世界模型, Google, NVIDIA, 強化學習

[技術文章] HARNESSSQL 讓 SQL 代理在真實資料庫中學習

SQL 代理不再只需一次生成查詢,而是在可執行資料庫內探索、修正錯誤並完成任務。

Hero image preview

面對陌生資料庫,SQL 代理往往要先查看 schema、檢查欄位和值,再執行試探查詢、分析錯誤,最後修訂並提交 SQL。HARNESSSQL(Harness-Native Training for SQL Agents in Realistic Database Environments)是一套面向這類互動流程的後訓練框架,針對模型訓練只學習「問題直接對應查詢」、但推理時才加入執行工具的落差作出修正。

傳統 Text-to-SQL 通常把資料庫視為靜態提示內容,難以涵蓋長時間、多回合的探索。HARNESSSQL 建立隔離且可執行的資料庫環境,配合隱藏的 execution oracles,讓教師模型直接在目標 SQL harness 內完成互動,並只保留經驗證的操作軌跡進行 full-sequence SFT,之後再以 execution reward 進行 RL。

項目的核心做法包括:
• 將 schema 檢查、工具呼叫、查詢執行及錯誤修正納入訓練流程
• 以 sandbox 控制資料庫狀態,保存結果與錯誤回饋
• 只使用可驗證的成功軌跡,減少錯誤示範干擾
• 讓模型適應 Spider 2.0-SQLite 的互動式任務

在 Spider 2.0-SQLite 上,Qwen3-8B 的 execution accuracy 由 15.5% 升至 45.2%,Qwen3-14B 則由 22.2% 升至 54.8%;訓練所得能力亦能轉移至 BIRD-Interact 和 LiveSQLBench。結果反映,資料庫代理要處理複雜工作流,訓練階段同步保留執行 harness,比只在推理階段補上工具更能縮小訓練與使用環境的差距。

Paper

Categories: 開源, 香港科技大學, 清華大學, Agentic, 模型, 模型訓練, Qwen, 微軟, 框架, 香港, 工具, 庫, 強化學習

ComfyUI-VoiceWorkbench:本地語音工作台:逐句修正音高與節奏

不用剪碎音檔,便可逐句調整音高、字詞時長、停頓和尾音,並比較不同錄音版本。

Voice Workbench

想修正一句旁白的語速、音高或句尾拖音時,ComfyUI-VoiceWorkbench 讓你在完整錄音上直接編輯,毋須把每個字剪開再重新拼接。這個項目屬於本地語音編輯工具,實際處理的是生成語音和錄音後期微調之間的卡位;編輯器可作為 ComfyUI 底部面板使用,也能獨立在本機運行。

聲音處理採用一次 Praat resynthesis pass,同時套用整段錄音的時長和音高變化,未修改的預覽則保留原始 WAV bytes。介面可調整 0.75 至 1.25 倍全局速度、全局音高及最多 64 個局部曲線點,亦能處理現有停頓和可靠的 voiced ending;編輯完成後可比較 Original、Edited 與不同生成 take,再回到較早版本。

  • 不用下載模型:內置例子可直接開啟和編輯,Windows 亦可調用已安裝的英文系統語音。
  • 適合本地工作流:支援 Python 3.10 或更新版本,並可接入 ComfyUI custom nodes。
  • 保留人工判斷:字詞邊界只是估算,無聲或不穩定區域不能可靠提供音高目標。
  • 有明確範圍限制:單聲道錄音約 0.15 至 60 秒,AI take 最多 200 字元;服務只綁定 loopback,並非公開共享伺服器。

可選的本地適配器把能力延伸至語音生成和表演編輯:IndexTTS2 支援參考聲線及情緒生成,AuK Base 用於整段錄音的表演編輯,Qwen3 forced aligner 則協助估算字詞邊界。這些元件不是開啟基本編輯器的必要條件,系統語音也不提供聲線複製或情感控制。

適合旁白製作、語音原型和 ComfyUI 使用者處理少量錄音,而不是多人共用的雲端配音平台。尾音延長最多 200 毫秒,目標音高及 voiced 區域亦有上下限;自動對齊不代表每個字都讀得正確,接受修改前仍要逐段聆聽。

GitHub

Categories: 開源, ComfyUI, 模型, Qwen, Audio, 工具, Python, 語音

WeKnora 把企業知識庫變成可問、可做、可追溯的 AI

WeKnora 將 RAG、Agent 與 Wiki 放進同一個知識庫,兼顧企業資料整合、任務執行和私有化部署。

WeKnora: find the answers, and put knowledge to work. Tencent

不只可以問文件內容,WeKnora 會幫你用 AI 操作工具、整理 Wiki,並保留已確認的偏好與事實。WeKnora 是一個開源 LLM 知識框架,處理企業文件理解、語意檢索與多步推理;RAG、Agent 和 Wiki 共用同一套知識庫,減少資料分散造成的落差。

RAG 會結合語意及關鍵字檢索,回答附上原文引用;Agent 可搜尋網頁、呼叫 MCP 工具、執行技能,並在沙箱中處理檔案。Wiki 則把文件整理成互相連結的頁面與知識圖譜,支援編輯、差異比較和版本回滾,適合需要持續維護內部知識的團隊。

  • 支援 PDF、Word、圖片、Excel、XMind 等十多種格式
  • 可同步飛書、Confluence、GitLab、Notion、語雀、RSS 等來源
  • 透過企業微信、飛書、Slack、Telegram、MCP Server 或 API 提供服務
  • 具備多空間 RBAC、審計日誌、任務佇列及 Langfuse 追蹤

模型、向量資料庫及儲存後端都可以替換,內置 29 家模型供應商,包括 OpenAI、DeepSeek、Qwen、Gemini、MiniMax、LiteLLM 和 Ollama。v0.8.2 加入本機瀏覽器操作、MCP Server、對話分叉與回滾,令知識庫不再只負責回答問題,也能參與任務流程。

Docker、Kubernetes、Helm、Lite 單機版及桌面應用都在支援範圍內,資料可以留在本地或私有雲。對重視資料留存、內部協作和可追溯性的企業,這套整合度具備明確吸引力。

項目主頁 · GitHub

Categories: 開源, 騰訊, Agentic, RAG, MCP, Qwen, OpenAI, DeepSeek, Gemini, Image, 框架, KnowledgeGraph, Ollama, 庫, Anthropic, MiniMax, Skill 技能

OuroWorld 讓靜態 3D 世界循環動起來

OuroWorld 把靜態 3D 場景轉成可由移動鏡頭觀看、動作無限循環的 3D cinemagraph,亦毋須手動製作遮罩。

OuroWorld Logo

想把重建好的 3D 場景變成有火焰、流水、物件活動或光線變化的循環畫面,OuroWorld 提供了一條直接的處理流程。它屬於 mask-free 的 3D 動態生成框架,會將任何來源的靜態 3D Gaussian Splatting (3DGS) 場景轉成可從不同視角觀看的 3D cinemagraph。

項目不只處理流體般的局部變化,也涵蓋一般形變、物件運動及 illumination change;輸入可以來自傳統重建,亦可以是 HY-World 2.0、Marble 或 Lyra 2.0 等 3D world model。相比需要逐個區域製作遮罩的流程,OuroWorld 減少了前期標註工作,但動態內容的控制精度和生成結果仍要視乎輸入場景與模型能力。

測試時需準備符合格式的 3DGS 場景,以及描述鏡頭的 camera JSON。c2w 使用 OpenCV convention 的 4×4 camera-to-world pose,K 以像素表示,principal point 必須位於影像中心;項目亦提供 ouroworld-import world 方式匯入場景,沒有 camera JSON 時會採用預設鏡頭配置。README 的資料格式說明對接駁外部 3D 世界尤其重要。

可留意的重點包括:
– 由靜態 3DGS 場景生成動態 3D cinemagraph
– 支援移動鏡頭,而非只輸出固定視角動畫
– 不需人工 mask,並處理形變、物件運動與光線變化
– 可接駁重建場景及多種 3D world model
– 筆者被拒下載 Hugging Face 由 Meta 管理的權重

對 3D 重建、世界模型展示、互動場景預覽及視覺內容製作團隊而言,OuroWorld 的價值在於把靜態資產延伸成可循環播放的動態內容。它較適合研究原型和展示項目,正式製作前仍應檢查鏡頭參數、場景格式,以及長時間循環時是否出現動作或光照接縫。

項目主頁 · GitHub

Categories: 開源, 模型, 世界模型, Image, 框架, 3D, 動畫, Dataset 數據集

用 5 百萬次人類投票煉成的文生圖獎勵機制,公開給開源社群

Arena.ai 提出一套文生圖模型的後訓練方法,把人類偏好分數加上自動評分量尺,結果讓 FLUX.2-dev 與 Ideogram 4 同時衝上排行榜高位。你可以把它理解成幫文生圖模型「補課」的兩條評分線。

Og image

文生圖模型越來越強,但要靠後訓練再往上推,卻卡在同一個難題:到底要拿什麼訊號當作優化目標。Arena.ai 這項工作直接把答案拆成兩條互相補位的獎勵線,再把他們公開給社群參考。

第一條線來自 Text-to-Image Arena 上大約 500 萬組真實人類對決投票,用 Bradley–Terry 目標訓練出一個偏好獎勵模型,負責衡量視覺品質、構圖、美感這些廣義的好看與否。這個偏好模型在 MMRB2 基準上比其他獎勵模型表現更好,而且訓練資料越多,後訓練成果也越好。

第二條線則對應一個偏好資料看不到的問題:圖片可以極漂亮,卻把提示詞裡的物件寫漏、多塞東西,或者走偏要求的風格。Arena.ai 用視覺語言模型自動產生一組評分量尺,針對提示詞忠實度、相關約束、以及常見的獎勵漏洞行為打分,把這些規則式分數一起混入優化目標。

比起 Flow-GRPO 或 DiffusionNFT 這類只靠單一獎勵訊號的後訓練方法,這套組合給人的差別感在於:美感與合規不再互搶資源。經過他們的後訓練食譜,FLUX.2-dev 在 Arena 即時文生圖排行榜上多了 69 分,Ideogram 4 更拿到 1224 分,超越 2026 年 9 月 4 日之前所有公開上架的開源模型。

項目主頁 · Paper

Categories: 開源, 模型訓練, Image, txt2img, 提示詞, 教學, Dataset 數據集, 強化學習

OneSearch-VL:多模體視覺 deep research agent

由單張相片到影片片段,OneSearch-VL 會找出視覺線索、搜尋外部資料,再把證據串成可核對的答案。

OneSearch-VL

由一張相片、相片集合到影片片段,OneSearch-VL 會先定位視覺線索,再檢索外部知識,將相關證據組合成答案。它屬於多模態 deep research agent,處理的是影像內容理解與資料查證之間難以銜接的工作。

核心是 Visually Grounded Evidence Graph(VGEG),把視覺錨點、來源支持的事實和產生答案所需的操作連在一起。VGEG 亦支援資料建立及驗證;Evidence-aware Visual-Grounded Rubric reward(EVGR)則在強化學習中監督證據是否可追溯,以及答案有沒有真正對應影像內容。

項目提供 OneSearch-MI-Bench 和 OneSearch-Video-Bench,分別面向多圖及影片研究能力。輸入資料未列出具體分數或模型名稱,因此不能把它描述成已全面勝過其他視覺研究方案;它較適合用作研究原型、訓練資料管線和 agentic workflow 的基礎。

OneSearch-VL 包含 Agentic SFT、Agentic RL、推理及評估相關目錄,並標示 Python 3.11+;先準備模型、資料集和外部工具,再執行訓練或評估流程。對需要查核圖片來源、比較多張圖片,或從影片整理證據的研究團隊,這種統一處理方式較容易整合到既有工作流,但部署成本和工具依賴仍要自行確認。

• 同時支援單圖、多圖集合及影片
• 以 VGEG 統一視覺線索與外部證據
• EVGR 強調證據可追溯及視覺對齊
• 提供多圖與影片專用 benchmark
• 支援 SFT、RL、推理和評估流程

GitHub · 模型

Categories: 開源, Agentic, AI productions, 模型, 視覺模型, 多模態模型, 模型訓練, Video, Image, 工具, Python, 庫, Dataset 數據集, 強化學習

Compo:以 Spatial Canvas 編排海報中的文字、人物與圖像

Compo 讓你用畫布安排文字、人物與圖像位置,再交由模型生成海報,減少只靠文字描述構圖的反覆試錯。

Compo Teaser

海報生成最難控制的往往不是主題,而是文字、人物和裝飾元素應該放在哪裏。Compo 屬於海報生成模型及介面項目,將 Spatial Canvas Interface 與 Text Specifications 結合,讓使用者直接在畫面中表達二維構圖意圖。

Spatial Canvas 支援四種綁定方式:Semantic Binding 指定文字概念及目標區域,Identity Binding 以參考圖保留視覺身份,Text Binding 同時交代準確字句與位置,Pixel Binding 則放入需要保留的像素內容。Bounding boxes、參考圖片和文字識別資料會一併渲染到畫布,形成模型接收的統一影像輸入。

  • 以畫布補足單靠文字提示難以交代的空間關係
  • Compo 由預訓練 image editing model 改編而成,毋須另建 task-specific architecture
  • 支援 direct inference,也支援 agentic mode 自動規劃畫布
  • 可用於海報、宣傳圖及需要精確排版的視覺內容

Compo 的模型改編重點,是令現有 image editing model 理解不同綁定方式及其組合,而不是從零訓練專用 poster generator。項目亦建立自動產生監督數據的流程,協助模型學習各類 Spatial Canvas 輸入;這比純文字提示更容易控制位置,但使用者仍要準備畫布內容,agentic mode 的自動規劃亦未必取代人工微調。

適合研究人員、設計工具開發者和需要批量製作宣傳海報的內容團隊作為試驗起點,而非直接視作成熟的製作平台。

項目主頁 · GitHub

Categories: 開源, 香港大學, Agentic, 模型, 視覺模型, 模型訓練, 微軟, Image, 影像處理, 香港, 工具, 中國, Dataset 數據集

VibeEdit:以畫布指令精準指定影像編輯位置

圈選、畫線或拖動就能指定修圖位置,VibeEdit 以空間標記處理相似物件難以辨認的問題。

VibeEdit enables image editing with canvas instructions, including circles, scribbles, short notes and drag gestures.

圈選物件、畫幾筆線,或在圖片上拖動指定位置,再補上一句短註記,便能要求模型新增、移除、替換、改變屬性或移動內容。VibeEdit 屬於影像編輯模型,處理的是文字提示難以準確指出相似物件和局部區域的問題。

它採用 Qwen-Image-Edit,以 layer-decoupled conditioning 分開編碼原圖與 canvas instruction,再配合 region-weighted supervised fine-tuning,以及 rubric-guided reinforcement learning(RL)改善局部修改、指令完成度和未編輯區域的保留。訓練資料包含 155 萬組 source–target edit pairs、物件遮罩和結構化編輯描述,畫布指令則由這些資料生成。

  • 支援新增、移除、替換、屬性修改及移動物件
  • 不要求獨立文字提示,空間標記直接表達目標位置
  • 以 419 個人工整理案例測試相似物件選取能力
  • VLM(Vision-Language Model)評分為 79.9,outside-region PSNR 為 32.8 dB
  • 對比 FireRed 的 67.4 分及 24.0 dB,局部編輯和區域保留均較佳

對需要精準修圖的設計、內容製作和研究團隊,畫布指令比長篇描述更容易表達「改哪一件」;但模型仍屬研究項目,程式碼標示為 Coming soon,暫時不能按儲存庫直接安裝或自行重現。評測規模亦只有 419 個案例,結果未必涵蓋所有圖片類型和複雜編輯情境。

項目主頁 · GitHub

Categories: 開源, 模型, 視覺模型, 多模態模型, 模型訓練, Qwen, Image, 庫, 強化學習

Page 1 of 168
1 2 3 … 168