MBA:把商業點子變成多模態評測題

MBA 將商業點子生成拉回真實場景,讓模型不只看文字,還要理解圖片、情境同市場證據。它同時提供評測基準同兩個 agent 訓練版本,方便比較不同取捨。

teaser

MBA(Multimodal Benchmark and Agents for Real-World Business Ideation)把原本偏文字的商業構思流程,改成要連圖片、場景同市場證據一齊理解的多模態任務。對做產品構思、創業點子篩選或研究 agent 的團隊來講,重點唔係生成幾多答案,而係點樣喺真實視覺線索下提出夠新意、又講得通的方案。

這個項目同時提供 MBA-Bench 同兩個 agent,MBA-b 同 MBA-k。前者偏盲測設定,後者會利用已知標準,兩者都用 LoRA-based supervised fine-tuning,再接 group relative policy optimization,並加入 creativity、feasibility 等獎勵去訓練。

官方資料提到,MBA-Bench 有 30K 筆樣本,涵蓋六個有明顯視覺線索的領域,評估亦用多個商業向準則去看答案是否具體、可行、具差異化同可擴展。這代表它不只是比模型「講得靚」,而是逼系統在多個限制之間作取捨。

倉庫提供環境設定、資料準備、訓練同推理流程;資料亦可從 Hugging Face 取得,適合想重跑基準、改 reward 設計,或者把 multimodal agent 套到商業 ideation 工作流嘅研究者同工程團隊。現階段最它把 business ideation 由純文本任務,推向更接近現實訊號的評測框架。

  • 同時有 benchmark 同 agent,方便做訓練、比較同復現
  • 強調圖片與市場證據,唔再只靠文字提示
  • 以 creativity 同 feasibility 作核心獎勵
  • MBA-b 同 MBA-k 對應 blind 與 known 兩種設定
  • 適合做多模態 agent、產品構思同商業研究的團隊

項目主頁 · GitHub

Categories: 開源, Agentic, 多模態模型, 模型訓練, Dataset 數據集, 框架

S2R 用物理模擬解決影片反光

隔住玻璃拍片常見嘅反光,會令畫面難睇又影響後續辨識。S2R 把合成、去反光同評測串成一條流程,重點是先補足可信訓練資料。

Og image

隔住玻璃拍攝時,反光往往唔只影響觀感,仲會干擾偵測、辨識同追蹤等後續視覺工作。S2R 屬於影片去反光項目,重點唔係單靠清理單幀畫面,而是同時處理資料不足、時間連貫性同評測基準缺位三個卡位。

呢個項目用一個閉環流程連接 S2R-Synthesis、S2R-Removal 同 S2R-Benchmark。前段先以 Physics-Grounded Augmentation 與影片擴散生成方法合成成對影片,控制玻璃粗糙度、反射率、厚度等性質;後段再把 pretrained video diffusion prior 調整成適合去反光的模型,加入 reflection-aware latent adaptation 同 one-step pixel-geometric refinement,減少殘影並維持時序一致。

它跟常見做法最大分別,在於先把反光結構同外觀拆開處理。S2R-Synthesis 會從 FLUX-generated pseudo videos 學習較真實的反光外觀,再把兩段乾淨影片經 Physics-Grounded Augmentation 融合,生成可配對訓練資料,避免只靠傳統合成或少量真實資料,令模型較難學到穩定的影片反光模式。

  • 用物理約束方式合成反光影片,補足 paired video data 不足
  • 以 diffusion-based video dereflection 處理影片,強調跨幀一致性
  • 提供 S2R-Benchmark,兼顧 full-reference 評估同真實場景人類感知評估
  • 在 OpenRR-1k 的結果中,加入完整 PGA 後,PSNR 與 SSIM 都比基線再提升

現有資料顯示,S2R 特別適合需要穿玻璃拍攝的內容整理、監控視覺流程,或者任何重視畫面可讀性與後續分析品質的工作流。項目亦反映一個明確取捨:先花力氣建立可信的反光合成與評測系統,再用 diffusion-based 方法做移除,換來較完整的訓練閉環,但最終表現仍會受真實場景複雜反射型態影響。

項目主頁

Categories: Stable Diffusion, Video, Image, 小米-Xiaomi, Dataset 數據集, 框架

Self-Geometry 補強 3D VFM 幾何一致性

同一個場景睇落都幾準,跨視角一對就出現幾何唔一致,正正係 Self-Geometry 想補上的缺口。它用測試階段微調,幫現成 3D Vision Foundation Models 把深度、位姿同 pointmap 對齊。

icon

單張推理已經夠快,但去到多視角場景,depth、camera pose 同 pointmap 未必互相講得通,之後做重建、定位或者室內掃描就會累積誤差。Self-Geometry 屬於 3D 視覺模型適配流程,重點唔係重新訓練一個新模型,而係喺測試階段替現有 3D Vision Foundation Models 補回明確幾何約束。

它採用 GT-Free 的 Test-Time Adaptation (TTA),直接由 2D pixel correspondences 生成 pseudo ground-truth,再把 Multi-View Consistency、Epipolar Consistency 同 Gradient Disentanglement 組合起來,減少幾種幾何訊號互相拉扯。配合基於 SO(3) geodesic distance 的 Frame Angular-Neighbor 抽幀方式,以及用 LoRA 做 Lightweight TTA,部署理解上比較直接:你可以把它視為加喺 VGGT、π³、DA3-Giant/Large/Base/Small 之上的後處理適配層,而唔係取代原本 backbone。

同類做法常見會依賴模型自己輸出的隱式一致性訊號,Self-Geometry 則改為在測試時加入顯式 multi-view geometry constraints。取捨亦好清楚:它換來較穩定的 pose estimation 同 geometry estimation 改善,但仍然要針對每個 scene 做一次短時間適配,未必適合極端低延遲或單張即時推理流程。

現有資料指出,它在六個 VFMs 同四個 benchmarks,包括 7Scenes、ETH3D、ScanNet++、HiRoom,都有一致提升,而且每個 scene 的適配可在兩分鐘內完成。互動示例亦提供 baseline 與 Self-Geometry 的 pointmap、depth-map 對照,以及相對 TCO、Free-Geometry 的 depth-error、pointmap-error 視覺比較,較適合做 3D reconstruction、camera localization、室內空間感知,或者想保留既有 VFM 而補強幾何一致性的研究團隊同工程項目。

  • 針對預訓練 3D VFM 的多視角幾何不一致問題,而唔係另起一個新模型
  • 用 2D pixel correspondences 當 pseudo ground-truth,避免依賴真實標註
  • 可直接套用到 VGGT、π³、DA3 系列,核心形式屬於 plug-and-play TTA
  • 已公開互動比較與定性結果,重點放在 depth、pointmap 與 pose 的一致改善

項目主頁 · GitHub

Categories: 開源, 3D, 框架

VoxWeave:Windows 本機 RVC 變聲工作站

把音頻、影片、麥克風同批次任務收在同一個桌面工作站,VoxWeave 走的是本機離線處理路線。它重點解決變聲流程分散、結果難追蹤,同時保留即時變聲與批量轉換。

VoxWeave

VoxWeave 是一套面向 Windows 的 RVC(Retrieval-based Voice Conversion)變聲工作站,定位很清楚:把離線轉換、即時麥克風變聲、批量處理和結果追蹤放進同一個桌面流程。它適合要穩定處理音頻、歌曲或影片音軌的人,也適合需要交付產物、查看失敗原因和保存位置的工作場景。

使用方式偏向本機部署而不是雲端服務。EXE 不內置大體積環境或模型,首次使用可在介面內按需下載經哈希校驗的運行組件與推薦模型;來源倉庫也保留 Linux 和 macOS 的邊界,但目前真機驗收集中在 Windows 11 與 NVIDIA CUDA。

它和常見變聲工具最大的分別,在於把狀態、任務、批量規則、即時會話、產物與歸檔都收進 SQLite 作為單一真源,連診斷匯出都會帶上運行時、模型和日誌清單。這種做法讓問題排查和重試更直接,但代價是它明確不提供虛擬聲卡、模型訓練或 GPT-SoVITS,定位比完整聲音工坊收得更窄。

  • 支援音頻、影片、資料夾和麥克風輸入,流程集中。
  • 可做離線轉換、即時變聲與批量處理,結果可追蹤。
  • 模型按原路徑登記,會計算權重和索引的 SHA-256,不會複製或改名。
  • URL 模型需要提供來源、最終大小和 SHA-256,授權不明時會明確標示。
  • 目標較適合 Windows 本機使用者、內容製作流程,和需要留存產物與錯誤記錄的團隊。

GitHub

Categories: 開源, NVIDIA, AI productions, Linux, Mac, Win, 語音

WorldClaw 把一句提示詞變成可編輯 3D 世界

WorldClaw 將開放式描述轉成可探索、可修改的 3D open-world scene,重點不只在生成,還在把世界結構交到使用者手上。它適合想快速做場景原型、互動展示或內容雛形的團隊。

teaser

WorldClaw 是一個 agentic 3D 生成框架,處理的問題很直接:把一句開放式提示詞,變成一個可以走進去、調整、再延伸的 3D open-world scene。它的價值不在於單次出圖,而是把「生成」和「可編輯」連在一起,令內容創作更接近真正可用的場景製作流程。

這個項目目前更像研究原型與方法展示,重點放在論文、項目頁與流程圖;README 沒有提供完整安裝指令,使用者主要應透過論文和項目頁理解它的工作方式。它由 Tencent-Hunyuan 團隊提出,核心方向是把 agentic 流程套進 3D 世界生成,讓模型不只產生外觀,還能維持場景可探索性與修改空間。

  • 由單一提示詞推進到可互動的 3D 世界,不是只生成靜態資產。
  • 強調 editable 與 explorable,較適合做場景原型和概念驗證。
  • 內容定位偏研究與展示,公開資訊未見完整部署流程。
  • 相比一般 3D 生成方法,它更重視世界結構與後續修改。
  • 對遊戲原型、虛擬場景、數字內容團隊較有參考價值。

從命名和定位看,WorldClaw 把自己放在 3D 生成與 agentic workflow 的交界位,關心的不是單一模型輸出,而是生成過程怎樣逐步組裝成世界。現階段公開材料主要講方法與成果,沒有明確性能表格可供直接比較;讀它時,重點應放在它如何把開放式描述轉成可操作場景,而不是當成現成工具包看待。

項目主頁 · GitHub

Categories: 開源, 騰訊, Agentic, 3D

NCP-Bench 把電影故事變成可逐輪檢查的互動環境

這個基準把電影故事變成可逐輪檢查的互動環境,重點不是講得順,而是能否守住既定事實與劇情承諾。你可以把它理解成用來測試 LLM agent 會否在長對話中改寫故事的工具。

NCP-Bench overview: data construction, interaction history, and evaluation framework

NCP-Bench 是一個 benchmark,加上一套固定 evaluator,用來測試 Interactive Narratives 裡的 Narrative Commitment Preservation (NCP)。它處理的問題很直接:當玩家自由輸入動作時,Narrator agent 會不會偷改已建立的世界事實,或跳過本來應該出現的劇情節點。

使用方式偏向研究與評測流程:每個電影 synopsis 會被轉成 stateful environment,內有 initial fact ledger、narrative commitments 同 ordered reference trajectory;agent 每回合回應後,固定 evaluator 會檢查 fact、commitment 同 player-input conflicts,再更新狀態。儲存庫同時提供 100 個 benchmark environments、方法無關的 episode runner,以及 Baseline 和 HiAgent 參考方法,方便直接比較。

這套做法的價值在於,它不只看文字是否自然,還逼系統在長 horizon 內維持一致性。和只看單輪生成的測試比,NCP-Bench 更接近互動式敘事真正會遇到的拉扯:玩家可以亂入,但系統仍要守住已承諾的劇情骨架。

較適合關心長對話敘事、互動式故事生成、角色扮演型 agent 的研究者與團隊。若要部署,重點不是訓練一個新模型,而是接上既有 narrator,再用 repo 提供的環境規格同 evaluator 跑整個 episode,觀察違反事實、承諾和劇情順序的情況。

  • 100 個 movie-level environments,涵蓋 18 個 genres
  • 每個環境都有 YAML 規格,包含 metadata、facts、commitments 同 trajectory nodes
  • 評測核心是逐回合檢查一致性,而非只看最終輸出
  • 提供 Baseline 與 HiAgent,方便和論文結果對照
  • 適合做長篇互動敘事、Narrative agent 與一致性評測

GitHub

Categories: 開源, Agentic, Dataset 數據集, 框架

dembrandt:把網站風格秒轉成可追蹤的設計 tokens

Dembrandt 直接把網站的 logo、色彩、字體和間距抽成 design tokens,方便你在 AI 工具或 CI 裡持續比對變化。它不只做擷取,還把每次改版的風格漂移記錄下來。

Dembrandt: Any website to design tokens

Dembrandt 係一個用來抽取網站設計系統嘅工具,重點係將 logo、色彩、字體、邊框、陰影等視覺元素整理成 design tokens,方便團隊快速理解一個網站嘅視覺規則。對做前端、設計系統或者品牌一致性檢查嘅人嚟講,佢可以省去逐頁抄資料嘅時間。

使用時要先準備 Chromium,因為它透過 Playwright 核心去驅動瀏覽器,唔裝 browser binaries 就冇得啟動。安裝後可以用 CLI 直接抽取,亦可以透過 MCP 接入 Claude Code、Cursor 或 Windsurf,令 AI 助手幫你讀出 tokens。

同類工具多數只做一次性擷取,Dembrandt 加入咗漂移追蹤同快照時間線,令你可以比較兩次發佈、兩個網站,或者同一個 domain 喺唔同時間嘅變化。佢仲提供視覺差異、分類分數同 baseline 比對,對 CI 監察改版影響特別有用。

  • 可把網站外觀整理成可重用嘅 design tokens
  • 需要先安裝對應 Chromium,否則無法運行
  • 支援 MCP,方便接入 AI 編程工作流
  • 可以記錄快照,持續追蹤設計漂移
  • 適合前端、設計系統同品牌檢查工作

如果團隊要維持多個頁面或多次發布之間嘅視覺一致性,呢個工具比單次擷取更有用。它將抽取、比較同追蹤放埋一齊,令設計變化唔容易悄悄走樣。

GitHub

Categories: 開源, MCP, IDE,

Google DeepMind 把手語 AI 放進用戶手中 涵蓋 30 種 ASL 詞彙

Google DeepMind 將手語識別 AI 整合到日常應用,讓失聰與健聽人士的溝通更自然。

A person signs with one hand while holding a smartphone, demonstrating the Gboard sign-to-text dictation feature.

聾人手語使用者日常面對的最大卡位,是怎樣讓手機或視訊鏡頭直接「讀懂」手語並即時翻譯。Google DeepMind 近期把手語 AI 從實驗室帶到實際產品中,覆蓋約 30 個美式手語(ASL)詞彙並透過 Gemini 模型支援即時回應,目標是讓聾人朋友毋須依賴真人翻譯就能完成基本對話。

這套技術並非單純的影像分類,而是結合姿態估計、語境理解與大型語言模型的能力,把手語動作轉成自然語言並維持對話節奏。比起過去只能辨識孤立詞彙的系統,現時更著重處理連續手語與多輪對話,使翻譯過程貼近真實交流節奏。

DeepMind 同時強調負責任部署,與聾人社區合作收集訓練數據,並透過小規模詞彙起步降低誤譯風險。對於依賴視訊通訊的聾人用戶來說,這項能力讓 Zoom、Meet 等場景下的溝通體驗更貼近健聽人之間的對話節奏。

這項功能適合手語使用者、聾人家屬,以及需要服務聾人客戶的企業。它並非要取代真人翻譯,而是作為日常輕量溝通的輔助工具,降低手語學習門檻並促進更即時的互動。

重點摘要:

  • 覆蓋範圍:支援約 30 個 ASL 詞彙,涵蓋日常問候與基本對話。
  • 技術核心:結合姿態估計與 Gemini 大型語言模型,處理連續手語與上下文。
  • 部署方式:整合到 Google Meet 等視訊應用,即時翻譯手語為文字或語音。
  • 負責任設計:與聾人社區協作訓練數據,從小規模詞彙起步降低誤譯風險。
  • 使用場景:聾人用戶日常視訊通話、聾人家庭成員溝通、企業客服聾人客戶。

項目主頁

Categories: Google, Gemini, Agentic, Video, Audio, 安全, Robotic, 世界模型, Skill 技能

StateFlow 把預視化變成可反覆編修 3D 世界

想像先搭好一個可重用的3D世界,再慢慢改鏡頭、物件同事件。StateFlow想處理的,正是生成式預視化最常見的連貫性問題。

StateFlow teaser

影像預視化最麻煩的地方,往往不是生成一條片,而是改完場景、換完鏡頭之後,前後內容仲要講得通。StateFlow屬於面向 previsualization 的 3D world-state modeling 框架,它把場景視為可持續保存的 3D world states,令同一個世界可以反覆建構、演化、再取用,而唔使每次修改都由頭生成。

呢個做法先處理內容一致性,再處理畫面輸出。StateFlow用 object-centric structured 3D state 去描述世界,每個物件都帶有 geometry、spatial pose 同 semantic attributes,將底層世界內容同最終 render observations 分開,於是場景結構、物件關係、動態事件同 cinematic camera direction 可以分步調整。

整個流程分成三段。State Construction 針對 2D 內容提升到 3D 世界時容易出現的歧義,用 prior-guided、conflict-aware dual-view initialization 建立較一致的起始世界;State Evolution 把使用者修改轉成 structured state transitions,保留 world memory,避免每次編修都重建整個場景;State Access 則配合 render-feedback reflection,把鏡頭意圖修正成視覺上可行的 cinematic trajectories。

  • 把一次性影片生成,改成可編修、可重用的 persistent world
  • 同一套世界狀態可支援 video production 同 3D game prototyping
  • 重點不只是生成畫面,而係保住場景結構、物件關係同時間上的連貫性
  • 鏡頭控制加入 render-feedback reflection,提升拍攝路徑的可行性

使用場景相當清楚:要先做分鏡、試鏡頭、試事件節奏的創作團隊,或者想由 3D scene 快速走到 playable prototype 的遊戲項目,都會較受用。現有內容著重方法展示、應用示例同與 baselines 的 3D scene generation 對比,但未見完整論文與量化細節公開,所以目前較適合視為一個值得留意的工作流方向,而唔係已完全定型的產品規格。

項目主頁

Categories: Video, 3D, 視頻模型, 北京大學, World-Action Model, 框架

spark-to-paper-skills:14 個 Claude Code 技能把點子直出論文 PDF

由一句想法走到可編譯論文,連引用、圖表同數字來源都一併追蹤。呢個 Claude Code 插件瞄準的,不是寫草稿,而是把研究寫作流程拆成可驗證工序。

spark-to-paper-skills

研究寫作最麻煩的地方,往往不是起草,而是引用會唔會失真、圖表能否修改、數字有冇來源可追。spark-to-paper-skills 把呢件事做成 Claude Code 插件型工具鏈,用 14 個可組合技能,將一句想法推進到可編譯 PDF,處理的是論文生成流程入面最容易出錯的核對與整理工作。

它吸引人的地方,在於唔靠獨立 app 或伺服器,而是直接掛入 Claude Code 會話。安裝前提相對簡單,重點是有 Claude Code,另外部分圖像流程需要 Python 3.10+ 同指定依賴;換句話說,這不是雲端代寫服務,而是偏向本機、插件式、可拆件調用的研究寫作工作流。

  • 14 個技能可分步串接,涵蓋資料整理、成稿到 PDF 編譯
  • 引用強調 verified,數字強調 traced to source,主打可追溯性
  • v1.2.0 加入 PaperBanana+ figure engine,圖可重畫成原生 editable vector figures
  • 新版支援 Claude Code plugin 自動載入,部署方式比早期版本完整

同類做法多數把重點放在生成速度,這個項目則把可信度同後續可編輯性放得更前。PaperBanana+ 的做法幾值得留意:先由官方 PaperBanana 產生候選圖,再用 ts-figure-svg 學習該渲染風格,根據論文事實原生重繪,並以 stdlib-only geometry audit 反覆修正至少 4 輪,換來的是圖像更容易進一步編修,但流程也明顯比單次出圖更講究。

目前公開資訊較多集中在工作流完整度。它已展示 7 篇跨 6 個領域的端到端樣本,並支援 ICML 2025、NeurIPS 2025 風格輸出,足以說明這套技能並非只停留在片段 demo。較適合研究助理、學術團隊、技術內容作者,或者需要快速整理初稿但又唔想放棄引用與圖表可追蹤性的人;最終學術品質,仍然要視乎輸入構想、來源材料同人工審稿力度。

GitHub

Categories: 開源, Python, Anthropic, Skill 技能

Page 1 of 133
1 2 3 133