Calliope:由故事到成片 : ComfyUI 本地工作流

Calliope 將故事拆成劇本、鏡頭片段,再交由本機 ComfyUI 生成影片,兼顧創作流程與資料私隱。

Repository image for benjiyaya/Calliope

由一個故事構想開始,Calliope 會整理情節節拍、角色與場景,再按場景寫出貼近劇本的內容,拆成多個鏡頭片段交給 ComfyUI 生成影片。它屬於本地優先的 story-to-video 工具,處理的是文字創作與影片生成之間需要反覆整理、分鏡和合成的工作。

LLM 負責故事結構及逐場景腳本,ComfyUI 則按既有 workflow 和模型逐個產生片段,兩者分工清楚;完成後再由 ffmpeg 加入 crossfade、匹配音量並串成完整影片。項目資料放在 SQLite,媒體保存在本機資料夾,只有你指定的 LLM endpoint 可以是雲端服務,因此私隱程度和可控性較依賴本身的模型及 ComfyUI 配置。

Make AI Micro Dramas From Script to Video Locally Using Calliope 1.5

使用前需要 Python 3.11+、Node.js 18+、已安裝模型的 ComfyUI、OpenAI-compatible LLM endpoint,以及可從 PATH 呼叫的 ffmpeg。前端是 SvelteKit,後端採用 FastAPI;啟動兩者後,在 Settings 設定 LLM、ComfyUI URL 及可選的 agent 分工,亦可調整並行工作數、輪詢間隔和等待上限,長時間影片工作可把預設 30 分鐘 timeout 延長,或設為無限等待。

適合需要保留素材在本機的個人創作者、小型製作團隊,以及已經建立 ComfyUI workflow、想加入故事編排層的使用者。Dry-run 只會產生佔位結果,不能用來判斷真正的影片效果。

  • 流程完整:由故事、劇本、分鏡到片段合成集中處理
  • 本機優先:項目資料與媒體不必上載到雲端
  • 依賴明確:需要自行管理 ComfyUI、模型、LLM endpoint 和 ffmpeg
  • 可調整佇列:支援並行數、輪詢設定及長任務 timeout

GitHub

Categories: 開源, ComfyUI, Agentic, AI productions, API, Video, 工具, Content Creator, Python

VideoGen-Agent 讓影片生成懂得規劃、驗證與修正

影片生成不再只靠一次輸出,VideoGen-Agent會分步使用工具,檢查結果後再修正畫面與內容。

VideoGen-Agent logo

面對需要維持人物身份、物理關係、場景構圖或事件次序的提示詞,一次生成往往難以兼顧所有要求。VideoGen-Agent以多模態代理配合強化學習,讓影片生成流程加入規劃、工具操作和視覺驗證,逐步處理這些容易出錯的部分。

代理會在多輪互動中協調 augmentation、generation 和 verification 工具,根據提示詞及中途觀察結果決定下一步行動。訓練先以教師生成的工具使用軌跡建立基本行為,再透過 multitask agentic reinforcement learning 改善工具選擇和生成品質,並以混合獎勵同時評估工具呼叫有效性、任務配合程度及影片效果。

VABench 包含600個提示詞,涵蓋程序知識、單一及多個實體的身份保持、物理一致性、場景構圖和多鏡頭時間結構。以 Seedance 1.0 T2V 作為基礎生成器時,VideoGen-Agent分數由56.5提升至75.6;推理時換用 Toolset 2,即使不重新訓練代理,分數仍升至86.1,人類評審在雙選比較中有84.3%偏好升級後的配置。

• 以多步驟代理流程取代單次影片生成
• 結合 augmentation、generation 和 verification 工具
• 針對身份、物理一致性及事件順序等難題作出驗證
• VABench涵蓋600個多類型提示詞
• 程式碼及資料集當時仍標示為即將推出

這種做法較適合需要精準遵循複雜提示詞的影片創作、研究評測及工具驅動工作流。它仍依賴可用的生成與驗證工具,代理表現亦會受基礎模型、工具能力和評估方式影響,不能把分數提升直接視為所有影片場景都能獲得相同效果。

項目主頁

Categories: 香港中文大學, Agentic, AI productions, Video, 提示詞

Gricea:把 AI 研究變成可重用的開放工作流

Gricea讓研究團隊設計、執行及分析人機對話實驗,並保留可重用的研究脈絡。

image

研究人員測試 AI 對信任、偏見或使用習慣的影響時,往往要自行處理分支流程、隨機分組、對話介面與事件記錄。Gricea提供一個開放平台,讓團隊在同一套工作流內設計受控的 Conversational AI 研究、收集互動資料,並比較不同研究設計。Gricea 就是把這整套東西做成一個可運行、可分享的研究實驗。

用一個例子說明,假設你想研究:「廣東話 AI 客服,用 GPT 類模型還是本地模型,使用者會覺得較有幫助?」

你通常要自己做很多東西:
-做一個受試者能使用的聊天網頁
-設定 chatbot 用哪個模型、system prompt、知識庫與工具
-把受試者隨機分兩組:A 組用模型 A,B 組用模型 B
-安排任務,例如「請 AI 幫你處理退貨」
-收集聊天紀錄、完成時間、滿意度問卷
-確保別人日後可以用同一個流程再做一次

平台以可編輯的視覺流程建立器編排研究,支援 within-subject 和 between-subject 設計、隨機化、條件分支及邏輯控制。研究人員亦可加入 LLM 聊天介面、bias manipulation、RAG-based context retrieval 和 streaming responses,觀察模型設定或對話脈絡改變後,參與者行為如何變化。

• 記錄訊息、點擊及其他行為事件
• 連結參與者路徑、回應、replay 和研究層級分析
• 以 consent 版本管理、遮罩 replay,限制研究資料存取

Gricea 同時提供參與者管理、資料分析、研究分享及公開研究瀏覽功能,公開項目可以作為其他研究的模板。研究團隊可研究「奉承式 AI 如何改變信任」等問題,也可比較 RAG 介面、對話風格或教育問卷設計;平台的價值在於保留完整 study artifact,方便其他人檢視、修改及重新部署。對需要可重現流程、細緻互動記錄和社群協作的 Conversational AI 研究尤其合適,但資料貢獻仍涉及私隱及同意範圍,研究團隊需要自行界定收集與分享的界線。

項目主頁 · Paper

Categories: Agentic, RAG

[技術文章] MintAct 把跨平台視覺代理整合到單一模型

由手機、桌面到網頁操作,MintAct嘗試用一個輕量模型兼顧定位、導航與視覺工具使用。

Hero image preview

蘋果電腦即將推出一個視覺語言模型系列,它統一了跨行動裝置、桌面和Web的多步驟導航以及視覺化工具,並已在 2B 、4B 和 8B 上進行了訓練。蘋果認為讓 AI 直接操作手機、桌面或網頁,單是看懂畫面並不足夠,還要準確點擊目標、完成多步驟任務,以及在需要時呼叫外部工具。MintAct 是一系列統一的 vision-language models,針對這些分散能力提供單一視覺代理,並推出 2B、4B 與 8B 三種規模。

通常做法是 UI grounding、手機導航、桌面控制、網頁導航及視覺工具使用各自訓練專門模型。這種 per-domain specialist 範式需要分開維護,模型之間亦可能因觀察空間、動作方式和資料來源不同而互相干擾;直接混合資料,更可能令各領域表現下降。MintAct 改用多階段訓練,先以 grounding 和多步驟監督學習建立基礎,再配合強化學習(reinforcement learning,RL)整合跨平台能力。

項目的關鍵不只在模型本身,也包括支援訓練的環境和資料基礎設施。團隊讓數百個不同後端的環境並行運作,同時收集 trajectory data 和進行 online RL;非同步框架則控制不同領域的訓練比例,減少環境速度不一、回饋雜訊及 off-policy drift 帶來的不穩定。

MintAct 在相近模型規模下,聲稱能追平各領域專門模型的表現,並在 OSWorld-Verified 取得 48.9 分的結果。對需要在裝置端運行、又不想同時服務多個專門模型的工作流而言,這種統一設計具備實際吸引力,但跨領域互相干擾、環境回饋可靠性和長時序任務穩定性,仍是部署時需要持續驗證的限制。

  • 統一 UI grounding、多步驟導航及視覺工具使用
  • 覆蓋手機、桌面與網頁環境
  • 提供 2B、4B、8B 模型規模
  • 透過非同步 RL 控制跨領域訓練分佈
  • OSWorld-Verified 得分為 48.9

Paper

Categories: Agentic, 模型訓練, Google, 框架, 工具, 蘋果, UI/UX

RecreationWorld:從操作到重建軟件介面

代理不只觀察介面,還要自行寫程式、啟動成品及核對結果,測試由操作走向完整交付。

RecreationWorld logo

給代理一個正在運行的參考程式,它要邊操作、邊寫程式,再自行啟動及檢查成品。RecreationWorld 是研究混合式電腦操作代理(hybrid computer-use agents)的五平台框架,處理代理能否按可見行為重建軟件的問題。

它把參考程式當作可執行判準,讓代理反覆進行探索、實作與驗證,而非依固定階段完成任務。最終評分看功能與畫面是否吻合,不要求源碼、語言或架構相同,保留了實作自由。

  • 涵蓋 Ubuntu、macOS、Windows、Android 與 Web
  • RecreationBench 提供 250 個未公開於訓練流程的應用任務
  • 同時採用程式化檢查與視覺模型(Vision-Language Model,VLM)評分
  • 可比較完成度、接近滿分的應用比例及每項任務成本

已列出的結果中,GPT-6 Astra 平均 58.06%,領先 Claude Opus 5 的 44.16%,但估算成本達每項任務 115.80 美元;較便宜的模型則要接受明顯分數差距。這反映長時間探索、編碼與視覺核對仍然昂貴,而且只有少量應用能達到完整功能分數。

開發代理、GUI 自動化或程式生成系統的團隊,可下載 RecreationBench 資料集並依儲存庫的 Quickstart 配置環境;自行託管模型的正式評估需要聯絡團隊。它較適合作研究與模型比較,未見足夠資料證明可直接充當一般軟件重建服務。

項目主頁 · GitHub · 數據集

Categories: 開源, 阿里巴巴, Agentic, 視覺模型, 多模態模型, 模型訓練, Qwen, 框架, Mac, Linux, 庫, Dataset 數據集

小米公開 CodeMidas 強化學習訓練進度

小米以即時指標公開 mimo-v2.6-pro 與 mimo-v2.6-flash 的強化學習訓練狀態,並連結至程式編碼代理研究。

CodeMidas 把模型訓練過程帶到公開視野,展示 mimo-v2.6-pro 與 mimo-v2.6-flash 兩組 reinforcement-learning runs 的即時指標。對需要追蹤模型能力如何形成的研究者和開發者而言,這類介面可用來觀察訓練是否持續、何時中斷,以及不同模型版本的進度差異。

小米以 trainer 直接提供的 metrics 為主,未有完整列出指標定義、數值解讀或最終評測結果。因此,讀者可以把它視為訓練監察入口,而不是已完成模型的性能報告;畫面亦提示可能出現重新連線狀態,資料連續性仍需留意。

根據 CodeMidas 研究,mimo 從程式碼本身擴展 agentic coding reinforcement learning environments。這個方向處理的問題,是如何建立足夠多、又能反映真實編程任務的訓練環境,讓 coding agents 在程式修改、執行與驗證等流程中學習,而不只依賴靜態範例。

資訊:
– 同時追蹤 mimo-v2.6-pro 與 mimo-v2.6-flash 的強化學習訓練
– 指標由 trainer 即時更新,適合觀察訓練進程
– CodeMidas 聚焦由程式碼擴展 agentic coding RL environments

對模型研究、AI agent 和編程工具開發者來說,頁面提供了一個觀察訓練公開化的窗口;一般使用者則應等待正式模型說明和獨立評測,才適合判斷其編碼能力及穩定性。

項目主頁 · 模型

Categories: 開源, 香港大學, 北京大學, Agentic, 模型訓練, 工具, Discord, 編程, 小米-Xiaomi

lanshu-create-ai-presenter-video:數字人影片 Skill:一張圖+文案自動生成完整講解影片

一個針對通用數字人影片製作 Skill。你輸入主題或文案,再加一張授權人物圖,它就會按完整配音時間軸組織生成、剪輯同驗收,輸出一條可發佈嘅講解片。

Repository image for cclank/lanshu-create-ai-presenter-video

做數字人講解片最麻煩嘅地方,往往唔係生成人物,而係口型、文字同聲音對唔齊,最後剪埋一齊就甩拍。lanshu-create-ai-presenter-video 嘅切入點正正喺呢度:佢將「完整配音」鎖定為全片時間基準,人物主素材、字幕、關鍵詞動效同鏡頭轉場都跟住呢條音頻排,從而減少口型漂移同片段接駁嘅問題。整個項目屬於 Agent Skill 工具,由 Codex 或其他兼容本地 Skill 嘅 Agent 環境直接調用,源碼本身唔綁定任何特定服務商、模型或私有接口,可以按當前環境可調用嘅能力動態選擇配音、人物生成同口型同步工具。

最低門檻只需要一份主題或文案,再加一張已授權、包含清晰成年人物嘅參考圖。聲音樣本、屏幕錄影、B-roll、品牌素材、目標平台、時長、橫豎屏同風格等都係可選輸入,畀進階用戶調整。Skill 目錄會隨階段讀取對應參考文檔:generation.md 處理文案、聲音、能力選型同人物提示詞;editing.md 負責時間軸、字幕預設、封面同導出;qa-recovery.md 處理技術驗收、人工驗收同常見故障修復,避免一次過佔用過多上下文。

預設輸出係 9:16、1080×1920、30fps 豎屏,時長 45 至 75 秒,發佈響度目標約 -16 LUFS。初始化可透過 init_job.py 自動建立標準任務目錄同 job.json,preflight.py 會做前期檢查,最後由 finalize_delivery.sh 收尾輸出,同時產出 QA 報告。環境要求 Python 3.9+、FFmpeg/ffprobe、Bash、jq、awk、sed,以及至少一種可調用嘅影片生成、語音生成同口型同步能力。

佢唔係一個獨立嘅模型,而係一套組織數字人影片工序嘅 Skill 框架,價值在於把配音、人物、字幕、剪輯、驗收等步驟統一在同一條音頻時間軸上,避免最常見嘅口型錯位同片段斷裂。內容創作者、行銷團隊、課程錄製同需要快速產出講解影片嘅場景會較受惠,特別係想喺不同 AI 服務商之間靈活切換、又唔想被單一平台鎖死嘅人。

  • 以完整配音為全片時間基準,減少口型漂移同片段接駁問題
  • 源碼不綁定服務商或模型,可按環境動態選擇配音、人物、口型工具
  • 三份參考文檔按階段讀取,控制上下文用量
  • 預設 9:16 豎屏、1080×1920、30fps、主題片長 45–75 秒
  • 支援聲音樣本、B-roll、品牌素材、平台、橫豎屏等可選參數

GitHub

Categories: 開源, Agentic, AI productions, 數字人, Video, Audio, 提示詞, 框架, Content Creator, Python, 語音, Skill 技能

XGEN-JING 世界模型開源:邊走邊生成影片與音效

XGEN Labs 把互動式第一人稱世界模型 JING 開源:輸入動作與參考圖,就能邊走邊生成對應影片與環境音效,等於把世界模型變成可即時體驗的 demo。

過往的世界模型 demo 多半停留在「按一個鍵播一段片」,XGEN-JING 想把互動感再推一步:鍵盤操作鏡頭、輸入文字引導角色對話,模型即時生成第一人稱影片與配對音訊,並以參考圖約束人物、物件與場景的一致性。這個項目是一個以 MiniMax-H3 為骨幹的 egocentric interactive experience 模型,屬於世界模型 / 互動影片生成一類,目標是讓「在同一個起點做出不同選擇」這件事變得可視聽。

XGEN-JING 的核心差異在「四步雙向推論」與即時性:JING-Flash-v1 用四個步驟完成推論,再把動作、觀察歷史、參考圖同時餵進去生成下一段片段;鏡頭移動、物件互動、人物對話都由文字與按鍵驅動,而畫面與聲音同步輸出,所以更像「邊走邊生成」而不是「先想好再剪片」。

Step Into a World That Responds | XGEN Labs

這版本同時提供 Inference code、examples 與 Prompt skills,後者可以從故事與參考圖自動生成經過驗證的推論案例,降低試錯成本;但因果模型與技術報告尚未釋出,想深入架構細節的人需要再等等。硬件門檻亦偏高:項目方以六張 H100 做驗證,其中一張跑 text encoder、一張跑影音 VAEs、四張跑 DiT 加 sequence parallelism,並指定 FlashAttention-4 為預設後端。

以下幾類人會比較快從中受惠:做世界模型研究、需要互動 demo 的研究者;做遊戲 / VR / 沉浸式敘事、需要快速產出第一人稱體驗的開發者;以及關心 video generation xa in 2026 路徑、想理解「影片 + 音訊 + 動作」三軸如何耦合的團隊。對一般玩家或創作者而言,Hugging Face 上的模型頁與 xgenlabs.ai gallery 已足夠先看 demo,再決定是否投入本地部署。

重點摘要

  • JING 是以 MiniMax-H3 為基礎的第一人稱互動體驗模型,支援鍵盤控鏡、文字對話與參考圖約束。
  • JING-Flash-v1 以四步雙向推論同時生成影片與音效,比單向生成更貼近即時體驗。
  • 官方硬件門檻為六張 H100(1 text encoder + 1 VAEs + 4 DiT),預設 FlashAttention-4,後端依賴 SGLang 特定 commit。
  • Prompt skills 可從故事與參考圖自動產生驗證過的推論案例,方便快速試玩法。

項目主頁 · GitHub · 模型 · 影片集

Categories: 開源, AI productions, 模型, 視頻模型, 世界模型, Google, NVIDIA, Video, Audio, Content Creator, MiniMax, Skill 技能

EvoSkill-GUI 讓 GUI Agent 在執行中即時修正技能

浙江大學 ZJU-REAL 團隊開源 EvoSkill-GUI,毋須額外訓練,透過結構化技能包、即時修正與自我檢討機制,讓 GUI Agent 在 MobileWorld、AndroidWorld、OSWorld 三個基準上明顯提升成功率。

Comparison between static skill methods and EvoSkill-GUI

當手機或電腦彈出視窗、載入延遲、介面元素位置變動,原本寫好的 GUI 操作步驟往往幾步之後就失效。EvoSkill-GUI 正正回應這個痛點——它是浙江大學 ZJU-REAL 團隊推出的開源框架,毋須微調,就能讓 GUI Agent 把「技能」從靜態提示詞變成可即時修補、可重用的程序知識。

以往的 skill-based agent 把規劃、定位、復原規則全部塞進同一份文件,出錯時難以精準修補。EvoSkill-GUI 將每項技能拆成結構化套件,內含計劃、後備定位、復原規則、無障礙工具、檢索 metadata 與失敗案例等獨立檔案,並以 metadata 索引,後續按意圖、應用、平台等條件快速取出對應經驗,而非逐字比對長篇技能文件。

它的核心設計是「同一個骨幹模型」兼任執行者與批評者。執行時若觀察到介面與計劃不符,會即時修補局部錯配,避免小錯滾成大錯;失敗後模型會在嚴格資訊隔離下診斷軌跡,只針對出問題的檔案做精準編輯,毋須額外更強的反思模型輔助。

在 MobileWorld、AndroidWorld、OSWorld 三個基準上,無論通用模型還是 GUI 專用模型,EvoSkill-GUI 都帶來穩定提升,最高絕對增益分別為 +16.2、+6.0、+10.5 個百分點。對做行動 App 自動化、桌面助手或 RPA 的團隊而言,這種毋須重訓又能累積經驗的設計相當實用;不過整套機制依賴骨幹模型本身的反思品質,任務越長、介面越動態,回報會越明顯。

重點摘要:

  • 訓練免費用:以 single-backbone self-evolution 機制,省掉外部批評模型與微調成本。
  • 技能拆件:把計劃、定位、復原拆成獨立可編輯檔案,方便精準修補。
  • 即時修正:在 rollout 內偵測到介面變化就立刻修,避免錯誤擴散。
  • 資訊隔離批評:批評階段只看指令、觀察與動作,避免偷看草稿或答案。
  • 跨基準驗證:在 MobileWorld、AndroidWorld、OSWorld 三項皆有顯著絕對增益。

項目主頁 · GitHub

Categories: 開源, Agentic, 模型訓練, 提示詞, 框架, 工具, Skill 技能

[技術文章] Coding harnesses 編程代理 : Context 管理、規劃與動作介面誰最影響表現?

同一個模型,搭配不同的 coding harness,表現可以差很遠。這份實證研究把 harness 拆成三個零件逐個測,告訴你哪個零件在邊種情況下真正有作用。

Hero image preview

在 SWE-Bench Verified、Terminal-Bench 2.1 呢類基準上,坊間討論往往直接以「Claude 用某個 harness 表現最好」作結,例如 Cao et al. (2026) 比較後發現 Claude-Opus-4.5 配 OpenHands 最強,而 Claude-Sonnet-4.5 則在 SWE-Agent 上表現較佳。問題係,當我哋直接比較兩個完整嘅 harness,所觀察到嘅差異其實係 plan、action space、context management 三個零件同時變化嘅結果——換句話講,「邊個 harness 比較好」呢條問題,根本答唔到「邊個零件有用」。作者指出,以往研究多把 harness 視為單一系統去比,結果令個別零件嘅效用難以釐清。

為咗拆開睇,呢篇論文用咗一個輕量級 coding harness,固定執行迴圈,只改動三個零件:規劃、動作空間、上下文管理。團隊用四個模型喺 SWE-Bench Verified 同 Terminal-Bench 2.1 上測試咗 176 個配對設定,涵蓋五種上下文管理策略、四種上下文視窗預算,再加規劃同動作空間嘅針對性消融。

研究發現幾個有趣嘅條件性效果。第一,context 管理喺視窗預算愈緊嘅時候愈有價值,大部分效益其實嚟自避免 context-overflow 失敗,而非提升行為質素。第二,在眾多策略中,「先做規則式 elision、再做 LLM 摘要」呢種分階段做法整體效率最高;允許被刪內容可恢復嘅機制,模型幾乎唔會用到,亦無帶嚟準確度提升。第三,規劃嘅角色會隨模型能力變:對弱模型係準確度嘅支柱,對強模型就變成慳成本嘅工具,準確度變化唔大。第四,預定義工具對 bash 能力弱嘅模型有幫助,但 bash 能力強嘅模型只需要 bash 介面就夠,而且喺命令行主導嘅任務上成本低好多。

軌跡分析進一步解釋:context 管理延長執行軌跡但唔大幅改變行為,規劃改變軌跡停止嘅位置,動作空間就改變程式碼被寫出嚟嘅粒度。換句話講,三個零件影響嘅其實係代理行為嘅唔同面向。對從事編程代理相關工作嘅人,呢套模組化框架提供咗一個可以繼續累積、比較新零件嘅方法,亦提示設計時要按模型能力同預算做取捨,而非盲目堆砌功能。

重點摘要:

  • harness 唔應該當成單一系統去比,拆開 plan、action space、context management 三個零件先睇得清
  • context 管理喺視窗愈緊愈有用,核心係防 overflow,而非提升行為質素
  • 規則式 elision 配合 LLM 摘要嘅分階段策略,效率表現最好
  • 規劃對弱模型係必需、對強模型只係慳錢
  • bash 能力夠強嘅模型用純 bash 介面,喺 CLI 任務上可以大幅降低成本

Paper

Categories: Agentic, 框架, 軟件, 工具, 編程

Page 2 of 35
1 2 3 4 … 35