OpenClaw 2.0 重建介面與記憶連續性

OpenClaw 2.0把入門流程、對話延續同穩定性一併重做。對長時間使用 AI agent 的人,差別會先體現在找回上下文同減少中斷。

用得久嘅 AI agent,最怕唔係功能少,而係中途斷線、記唔住之前做過乜,或者想翻查舊對話時搵唔返內容。OpenClaw 2.0 針對呢類問題重做咗網頁體驗,亦加強咗 memory 同 session continuity,令長流程互動唔使成日由頭開始。

今次版本另一個直接影響體驗嘅改動,係 onboarding 變得更簡單。新手由安裝到開始使用嘅門檻降低,而舊用戶就會更在意 reliability pass 帶來嘅穩定性提升;更新說明同時提醒先備份 configuration 同 state,亦提到自動更新失敗時,可以用本地 coding harness 幫手完成更新、排錯同確認 Gateway 正常啟動。

文件列出咗一個幾實用嘅新能力:可以用完整字詞或片語搜尋可見對話內容,之後直接打開相符結果附近嘅訊息。對要追查工作脈絡、整理多輪討論,或者長時間同 agent 協作嘅人,呢個改動比單純加模型選項更有感。

  • 重做 web 體驗,介面與流程更貼近持續使用情境
  • 強化 memory 同 session continuity,減少對話中途斷層
  • 新增對話文字搜尋,可由結果跳回相關訊息位置
  • 做咗大規模 reliability pass,重點放在穩定運行
  • 更新時仍有 migration 要求,Plugin SDK compatibility 亦有保留與修補

OpenClaw 2.0 今次唔係靠單一新模型吸引注意,而係集中修補 AI agent 項目最常見嘅摩擦位:入門、延續性、搜尋同可靠度。對已經把 OpenClaw 放入日常工作流嘅團隊或個人,呢次更新代表系統更接近可長時間依賴嘅狀態;不過升級前後仍要留意 migration 與相容性檢查。

項目主頁

Categories: 開源, Agentic, OpenAI, API, OpenClaw, Anthropic

Code as World: 用於物理推理的智能體

它把物理世界拆成可執行的程式表示,再用代理式流程反覆驗證與修正。你可以把它理解成一套把影像觀察轉成可推演世界模型的方法。

MirroS logo

Code-as-World 是一個面向物理推理的研究項目,核心做法不是直接死記像素,而是把世界整理成可執行的程式表示。這樣做的目的很直接:讓模型不只看見畫面,還能整理出物件、狀態、動態規則與彼此關係,方便後續推演和檢查。

它的做法帶有明顯的工具與模型結合味道,提供 Code-as-World-VL-4B 和 Code-as-World-VL-9B 的本地推理與 QuantiPhy 評估。倉庫也提到可用 Python 3.10 或 3.11 在 CUDA 主機上安裝,代表它比較像研究團隊可重現實驗與推理流程的發佈形式,而不是單純示範頁。

和一般只靠像素特徵做判斷的做法相比,這個項目更著重可執行、可驗證、可調整的世界表示。代價是系統會更複雜,因為它要同時處理抽象、組合、模擬與一致性檢查,但換來的是更適合做反事實推演、診斷與物理場景理解。

  • 把物理世界表成程式,方便模擬和驗證
  • 支援本地推理與 QuantiPhy 評估
  • 4B、9B 版本已釋出,方便比較尺度效應
  • 適合做物理推理、世界模型與多模態研究
  • 量化結果顯示,較大模型的平均 MRA 有提升

對做多模態模型、世界模型、機械推理或具身智能的團隊,這類方法會比較有吸引力,因為它把感知和可執行結構連起來。若工作重點是要從影片或觀測中抽出可重用的物理表示,而不是只做單次辨識,這個項目提供了一條相當具辨識度的路線。

項目主頁 · GitHub · 模型

Categories: 開源, Agentic, 模型, 世界模型, NVIDIA, Dataset 數據集

Semantica 用圖譜為 AI 決策加上可追溯證據

Semantica 把分散企業資料整理成 Context Graph 和知識圖譜,再為 AI 決策保留可審計的來龍去脈。對需要解釋原因、追查來源的團隊,這比單靠向量索引更實用。

Semantica

Semantica 是一個開源 Python 庫,做的是把企業資料整理成可查詢的 Context Graph 與 knowledge graph(KG),再把推理、決策與來源脈絡一併留下。它特別適合需要回答「AI 為何這樣判斷」的場景,因為每一步都能追到資料來源與處理過程。

它的做法不是只做檢索,而是先從零散資料抽取實體、關係和衝突資訊,再處理去重、譜系與本體管理,讓圖譜可直接承接 GraphRAG、因果推理和決策分析。官方也提到可自架,並支援 RDF 與 LPG,方便接入既有資料平台。

Semantica Platform Tour | Knowledge Graphs, Reasoning & Decision Intelligence

對 Databricks、Snowflake,或者受監管行業的資料與平台團隊,比把資料送去第三方 SaaS 更貼近實際要求。它不只服務 AI/ML platform teams,也照顧合規、風險和審計需求,因為 provenance 和 lineage 不是事後補寫,而是系統的一部分。

目前文件強調的是可解釋、可追溯與可自託管,並沒有把自己包裝成單純的模型套件。若團隊已經有 LangGraph、CrewAI 或 LlamaIndex,Semantica 比較像補上「上下文治理」與「決策證據」那一層,而不是取代原本的 LLM 流程。

  • 把碎片化資料轉成可查詢的 Context Graph 和 KG
  • 保留決策來源、譜系與審計軌跡
  • 支援 GraphRAG、因果推理與本體管理
  • 可自架,避免資料先送出企業邊界
  • 適合合規、風險與 AI 平台團隊

項目主頁 · GitHub

Categories: 開源, Agentic, KnowledgeGraph, LangGraph, Python, 庫

OpenMAIC:把課堂內容變成多代理互動教學

把主題或文件直接轉成可互動課堂,連投影片、測驗和小組活動都一併生成。它更像一個面向教學流程的多代理 AI 平台。

OpenMAIC

OpenMAIC 是一個多代理 AI 教學平台,處理的是把零散素材快速整理成可教、可互動的課堂內容。使用者只要輸入主題,或者上傳文件、音訊、影片,再加上網頁搜尋素材,系統就會組織出投影片、測驗、互動模擬和專題式學習活動,並由 AI 老師和 AI 同學在課堂內即時互動。

它和一般內容生成工具的分別,在於不只產出講義,而是把整個教學流程串起來。OpenMAIC 內部採用 chat-first 的工作區,支援持久化 session,任務可以在伺服器重啟後繼續,亦可中途取消、回復和調整,較適合需要反覆修訂課程的教育團隊、培訓人員和內容製作人。

  • 可由文字主題或外部素材直接生成完整課堂
  • 支援投影片、測驗、互動模擬、PBL 和 .pptx 匯入
  • 接入 OpenClaw 後,可由 Feishu、Slack、Telegram 等訊息工具建立課堂
  • 可自行接入模型、媒體、搜尋供應商和儲存後端
  • 官方提供 Live Demo,亦可用 Vercel 一鍵部署
OpenMAIC GitHub Setup Guide: From Text Prompt to Local MP4 Classroom Export

OpenMAIC 以多代理協調做編排,並結合 LangGraph、Next.js、React 和 TypeScript。超過 20 項內建技能,定位不是單純聊天機械人,而是把教學內容生產、互動和發佈收束到同一條工作流。

GitHub

Categories: 開源, Agentic, 框架, 教學, LangGraph, OpenClaw

Diffusion Studio:智能影片剪輯工作流

Diffusion Studio 將時間軸剪輯與 SolidJS 程式碼互相同步,讓 AI agents 可以直接協助製作影片。

Diffusion Studio

想用自然語言叫 AI 整理素材、剪出精華片段,甚至加入動態圖像和旁白,Diffusion Studio 提供了一條由命令列控制影片編輯器的工作流。它屬於開源影片編輯工具,核心是以 SolidJS modules 作為文件來源,處理由原始片段到成片的剪輯、合成和影片理解。

畫布與程式碼可以雙向修改:在畫布調整內容,變更會寫回程式碼;直接編輯程式碼,影片畫布亦會重新繪製。配合 dapi CLI,Claude Code、Codex、Cursor、Copilot 或 Gemini CLI 等 agents 能以文字指令操作時間軸,亦可要求系統摘要影片、搜尋場景,或找出附有時間戳的引述。

  • 影片剪輯、Motion graphics、社交平台短片重製
  • 以程式碼宣告圖片、影片和 voiceover,再合成到時間軸
  • 由命令列觀看及聆聽素材,交由 agents 協助處理
  • 可在 macOS Apple Silicon 使用桌面版本,並透過 skills 接入工作流

相比只在時間軸介面操作的編輯器,程式碼成為可保存、修改和交給 agents 處理的文件來源,較適合需要重複產出、批量改版或以生成式資產組成影片的團隊。代價是使用者要同時理解畫布、SolidJS modules 和 CLI 的關係;項目資料亦未提供獨立性能指標或完整平台支援範圍,不能單憑介紹判斷長片剪輯效率。

Diffusion Studio 連接 AI agents 之後可透過程式碼與影片時間軸進行編輯。內容創作者可先下載 macOS Apple Silicon 版本,再安裝官方 skills,透過自然語言要求建立影片,並在畫布中檢查結果;熟悉編程的團隊則可直接維護可重用的影片程式碼。

GitHub

Categories: 開源, Agentic, AI productions, IDE, Mac, 蘋果, Skill 技能

Breeze TTS 2:低延遲語音生成再推一級

Breeze TTS 2 把即時語音互動、聲線設計同語氣控制放埋一齊,主打低延遲同高可塑性。它較適合要做配音、語音代理或互動內容嘅團隊。

BreezeBlue

Breeze TTS 2 係一個文字轉語音(text-to-speech, TTS)模型,重點唔止係把文字讀出,而係處理即時互動入面最難平衡嘅兩件事:聲音要自然,回應又要夠快。佢支援 Voice Clone、Voice Design 同 Voice Direction,代表可以由參考錄音複製聲線,亦可以純靠自然語言描述去設計新聲線,再按指令調整語氣、節奏同表達。

對內容製作、語音代理、遊戲角色配音同多語言產品來講,呢種做法比單純 TTS 更有彈性。文本內仲可以插入 Vocal Events,例如笑聲、咳嗽、清嗓子呢類表情提示,令生成聲音更接近真人演繹,而唔係只係平鋪直敘讀稿。

項目資料顯示,佢喺 Artificial Analysis TTS leaderboard 排名第一嘅 open-weight 模型,亦聲稱喺部分測試中超越商業系統。低延遲係另一個賣點:warming 後喺 NVIDIA H100 可做到少於 40 ms 的 time to first audio,RTF 約 0.32,適合即時對話場景。

不過,repo 同時寫明模型權重、衍生模型同 self-hosted outputs 只限研究同非商業用途,呢點對想直接落地嘅團隊影響好大。代碼層面提供 PyTorch inference code,但原始資料未交代完整安裝流程或部署細節,較合理嘅理解方式係先把佢視為一個面向研究與產品原型驗證的高性能 TTS 模型。

  • 支援參考錄音複製聲線,亦支援純文字描述設計新聲線
  • 可以用指令調整語氣、情緒、語速同演繹方式
  • 低延遲串流適合即時語音互動同 voice agent
  • 在 open-weight TTS 基準中聲稱領先,但授權限制較嚴
  • 適合配音、互動內容、多語言語音產品同研究團隊

項目主頁 · GitHub · 模型

Categories: 開源, 文字轉語音, Agentic, 模型, NVIDIA, Audio, Clone, Python, 語音, Dataset 數據集

God’s Eye View 開源:用瀏覽器砌出間諜衛星視角

把航班、船舶、地震同公共鏡頭即時疊上一個寫實 3D 地球,配以 AI 聲控同 GLSL 濾鏡,唔使安裝就玩到。

當 YouTube 上 God View 系列影片累積過五百萬次觀看,開發者 Bilawal Sidhu 直接把整套介面開源——God’s Eye View 是個純瀏覽器端的 3D 地球模擬器,把 ADS-B 航班、AIS 船舶、衛星軌道、地震儀、公開 CCTV 等公開訊號源即時疊加到寫實地球儀上。對於想用單一畫面追蹤全球動態的研究者、航迷或 OSINT 玩家來說,它把過往要開十幾個分頁的情報工作濃縮成一個可縮放、可標註、可聲控的 3D 空間。

與坊間 OSINT 工具最大分別是「空間感」與「混合實境感」:點擊飛機即可進入模擬駕駛艙鏡頭,相機會貼着地形俯衝;鎖定目標後會拖出淡出軌跡,遇上山火或船艦更會一鍵交棒到最近公共鏡頭。沒實時鏡頭的位置會清楚標示為模擬畫面,連火箭上升軌跡都標明 RECONSTRUCTED ESTIMATE,刻意延遲一個輪詢週期以換取流暢插值。

God’s Eye View Blew Up. Here's What You Can Do With It.

技術上它由 Three.js + GLSL 自定着色器渲染地球,加入夜視、紅外熱成像、雪花雜訊等感測器風格濾鏡,並用一個 realtime AI agent 接管語音指令——可以直接講「追蹤呢班機」、「喺這個位置畫邊界」落去執行。3D Hangar 提供 787、ATR-72、Citation、Bell 206、MQ-9 等真實飛機模型,鏡頭拉近時符號會自動切換成 3D 模型。

We Got Open Source Palantir Before GTA 6

目前主要以開源 GitHub 項目形式發佈,實際部署流程仍須查閱儲存庫內容。適合做簡報 demo、地理課堂或開源情報練習的展示層,但若需要穩定商用級數據準確度,仍要自行評估延遲同模擬標記帶來嘅限制。

GitHub

Categories: 開源, Agentic, 3D

MMLVE-Agent 點樣唔再搞亂多鏡頭影片

過往 AI 影片編輯碰到多鏡頭長片就容易認錯人、漏改背景。MMLVE-Agent 用 LLM 與 VLM 協作,把每個鏡頭拆開處理,再靠全局記憶鎖住主體身份。

MMLVE-Agent framework

用一句「將男人嘅紅色衫變成藍色」就改完成條片、每個鏡頭都認得返同一個人——呢個係南開大學同騰訊團隊提出嘅 MMLVE-Agent 想要解決嘅痛點。過往影片編輯模型主要處理單鏡頭或幾秒短片,落到幾分鐘、橫跨多個鏡頭嘅長片就容易出現主體身份斷裂、編輯幻覺同時間連續性受損。呢個項目本質係一個異構多智能體框架,結合 LLM 做指令解析、VLM 做鏡頭級拆解同評估,再透過全局記憶卡(Global Memory Card)將 top-k 關鍵幀合成統一參考,確保主體身份唔會跨鏡頭走樣。

團隊同時定義咗 MMLVE 任務嘅三個核心目標:跨鏡頭編輯一致性(CSEC)、多指令解耦(MID)以及對非目標區域嘅零破壞(ZDSS)。其中 Pos-Neg Editing Feedback(P-NEF)令 VLM 評估器可以同時輸出負向提示同正向提示,主動修正錯誤同時保留應有細節,取代坊間常見嘅單向反饋機制。佢哋亦同步推出 MMLVE-Bench 數據集,涵蓋密集異質指令同稀疏隨機分佈嘅實體,對應真實影片剪接場景。

團隊聲稱喺呢個基準上超越咗 Seedance 2.0 等閉源方案,特別喺消除編輯幻覺同保持時空連貫性方面。不過要留意,原始資料只提供項目頁、論文同 benchmark 數據集,並無公開模型權重或安裝入口,想實際部署嘅讀者需要留意後續開源進度。

重點摘要:

  • MMLVE-Agent 係一個多智能體影片編輯框架,專門處理多鏡頭長片嘅自然語言指令編輯
  • 核心創新在於全局記憶卡同正負反饋機制,前者鎖定跨鏡頭主體身份,後者主動修正編輯錯誤
  • 同步推出 MMLVE-Bench 數據集,涵蓋高密度指令同稀疏實體分佈等真實場景
  • 團隊報告在自建基準上超越 Seedance 2.0 等閉源方案
  • 原始資料未提供模型下載或部署方式,實際可用性有待後續開源進度確認

項目主頁 · GitHub

Categories: 開源, 騰訊, Agentic, 視覺模型, 影像處理, Dataset 數據集

[技術文章] 淘寶直播 AI 主播團隊提出 HAT 訓練法 解決小模型難以跟上快速更新的張力

淘寶直播 AIGC 團隊針對直播帶貨 AI 主播的實時互動需求,提出 Harness-Aware Training(HAT)框架,令小模型能在頻繁更新的策略環境中保持低延遲與高適應力。

Hero image preview

淘寶直播旗下的 TaoLive AIGC LLM 團隊發表技術報告,提出一套名為 Harness-Aware Training(HAT)的訓練方法,專門用於訓練能在直播帶貨場景中即時回答商品問題、與觀眾互動並執行營銷策略的數字人主播。團隊指出,直播帶貨對延遲極為敏感,同時行銷規則與商戶偏好又會持續變動,因此業界普遍採用「可演化 Harness」設計,把 Skills、Hooks、prompts 和 tools 與模型參數解耦,策略改動時不必重新訓練模型。然而這種做法帶來明顯取捨:大模型雖然泛化能力強,能夠零樣本適應 Harness 變動,但延遲太高;小模型延遲符合實時要求,卻容易過拟合到固定的 Harness 設定,一旦配置更新就需要重新訓練。

HAT 的核心思路是在訓練階段就讓模型接觸大量不同的 Harness 配置,使它學會「讀懂當前的 Harness」,而非記住某一個固定版本。具體做法引入 Harness-State Augmentation(HSA),對 Skill 識別碼、Skill 內容、工具 schema、prompt 結構及 Hook 函數施加保留任務語義的轉換。訓練分為三個階段:HSA-SFT 讓小模型從強模型生成、在多樣化環境中收集的高質量軌跡學習,直接提升推理與工具調用能力;General OPD 透過 On-Policy Distillation 在通用從基礎模型學習,恢復 SFT 過程中受損的泛化能力;HSA-RL 則在經 HSA 增廣的多樣化環境中做強化學習,進一步強化模型對變動 Harness 的理解與工具調用穩定性。

HAT 訓練的模型在 Live-Stream QA 上平均得分 94.8,明顯高於基礎模型的 80.3 和最強通用 LLM 的 93.0;在 Harness-Variant QA 上亦達到 94.6,遠超基礎模型的 75.4。傳統 Fixed-Harness SFT 會令 IFEval 分數較基礎模型下跌 7.7 分,而 HAT 不單避免這種下跌,更取得 83.5 分。在部署層面,模型可在單張 NVIDIA H20 GPU(啟用優化)上運行,P50 延遲 3.4 秒、P95 8.1 秒,已滿足實時互動門檻。系統已落地至淘寶直播的生產環境,線上 A/B 測試顯示相對 ReAct 對照組,Harness 實驗組在確認收貨 GMV 上帶來 4.33% 的 UV 標準化提升、商品頁瀏覽量提升 0.91%。

對需要快速疊代策略、又受制於延遲與算力的實時對話代理團隊而言,這份報告展示了一條可落地的工程路徑。

重點摘要
– 淘寶直播 AIGC 團隊針對直播帶貨 AI 主播提出 HAT 訓練框架
– 解決小模型過拟合固定 Harness、無法跟上策略更新的核心矛盾
– 透過 HSA 增廣與三階段訓練兼顧延遲、泛化與工具調用穩定性
– IFEval 分數避免傳統 SFT 出現的 7.7 分下跌,反升至 83.5
– 已在淘寶直播生產環境上線,A/B 測試帶來 GMV 與瀏覽量提升

Paper

Categories: 阿里巴巴, Agentic, 模型訓練, 框架, Skill 技能

[技術文章] 淘寶直播 AI 主播團隊提出 HAT 訓練法 解決小模型難以跟上快速更新的張力

淘寶直播 AIGC 團隊針對直播帶貨 AI 主播的實時互動需求,提出 Harness-Aware Training(HAT)框架,令小模型能在頻繁更新的策略環境中保持低延遲與高適應力。

Hero image preview

淘寶直播旗下的 TaoLive AIGC LLM 團隊發表技術報告,提出一套名為 Harness-Aware Training(HAT)的訓練方法,專門用於訓練能在直播帶貨場景中即時回答商品問題、與觀眾互動並執行營銷策略的數字人主播。團隊指出,直播帶貨對延遲極為敏感,同時行銷規則與商戶偏好又會持續變動,因此業界普遍採用「可演化 Harness」設計,把 Skills、Hooks、prompts 和 tools 與模型參數解耦,策略改動時不必重新訓練模型。然而這種做法帶來明顯取捨:大模型雖然泛化能力強,能夠零樣本適應 Harness 變動,但延遲太高;小模型延遲符合實時要求,卻容易過拟合到固定的 Harness 設定,一旦配置更新就需要重新訓練。

HAT 的核心思路是在訓練階段就讓模型接觸大量不同的 Harness 配置,使它學會「讀懂當前的 Harness」,而非記住某一個固定版本。具體做法引入 Harness-State Augmentation(HSA),對 Skill 識別碼、Skill 內容、工具 schema、prompt 結構及 Hook 函數施加保留任務語義的轉換。訓練分為三個階段:HSA-SFT 讓小模型從強模型生成、在多樣化環境中收集的高質量軌跡學習,直接提升推理與工具調用能力;General OPD 透過 On-Policy Distillation 在通用從基礎模型學習,恢復 SFT 過程中受損的泛化能力;HSA-RL 則在經 HSA 增廣的多樣化環境中做強化學習,進一步強化模型對變動 Harness 的理解與工具調用穩定性。

HAT 訓練的模型在 Live-Stream QA 上平均得分 94.8,明顯高於基礎模型的 80.3 和最強通用 LLM 的 93.0;在 Harness-Variant QA 上亦達到 94.6,遠超基礎模型的 75.4。傳統 Fixed-Harness SFT 會令 IFEval 分數較基礎模型下跌 7.7 分,而 HAT 不單避免這種下跌,更取得 83.5 分。在部署層面,模型可在單張 NVIDIA H20 GPU(啟用優化)上運行,P50 延遲 3.4 秒、P95 8.1 秒,已滿足實時互動門檻。系統已落地至淘寶直播的生產環境,線上 A/B 測試顯示相對 ReAct 對照組,Harness 實驗組在確認收貨 GMV 上帶來 4.33% 的 UV 標準化提升、商品頁瀏覽量提升 0.91%。

對需要快速疊代策略、又受制於延遲與算力的實時對話代理團隊而言,這份報告展示了一條可落地的工程路徑。

重點摘要
– 淘寶直播 AIGC 團隊針對直播帶貨 AI 主播提出 HAT 訓練框架
– 解決小模型過拟合固定 Harness、無法跟上策略更新的核心矛盾
– 透過 HSA 增廣與三階段訓練兼顧延遲、泛化與工具調用穩定性
– IFEval 分數避免傳統 SFT 出現的 7.7 分下跌,反升至 83.5
– 已在淘寶直播生產環境上線,A/B 測試帶來 GMV 與瀏覽量提升

Paper

Categories: 阿里巴巴, Agentic, 模型訓練, 框架, Skill 技能

Page 7 of 35
1 … 5 6 7 8 9 … 35