Grok Bot 登場:xAI 推出常駐 AI 同事,能自主操作電腦完成任務

Grok Bot 就像一隊永不登出的 AI 隊友,能登入你的軟件代勞長時間任務,從銷售外聯到支援工單都接力完成。

Og image

xAI 最新推出的 Grok Bot,把「Computer-use agents(CUAs)」這個概念包裝成一支可以分工的虛擬團隊。它擁有自己獨立運行的電腦環境,能像真人般登入 Zendesk 等 SaaS 工具、瀏覽網頁、操作軟件介面,並在背景 24 小時不中斷地接力完成任務。對需要處理大量例行工序的小團隊或一人公司來說,這類 agent 最直接的價值是把「等人按掣」的等待時間壓縮到接近零。

Grok Bot 強調幾個工作流設計:你可以同時叫多個 Bot 進入同一個對話串,分頭負責研究、公關、差旅等不同環節,Bot 之間會自行交接工作;只要你親自示範一次流程,它就能把步驟記成「routine」自動重複執行,並隨時間累積記憶,例如記下某客戶只簽年約、誰是決策人。對需要批量生成銷售名單、處理支援工單或長期追蹤項目進度的使用者而言,這種「邊做邊學」的能力比單純的 prompt 工具更貼近實際工作節奏。

定價方面,Grok Bot 綁定在 Cursor Ultra 月費 200 美元的方案內,包含其專屬電腦環境、跨裝置使用與排程執行;團隊版則額外提供 SSO 與共享用量分析。xAI 將其定位為企業 SaaS 的入口代理,但實際上能否取代 ClickUp、HubSpot 等內建自動化,仍要視乎它對接工具的覆蓋率與執行成功率。

重點摘要

  • 擁有獨立電腦,能像人類登入並操作 SaaS 工具完成長時間任務
  • 支援多 Bot 協作,在同一對話串內自行分工與交接
  • 用戶示範一次流程後,Bot 可記為 routine 自動重複執行
  • 隨時間累積記憶,保留客戶偏好、決策人等脈絡
  • 透過 Cursor Ultra(200 美元/月)方案提供,團隊版含 SSO 與共享分析

項目主頁

Categories: Agentic, API, 工具, 線上服務, IDE, Mac, 免費試用

NeMo Speech:NVIDIA 把 ASR、TTS、語音 LLM 收進同一條 PyTorch 生產線

NVIDIA 把語音研究最常碰到的 ASR、TTS 與 Speech LLM 整合成單一框架,研究員和工程師不用再東拼西湊,也能用預訓練權重快速微調與部署。

Repository image for NVIDIA-NeMo/Speech

語音 AI 的痛點往往不是模型不夠強,而是開發者要同時面對 ASR、TTS、串流識別等好幾套獨立工具鏈。NVIDIA NeMo Speech 把這些任務收進同一個 PyTorch 框架,並提供預訓練權重,讓研究員可以把精力花在實驗設計,而不是從頭搭建訓練流程。

從近期更新可以看到三個值得留意的方向:MagpieTTS v2607 把支援語言擴展到 12 種,新增阿拉伯文、韓文、葡萄牙文;Nemotron-3.5-ASR-Streaming-0.6B 在單一 H100 上能同時處理最多 2400 條串流,並允許把延遲控制在 80ms 到 1s 之間;Parakeet-unified-en-0.6b 則把離線與串流推理合併成一個英文模型,最短延遲 160ms。

Nemotron 3 VoiceChat 把 LLM、骨幹與 TTS 解碼器串成全雙工對話,能自然處理打斷與插話,這對於想建立語音助理的團隊是比較完整的一條路。Fastconformer 等快取感知架構是背後的工程功臣,讓長音訊串流不需要犧牲太多吞吐量。

訓練階段必須配備 NVIDIA GPU 與 CUDA 環境,推薦使用 PyTorch 2.7 或以上版本;現時倉庫正進行拆分,下一個主要版本預定 2026 年 6 月發佈,短期內穩定使用可以考慮 26.02 NGC container。對做客服、會議記錄、媒體字幕或有聲書生成的團隊,這套框架能把語音模型從原型走到部署的距離明顯縮短。

重點摘要:

  • 單一框架覆蓋三大任務:ASR、TTS 與 Speech LLM 都在 NeMo Speech 內,減少切換工具鏈的成本。
  • 串流效能突出:Nemotron-3.5-ASR-Streaming-0.6B 支援 40 種語言,單張 H100 可並行 2400 條流,延遲可調。
  • 多語 TTS 擴張:MagpieTTS v2607 覆蓋 12 種語言,並提供 Hugging Face 線上 demo。
  • 全雙工語音助理:Nemotron 3 VoiceChat 把 LLM 與 TTS 解碼器結合,支援自然打斷與低延遲對話。
  • 硬體要求明確:至少配備 80 GB 記憶體。訓練需 NVIDIA GPU 與 CUDA,PyTorch 2.7 或以上版本,推理可在 CPU 或 GPU 執行。

GitHub · 模型

Categories: 開源, 文字轉語音, Agentic, NVIDIA, 框架, Python, 語音, Dataset 數據集

NVIDIA Nemotron 3.5 Lightning:專為長期運行 Agent 而生的輕量 MoE 模型

AI Agent 大部分時間都在做工具呼叫、結果驗證等高頻次執行,而非高階推理。Nemotron 3.5 Lightning 以 30B MoE 架構瞄準這個執行層,速度比同級模型快 4 倍。

Og image

長期運行的 AI Agent 真正花時間的地方,往往不是規劃,而是工具呼叫、結果驗證、子代理分派這些高頻次的執行步驟。每一個小動作都用頂級推理模型去跑,會帶來明顯的成本與延遲壓力。NVIDIA 推出的 Nemotron 3.5 Lightning 就是針對這個「執行層」設計的開放模型,採用 30B 參數的 Mixture-of-Experts(MoE)架構,但每次只啟動 3B 參數,在維持效率的同時兼顧準確度。

與坊間常見做法不同,Nemotron 3.5 Lightning 並非要取代大型推理模型,而是與之分工——前者處理高頻執行,後者專注規劃與複雜推理。模型本身針對 agent harness(如 OpenClaw、Hermes Agent)做了訓練優化,並提供 speculative decoding、NVFP4 與 BF16 量化版本,宣稱輸出速度比同級模型快 4 倍。這對需要長時間在線、隨時待命的 Agent 來說,省下的不只是金錢,還有回應時間。

Nemotron Lightning - NVIDIA's Super Fast Agent MoE

NVIDIA 同時推出 NeMo Switchyard,一個負責任務分派的路由函式庫,能根據任務類型自動挑選最合適的模型。整個 Nemotron 系列定位有點像「模型版的軟件庫」,每次發佈都在累積可組合的元件。對於需要自己掌控成本與效能的開發團隊,這套組合提供了相當完整的權重、數據與訓練配方,加上寬鬆的開源授權,方便做深度客製化。

  • 專注 Agent 執行層:30B MoE 架構、3B 活躍參數,設計目標是高頻低延遲的工具呼叫與驗證。
  • 速度與成本取捨:相比同級模型,輸出速度提升達 4 倍,搭配 NVFP4 量化可在本地硬件運行。
  • 分層協作模式:與 Nemotron 3 Ultra 等大型推理模型分工,由 NeMo Switchyard 負責智能路由。
  • 完整開源:權重、訓練數據與配方一併釋出,授權寬鬆,方便客製與整合。
  • 生態整合:對應 NemoClaw 安全管理開源方案,支援 OpenClaw、Hermes Agent 等長期運行框架。

項目主頁

Categories: 開源, Agentic, 模型, NVIDIA, 軟件, 庫, 安全, OpenClaw

NeMo Switchyard:幫 AI Agent 自動揀模型,慳成本又唔跌質素

NVIDIA 推出 NeMo Switchyard,等開發者用同一套 SDK 為 Agent 動態揀選最啱用嘅模型,兼顧成本、延遲同質素。

Og image

揀模型往往是部署 AI Agent 嘅最大難題之一。每一個請求嘅需要都唔同:有時要做分類,有時要做推理,亦可能只係簡單跟進任務。如果全部交俾最貴嘅模型,成本同延遲即刻飆升;硬揀細模型又會喺複雜任務上跌質素。NVIDIA NeMo Switchyard 就係為咗處理呢個矛盾而設計嘅 routing 框架。

開發者可以將 Switchyard 理解為一個智能分流器:每次有請求進入,router 會根據模型能力、成本同基建狀況等即時訊號,決定交俾邊個模型處理。整個判斷過程毋須事先大量微調,支援 tuning-free 同 tunable 兩種路由演算法,亦因為採用 provider-agnostic SDK,邏輯同具體模型供應商解耦,轉換模型時無需重寫應用。

Switchyard NVIDIA's Local Agent Router

呢套做法同「全部用一個模型」嘅常見做法相比,最大差異在於將選模型變成可調控嘅政策。LangChain 同 Cognition 等合作實測顯示,路由後既能維持高準確率,又能明顯降低成本。對於需要同時處理多類任務、又關心成本曲線嘅 Agent 工作流,呢種 system-of-models 嘅思維比起死鎖單一模型更貼近實際環境。

重點摘要:

  • 動態路由:根據每次請求嘅 context、能力、成本同延遲限制,即時揀選最合適嘅模型。
  • 彈性 SDK:provider-agnostic 設計令開發者無需為每個模型供應商重寫應用。
  • 支援兩種路由策略:由 tuning-free 到可微調演算法,畀開發者按需要調整。
  • 成本與質素平衡:實測顯示可以在保持高準確率嘅同時顯著降低開支。
  • 即時訊號驅動:用 runtime 訊號做調度,適合 production 環境嘅 agent workflow。

對於正在建構多步驟 Agent、又唔想被單一模型綁死嘅團隊,NeMo Switchyard 提供咗一個相對務實嘅選擇:將「揀模型」變成可觀察、可調校嘅環節,而唔係每次模型換代都要由頭來過。

項目主頁

Categories: Agentic, 模型訓練, NVIDIA, API, 框架, LangChain

WeClawArena:當多個 AI Agent 共用工作流,誰來守住邊界

這個項目把多個個人 AI Agent 放在同一個沙盒裡合作做任務,再刻意注入攻擊,檢視它們會否洩密或越權。它想回答的是:當 Agent 開始互相呼叫,安全性該怎麼量度。

WeClawArena and its bargaining, bidding, travel, SWE-Workspace, clinical, and trading domains

當 AI Agent 不再是單兵作戰,而是要在共享任務裡交換訊息、互相呼叫工具,真正的風險往往不在模型本身,而在邊界有沒有人守。WeClawArena 是一個開源基準與可審計的運行沙盒,它模擬每個「人類擁有者」各自帶著一個 Agent、私有資源、角色專屬工具與本地規則,再讓這些 Agent 一起完成跨擁有者的任務。沙盒會全程記錄訊息、工具呼叫、資源操作與治理決策,方便事後追查誰在什麼時候越了界。

與一般針對單一 Agent 的安全測試不同,這個項目刻意把「協作失敗」與「攻擊成功」拆開評估。它在六個領域共 124 個基礎任務、620 個變體上,加入無攻擊組作對照,並針對協作、安全、私隱、治理四類攻擊條件各自打分,得出任務成功率(TSR)與攻擊成功率(ASR)兩組指標。Bargaining、Bidding、Travel、SWE-Workspace、Clinical、Trading 這幾個場景覆蓋了採購談判、軟件工程協作、臨床團隊、投資俱樂部投票等高利害情境。

對從事 Agent 安全研究、紅隊測試,或要部署多 Agent 協作流程的團隊,這套沙盒提供了一個可重現、可審計的環境。從 README 與 HF Papers 頁面可見,作者 Prince Zizhuang Wang 等人已把論文、數據集與 v2.0.0 版本代碼同步公開,採用 Apache-2.0 授權代碼、CC BY-NC 4.0 授權數據。

重點摘要:

  • 邊界為核心:每個 Agent 只看得到自己擁有者的資源與工具,跨邊界行為會被記錄與計分。
  • 雙軌評估:任務成功率(TSR)與攻擊成功率(ASR)分開計算,避免「任務完成」掩蓋「已被入侵」。
  • 四類攻擊條件:協作、安全、私隱、治理各有一組匹配變體,可針對性分析 Agent 弱點。
  • 六個領域 620 變體:涵蓋商業談判、SWE 流程、臨床、投資等高風險協作情境。
  • 可審計沙盒:peer 訊息、工具呼叫、決策路徑都有跡可循,方便事後歸因。

項目主頁 · GitHub

Categories: 開源, Agentic, 安全, Skill 技能

RynnValue 用秒估計機械人完成時間

它不只判斷機械人有冇做對,仲會估計距離完成仲差幾多秒。呢種時間式價值訊號,令強化學習獎勵設計變得直接得多。

RynnValue overview

機械人操作最難的不只是識別動作成敗,而是要持續知道距離完成指令仲有幾遠。RynnValue 就是針對呢個空缺而來的模型項目:它把機械人影片連同文字指令一齊讀入,逐格預測剩餘完成時間,並輸出自然語言分析,讓進度估計、失敗偵測與 VLA(vision-language-action)policy 的獎勵建構可以共用同一套訊號。

它和常見進度分數或偏好標註做法的分野很清楚。RynnValue 不靠人工標出「較好」軌跡,也不把進度硬壓成 0 到 1,而是直接學習 goal-conditioned cost-to-go 的物理時間;標籤來自時間戳,配合子任務切分與 cutoff relabeling,於是能擴展到 7,000 多小時、約 300 萬段 instruction-conditioned clips 的異質機械人資料。這個取捨帶來的好處是可擴展,代價則是模型必須更好地處理長尾任務時長與不同視角、不同 embodiment 的差異。

RynnValue 連同完整工具鏈一併提供。你可以把它理解成一套由 HuggingFace 相容模型、影片推理示範,到 reward-model benchmark 與強化學習介面都包起來的研究型工具組;當中 RynnValue 建基於 RynnBrain,實作在 Qwen3-VL architecture 之上,除了預測 absolute 與 relative temporal value,亦會生成影片描述,並判斷 instruction–video 是否匹配、任務是否成功。

  • 核心能力是把「距離完成尚餘幾多秒」變成稠密 value signal
  • 訓練毋須 preference 或 progress annotations,較易放大量異質資料
  • 8B 版本在 RBM-EVAL-OOD 的平均 Kendall’s τₐ 達 0.675,高於文中對照的 fully preference-supervised 方法 0.655
  • 可直接接到 reward shaping,用作 policy ranking、evaluation 與 reinforcement learning critic

為免模型偷看序列位置去猜進度,作者加入 temporal-order shuffling、random temporal sampling,以及 value-isolation attention;消融結果亦顯示這些設計不是裝飾,拿走後指標會明顯下跌。再進一步,它把輸出的 value 轉成 potential-based shaping reward,在雙臂 Franka 的真實機械人學習中,無論 online 定 offline 都比最強 reward-model baseline 有更高成功率。

最受惠的會是做機械人操作、VLA 訓練、reward modeling 與 embodied AI 評測的團隊,尤其想減少人手標註成本、又需要跨資料來源泛化能力的人。限制同樣存在:這類時間距離訊號雖然比二元成敗更細緻,但對任務切分、影片品質與觀測覆蓋仍然敏感,而且它目前聚焦於 robot manipulation,不代表可直接外推到所有 agent 場景。

項目主頁 · GitHub · 模型

Categories: 開源, 阿里巴巴, Agentic, 視覺模型, 多模態模型, 模型訓練, Qwen, Video, VLA, Robotic, Dataset 數據集

Ouroboros 把 AI 代理變成「自我演化」

它不只會接任務,還會記住自己做過什麼,甚至改寫自己。對想長期運行 AI agent 的團隊,呢種設計幾有吸引力。

Terminal-Bench 2.1: Ouroboros against Claude Code, Codex CLI, Cursor CLI, and Hermes on matched models, with a same-harn

一次性完成指令的 AI agent 已經不少見,但能夠跨任務、跨重啟保留身份、記憶同歷史,仲可以持續修改自己運行方式的並不多。Ouroboros 屬於開源通用型 AI agent,處理的是長週期工作會斷線、失憶,同埋難以持續改進代理本身的問題。

它不是單純能開多個 specialist agents,而是保留「同一個負責任主體」去協調研究、建構、驗證同審查。呢種做法對外部程式碼項目、需要長時間追蹤證據的工作流特別有用;代價是系統野心很大,對使用者來說亦意味要接受一個會動到自身程式碼、prompt、tools 甚至 dependencies 的代理。

Ouroboros 可當原生桌面程式使用,也可走 headless CLI,Windows x64 同多種 Linux 發行版都有發佈版本。執行期會把 repository、durable memory、history 同介面留在本機,模型推理則可接駁你自行設定的遠端 API,或者用本地 GGUF 模型,對想保留資料控制權的人較有吸引力。

  • 開源通用型 AI agent,重點在持續身份、durable memory 與自我修改
  • 可協調一組 specialist agents,但最終責任仍由單一 root agent 承擔
  • 支援桌面 app 與 CLI,適合長時間運行或接手外部程式碼項目
  • 本機保存記憶與歷史,模型可用遠端 API 或本地 GGUF 格式在本地執行推理
  • 官方列出 Terminal-Bench 2.1、OSWorld-Verified、CL-Bench 的 self-reported 成績

Ouroboros 公開了在 Terminal-Bench 2.1、OSWorld-Verified 同 CL-Bench 的 self-reported 結果,並以 matched model 或公開排行榜對照 Codex、Claude Code、Cursor、Hermes。呢類數字有參考價值,但仍要留意它屬自報結果;較可取的是,項目同時強調 traces、evidence 同可重現性,顯示它想把重點放在可檢查的過程,而不只是最終分數。

整體來看,Ouroboros 適合研究型開發者、想建立長記憶 agent 的團隊,以至需要代理長期接手軟件工作流的人。它吸引人的地方在於把 agent 由「一次性助手」推向「可延續個體」,但同時也把風險一併帶進來:自我演化愈強,愈需要清楚邊界、驗證流程同責任歸屬。

項目主頁 · GitHub

Categories: 開源, Agentic, API, IDE, Mac, Linux, Dataset 數據集

Meta Muse Glimmer:為本地多模態代理而生

Muse Glimmer 30B 針對本地部署而設,把圖文理解和代理式操作放在同一個模型裡。它同時提供 BF16、GGUF 與 ExecuTorch 版本,方便不同裝置取用。

Meta

Muse Glimmer 30B 屬於多模態 agentic model,重點放在本地部署時的可用性。對需要在自己裝置上處理圖文輸入、又想保留代理式工作流的用戶來說,這種設計比只提供單一格式的模型更實用,因為可以按硬件環境選擇合適版本。

Meta 這次一口氣放出多種包裝,包括 BF16 權重、GGUF k-quants、ExecuTorch builds,還有一個較細的 assistant 版本。這代表它不是只面向單一推理環境,而是嘗試覆蓋桌面、本地推理引擎,以及流動裝置部署等不同需求。

從現有資訊看,Muse Glimmer 的核心價值在於把多模態能力和本地執行的彈性結合起來。GGUF 版本方便在本地執行推理,ExecuTorch 版本則指向更輕量的裝置端部署;對想控制資料流向、減少依賴雲端服務的工作流,會更有吸引力。

  • 支援多模態輸入,適合圖文混合任務
  • 針對 local deployment 設計,部署選擇較多
  • 提供 BF16、GGUF k-quants、ExecuTorch 等不同格式
  • 有 30B 主模型與較小的 3B assistant 版本
  • 適合需要本地推理、裝置端或代理式工作流的場景

現時公開資料較集中在模型包裝與部署形式。就定位而言,它更像是一個面向實用部署的多模態模型系列,而不是只靠單一規格吸引注意的發佈。

項目主頁 · 模型

Categories: 開源, Agentic, 模型, 視覺模型, 多模態模型, API, Image, LLaMa, 安全, Meta

Hermes WebUI 把代理搬到瀏覽器

想長開一個會記住上下文的 AI agent,又不想長期困在 terminal,Hermes WebUI 正好補上這個缺口。它保留 CLI 能力,同時把多裝置存取整理得更順手。

Workspace file browser with inline preview

把一個長時間運行、會累積記憶的 autonomous agent 放到瀏覽器,而且幾乎不削弱原本 CLI 操作,正是 Hermes WebUI 最值得留意的地方。它屬於 Agent 介面工具,實際處理的是 Hermes Agent 在日常使用裡不夠方便的互動問題,讓你不必只靠 terminal 或訊息 app 才能管理對話、工作區與設定。

跟不少另起一套前端堆疊的 Web 介面不同,Hermes WebUI 走得相當克制:不用 build step、不用 framework、也不用 bundler,只靠 Python 和 vanilla JS。這種取捨帶來的好處很直接,部署比較輕、維護點較少,亦更貼近原本 Hermes Agent 的運行方式;代價是它的重點明顯放在功能對齊,而不是做一個花巧的前端展示層。

介面設計本身也有明確工作流考量。三欄布局把 session、聊天區與 workspace 檔案瀏覽分開,模型、profile 同 workspace 控制則固定放在 composer footer,減少來回切換;再加上 token context ring、Hermes Control Center、voice、mobile 與主題切換,較適合需要長時間跟 agent 協作、又要隨時查看檔案與工具呼叫紀錄的人。

  • 1:1 對齊 Hermes CLI,終端可做的操作基本都能在 WebUI 完成
  • 支援 session、workspace、voice、profiles、安全設定與手機存取
  • 可用自動探索、手動啟動、SSH tunnel、Tailscale、Docker、Nix 等方式部署
  • 建基於既有 Hermes Agent 與現成模型,毋須另設一套推理環境

安裝理解上,它不是獨立 agent,而是 Hermes Agent 的瀏覽器前端,所以前提仍然是先把 Hermes 本體跑在伺服器,再用 bootstrap、start/ctl 腳本、Docker 或 Nix module 把介面掛上去。在存取方式、部署彈性與跨裝置操作一致性;對於已經在自架 AI agent、想把 CLI 工作流延伸到桌面與手機的人,這個項目的價值相當明確。

GitHub

Categories: 開源, Agentic, 框架, Python, 語音

MatrAIx-Persona-8B: 模擬現實中的人性

MatrAIx 把人性化模擬用戶搬入評估流程,讓產品在推出前先看見不同人會點互動。它特別適合做問卷、聊天、網頁同 App 測試。

Watch the MatrAIx demo on YouTube

MatrAIx 是一套以多樣化模擬用戶做核心的評估基建,目標是補足只看單一指標、卻看不到不同人實際反應的盲點。它把 persona 變成 LLM agents,分別在 Survey、AI Chatbot、Web 同 App 四種環境跑可重現的任務,適合用來看產品、介面同互動流程會點影響不同用戶。

它的做法唔係只生成幾個虛構角色,而係用 1,290 個人格維度去組合背景、心理、能力同行為,再加上依賴關係處理同 evidence-aware human grounding。這種設計令評估結果唔止係一條總分,而係可以分辨邊類用戶受影響、邊種流程出問題。

MatrAIx: Simulating the World with 8.3B Persona Agents
  • 可用於市場研究、概念測試、客服對話、網頁原型同 App 流程評估
  • 介面前有 Playground 同 visual runner,方便先睇互動再做批量測試
  • persona-agent 範例需要 Model API keys,Playground / viewer 前端只要求 Node.js 20+
  • 內文提到嘅公共 persona 資料集同評估報告,顯示它偏向研究同產品驗證兩用。

同一般只做通用 benchmark 的方法相比,MatrAIx 強調人口規模同可重現的模擬軌跡,重點唔係單次對錯,而係不同 persona 之間的差異。這對做 AI 產品、用戶研究、RL 訓練前資料收集的團隊較有價值,因為佢提供的是互動過程同行為痕跡,而唔只是結果分數。

項目主頁 · GitHub

Categories: 開源, Agentic, API, Medical醫學, Dataset 數據集

Page 13 of 35
1 … 11 12 13 14 15 … 35