[入門教學文章]一文搞懂 CNN、RNN 與 Transformer

Og image

學深度學習最容易卡住的位置,往往不是模型太難,而是聽過 neural network、Deep Learning、CNN、RNN、Transformer,腦入面仍然分唔清邊個處理影像、邊個擅長序列、邊個適合長距離內容關係。這篇文章屬於入門教學,重點是用 mental model 幫讀者建立直覺,而不是一開始就掉出一堆數學式。

內容先把 AI(Artificial Intelligence)、ML(Machine Learning)同 Deep Learning 的層次關係講清楚,再解釋 neural networks 點樣透過多層表示學習資料特徵。文中亦提醒一個常見誤解:Deep Learning 入面的「deep」主要是指層數夠多,並不是指模型真的像人腦那樣理解世界。

之後的重點放在三類常見架構之間的差異:CNN 適合由局部特徵逐步組合出整體理解,常見於影像;RNN 會按次序處理資訊,較貼近文字或時間序列;Transformer 則更重視整段內容之間的關聯,成為近年自然語言處理與多模態模型的重要基礎。對初學者來說,這種比較方式比單獨背定義更容易入手。

  • 用直觀方式整理 Deep Learning 與 neural networks 的基本概念
  • 把 CNN、RNN、Transformer 放在同一條線上比較用途與取向
  • 強調模型強項來自資料處理方式,而不只是名稱不同
  • 文章亦提到 Keras,方便之後進一步動手建立模型

引用模型:CNN、RNN、Transformer。整體來說,這項內容適合剛接觸深度學習、想先建立整體地圖的人閱讀;有少量 Python 基礎會更易銜接到 Keras,但就算未寫過模型,也能先用它釐清觀念。

項目主頁

Categories: Python, 教學, 模型訓練, 深度學習, Dataset 數據集

NotebookLM 改名 Gemini Notebook

Og image

做研究、整理文件同準備報告時,最麻煩往往唔係搵資料,而係點樣喺一堆來源之中保持脈絡清楚。Gemini Notebook 由 NotebookLM 更名而來,定位仍然係獨立使用的筆記與研究助手,但重點放在同 Google 服務有更深整合,並加入 secure cloud computer,令資料處理方式更貼近雲端工作流。

對一般用家而言,呢次更新最直接的改變唔係功能名稱,而係使用體驗更靠近 Gemini 系列產品。你可以把它理解成原本 NotebookLM 的延伸版本:保留原有獨立產品形態,同時更容易接上 Google 生態中的內容、帳戶與服務,適合需要長時間整理知識、追蹤文件脈絡的人。

  • 由 NotebookLM 更名為 Gemini Notebook
  • 產品仍然獨立存在,唔係單純併入另一個介面
  • 與 Google 生態整合更深,協作路徑更順
  • 加入 secure cloud computer,強調雲端處理與安全性

對常用 Google 工具做學習、研究、內容整理的人來講,呢個方向比單純改名更有意思,因為它指向的是更完整的一站式知識工作流程。

項目主頁

Categories: Google, Gemini, 安全

Grok Build 開源後,編碼代理點樣運作一目了然

Og image

想追到 AI 編碼代理點樣一步步理解程式碼、決定用咩工具,再把結果送回終端,Grok Build 而家提供了一個相當直接的入口。這個由 SpaceXAI 公開的 coding agent 與 TUI,不只方便試用,還把整個運作骨架開源,重點是讓人真正查清楚代理在處理什麼、又可以改到什麼。

對開發者而言,價值不止在「可用」,而是在「可驗證」。你可以直接查看它怎樣組裝 context、解析模型回應、分派 tool calls,也可以理解它怎樣讀寫程式碼、搜尋內容與執行指令。做緊技能擴充、插件整合,或者研究 MCP servers、subagents 工作流的人,這份原始碼會比單靠文件更有參考價值。

  • 開源範圍涵蓋 agent loop、tools、terminal UI 與 extension system
  • 可研究 skills、plugins、hooks、MCP servers、subagents 的載入與呼叫方式
  • 支援 local-first 用法,可自行編譯並接上本地 inference
  • 主要透過 config.toml 控制整體執行流程

和常見只提供託管服務或有限介面的工具相比,Grok Build 把關鍵細節直接攤開。使用時不一定要綁定雲端環境,亦可以自己編譯、指向本地推理後端,令測試、除錯、客製化與安全審視都有更大空間;代價是你要自己處理部署與整合,門檻自然較高。

對需要打造自訂 coding agent、終端工作流,或研究代理工具調度方式的人來說,這次開源相當有參考價值。

項目主頁

Categories: 開源, Agentic, API, MCP, Vibe Coding, 安全, 編程, Skill 技能

AsySplat:3D 場景重建更省算力

Teaser Image

AsySplat 是一個用於 3D Gaussian Splatting 的重建框架,主力解決長序列、廣覆蓋場景做新視角合成時,訓練和推理都太重的問題。現階段這個 GitHub 儲存庫主要提供項目頁、論文連結和資源,程式碼尚未公開,所以要理解它,重點放在方法設計而不是直接安裝部署。

它的做法是把 geometry branch 和 appearance branch 分開,前者處理較粗粒度的資訊,後者用較少參數補回外觀細節,再用 bilateral connections 互相引導。這種取向和一般把所有資訊一起硬塞進去的做法不同,目標是把算力用在更值得的位置。

從現有資料看,AsySplat 比較適合做多視角場景重建、研究級新視角合成,或需要在較大輸入規模下控制訓練成本的團隊。同時使用 sparse attention module,結合 convolution blocks 和 self attention 來減少開銷,並在 32-view 960P 輸入上取得較少參數和較低訓練、推理負擔的結果。

  • 類型:3D Gaussian Splatting 重建框架
  • 目標:降低 wide-coverage scene modeling 的重複計算
  • 特色:幾何與外觀分流處理,再以 bilateral connections 協調
  • 效能:在 32-view 960P 設定下,宣稱比之前的 generalizable models 更省參數和開銷
  • 相關模型:3D Gaussian Splatting、generalizable 3DGS models、novel view synthesis (NVS)

項目主頁 · GitHub

Categories: 開源, 香港, 香港科技大學, 3D, 香港城市大學, Dataset 數據集

Kimi K3 編程實測:能否撐起複雜項目

Og image

Kimi K3 的焦點落在編程能力,而不是單純講參數規模。這次實測把它放進 Claude Code,直接看它能否應付從零開發原生 macOS 和 iOS App、2D 與 3D 遊戲,以及較複雜的前端工作流。這類測試最有價值的地方,是能看出模型在長上下文、多步驟修改和除錯時,能否保持一致性。

和一般只看跑分或簡單問答的展示相比,這種做法更接近真實使用情境。開發者在意的通常不是模型會不會背答案,而是它能否理解已有程式結構、持續追蹤修改,並在多輪互動後仍然做對決定。

這個內容特別適合以下讀者:
– 需要評估 AI 編程助手的人
– 關心 Claude Code、Kimi K3 這類模型實戰表現的人
– 想看原生 App、2D/3D 遊戲與前端生成能力差異的人
– 留意國產模型是否追上第一梯隊的人

影片同時提到 Kimi K3 的 2.8 兆參數與 100 萬 Token 上下文窗口,顯示它主打的是長文脈和複雜編碼任務。不過,真正要看的仍然是它在高難度項目裡能否穩定交付,而不是單看規格有多大。

項目主頁

Categories: 模型, 教學

VIABench 視覺模型如何協助失明應用

VIABench cover

講到視覺模型,很多測試仍然停留在「見到乜、答到乜」;VIABench 把焦點轉去更貼身的助盲情境,直接檢查多模態大型語言模型可否在日常片段中作出提醒、回答環境問題,甚至按目標提供引導。它屬於Dataset 數據集兼評測基準,處理的是視障協助場景長期缺乏貼地測試標準這個問題。

VIABench 不再只量度被動理解,而是把影片 Multimodal Large Language Models 與真實任務綁在一起。資料來自盲人錄製或分享的第一身影片,包含 761 段影片、46.9 小時內容,以及 14,526 筆人工整理標註,圍繞 Proactive Reminder、Visual Question Answering、Vision-Guided Interaction 三類任務,測試模型會否在合適時間講合適內容。

和常見視覺問答基準相比,VIABench 的分野在於它重視「協助能力」多過一般描述能力。這意味模型不單要看懂畫面,還要判斷何時提醒、如何回應環境細節,以及怎樣支援使用者完成目標;取捨是任務更接近真實世界,但評測難度也更高,單靠表面語意對齊未必夠。

  • 核心價值在於測試影片 MLLMs 能否提供可行協助,而非只做畫面解說
  • 任務覆蓋主動提醒、視覺問答、互動引導三種助盲場景
  • 數據來自真實第一身影片,場景代表性比通用影片基準更強

較適合關注無障礙 AI、assistive technology、video MLLMs 評測的研究團隊,也適合想比較不同模型在真實互動場景表現的人。現有資料已足夠理解它作為基準的定位;使用前較合理的做法,是先查閱論文與 Hugging Face 資料集頁面,再確認支援哪些相關模型與評測設定。

GitHub

Categories: 開源, Video, 多模態模型, 視覺模型, Dataset 數據集, 南京大學

statistical_self_consistency:檢查 LLM 判斷靠唔靠得住

Statistical self-consistency in language models

當你想用 Large Language Models(LLMs)去估計某個群體的收入、意見分布或問卷答案,最麻煩唔係模型有冇答,而係同一批人用不同條件拆開再合併之後,結果會唔會前後一致。statistical_self_consistency 針對的正是呢個問題:它屬於研究實驗型程式庫,用二元 conditioning tree 把人群逐層分割,向模型索取各節點估計,再用 law of total probability 重建整體分布,檢查模型輸出有幾接近真正「條件機率」應有的表現。

項目的技術重點唔係再訓練一個新模型,而係替現有 LLM 加上一套 reference-free 的自我檢查方法。它一邊比較重建後的 aggregate 與直接 marginal estimate 是否一致,一邊再用 American Community Survey(ACS)、Global Opinion QA 同 World Values Survey(WVS)的人類統計資料做 alignment 對照。呢個取向同一般只睇單題準確率或 benchmark 分數的做法唔同,因為它更關心模型輸出在統計層面有冇內在矛盾。

資料與執行方式也反映出它偏向研究用途。README 已交代實驗分佈在 src/experiments_acs/src/experiments_global_opinion_qa/src/experiments_wvs/,ACS 與 WVS 亦有對應 data loader;WVS 需要自行從官方網站下載 SPSS 檔案並放到指定資料夾,另有 secrets/secret_config.yaml 儲存 API keys。原始資料沒有提供一鍵部署、公開模型下載或產品化介面,較合理的理解是:你會用它重跑論文實驗、檢查提示設計下的估計穩定性,或者把同類方法接到自己的 LLM 評測流程。

  • 用 binary conditioning trees 檢查 LLM 估計能否在分割與聚合後保持一致
  • 涵蓋 ACS、Global Opinion QA、WVS 三類任務,包含收入估計、跨國意見題與問卷分布
  • 同時做 self-consistency checks 與 human data alignment,唔只看單次回答
  • 依賴外部資料與 API keys,較接近研究驗證流程,未見即裝即用的產品包裝

受益最大的會是做 LLM evaluation、computational social science、survey estimation 或 prompt-based inference 的研究者與團隊。它未有在目前資料中列出完整性能數字,但方法定位相當清楚:不是追求更花巧的生成能力,而是量度模型在條件推斷場景下有幾可信。相關模型名稱在現有資訊中未被具體列出,只能確認此項目面向一般 LLM 實驗,而非綁定單一模型家族。

GitHub

Categories: 開源, API, Dataset 數據集, 框架

UniVR:視覺推理訓練變成可控工作流

UniVR Overview

UniVR 係一個能理解我們視覺空間中的思考方式及其在統一視覺推理中的應用,它針對 Emu3.5 unified generative models 的訓練框架,處理的是視覺推理、長程規劃同結果判斷點樣一齊學。它唔係拿來直接做推理展示,而係俾你用自己的資料同獎勵訊號,去微調一個已經懂得處理圖像與文字的底座模型。

SFT(supervised fine-tuning)階段要提供統一格式的樣本:query image、textual instruction、visual reasoning trajectory;RL(reinforcement learning)階段則改成透過 HTTP reward server 送回分數。原始資料沒有提供完整安裝流程,所以目前可確定的只有要把自定義 PyTorch Dataset 接入 UniVR_SFT/train.py,以及把 reward function 換成自己的服務。

和一般只做單次微調的做法相比,UniVR 的取向更偏向「先教格式,再用獎勵修正推理」。它在 RL 端用 GRPO,並配合 HybridEngine 與 Emu3.5 的 vLLM patch,強調 rollout 效率;同時保留 LoRA 同 full-parameter training,適合資源與改動幅度唔同的團隊。

  • 支援多節點 SFT,兼容 LoRA 同 full-parameter training
  • RL 端基於 verl,同 GRPO 搭配自訂 HybridEngine
  • Emu3.5 的 vLLM no-CFG parallel inference 可做到約 2 倍 throughput
  • 獎勵設計分成 format reward、global reward,同 step-level 的視覺推理約束
  • 相關模型包括 Emu3.5 同作為評分器的 Qwen3-VL-30B

較容易受惠的情境包括做視覺代理、機械臂/操作規劃、長程任務推理,或者想將現成視覺模型轉成自己工作流的團隊。它的價值在於把「資料格式、推理軌跡、獎勵判斷」串成同一條訓練路線,令視覺任務唔再只靠靜態標註去學。

項目主頁 · GitHub · Paper

Categories: 開源, Qwen, 字節跳動, Gemini, DeepSeek, OpenAI, Image, Python, 多模態模型, 模型訓練, Dataset 數據集

VideoChat3 一個睇得耐又睇得準的影片模型

VideoChat3 logo

影片理解最麻煩的地方,往往唔係「識唔識睇」,而係要一邊保留動作細節,一邊捱得住長時間片段。VideoChat3 就係朝住呢個矛盾落手:它屬於多模態模型(Multimodal Large Language Model, MLLM),目標係用同一個 4B 模型處理細微動作、長片推理、temporal grounding 同 live streaming 回應。

同類項目好多時只會專注其中一段工作流,例如短片動作辨識,或者長片問答。VideoChat3 的取向係做 generalist video understanding,代價就唔係追求單一場景最極致的規格,而係用 I3D-ViT 同 Adaptive Frame Resolution 平衡 token 成本、時序證據同延遲,令模型唔需要全程用高成本方式讀完整段影片。

  • 重點唔只係睇單格畫面,而係保留跨時間的證據
  • I3D-ViT 提供 16× spatiotemporal compression,主打效率
  • Adaptive Frame Resolution 會按需要提高畫面解析度,較適合 streaming 場景
  • 已公開 model weights 同完整訓練數據,但 training code 仍未釋出

部署同測試的理解方式幾直接:現階段較接近研究釋出與模型體驗,適合先經 Hugging Face 取用 models & data,再按示範場景驗證長片問答、時間定位同串流回應表現。README 已列明完整訓練資料包括 Academic2M、LV116K、OL617K,對研究團隊、做 video agent、或者要建構影片檢索與監察流程的團隊最有參考價值。

公開資訊亦交代咗幾個關鍵數字:4B parameters、3M curated instruction samples、2,048 frames 下約 20.4s latency。呢啲數據未必代表所有環境都會有同樣效果,但至少講清楚它想證明的方向:唔靠超大模型,都可以把影片中的時間線索、事件關聯同即時反應放入同一套架構。相關模型與模組則以 VideoChat3、I3D-ViT、Adaptive Frame Resolution 為核心,整體更似一個面向研究與進階應用的開源影片理解項目。

項目主頁 · GitHub · 模型

Categories: 開源, Agentic, Video, 3D, 多模態模型, 模型, 視覺模型, 框架, 南京大學

ComfyUI XY Plot 的乾淨做法

Og image

這段內容講的是 ComfyUI 裡的 XY Plot 用法,重點不在花俏效果,而在怎樣保留乾淨流程,同時方便比對不同參數、模型或提示詞的輸出差異。對經常要試圖、做視覺比較、或整理生成結果的人來說,這種做法會比把工作流拆得很碎更順手。

影片想解的問題很直接:不少 XY Plot 教學都會逼人用很重的接線、侵入式的自訂 KSampler,甚至把原本清晰的工作流弄得難以維護。這裡提出的取向是盡量少改動主流程,讓比較測試留在 ComfyUI 的正常操作邏輯裡完成。

它的價值主要在這幾點:
– 保持工作流較乾淨,較易重用
– 減少對自訂節點的依賴
– 方便橫向比較不同設定的效果
– 較適合要反覆調參的圖像生成工作

整體來說,這類做法對常用 ComfyUI 做實驗的人最有用,尤其是需要快速看清楚某個參數改動帶來什麼差別,而唔想每次都重砌一套流程。影片屬於教學內容,沒有提供模型評測數據,但方向很明確,就是用更少干擾的方式做 XY Plot。

項目主頁

Categories: ComfyUI, 教學

Page 9 of 125
1 7 8 9 10 11 125