
做 3D Question Answering 時,projection-based 3D vision-language models 往往要先把多視角 RGB-D 特徵投影到世界座標,結果每個場景會堆出幾千個 token,推理速度同記憶體壓力都會立即變成瓶頸。3DZip 屬於token compression 框架,處理的正正是這個問題,而且做法不是再訓練一個新模型,而是直接插進現有流程,先減重再回答問題。
它的判斷很清楚:3D token 的冗餘不只來自空間上太接近,還包括物件層級分佈不平均,所以單靠 2D VLM 常見的 attention 或語意相關性壓縮,未必保得住 3D 幾何結構。3DZip 用三步走處理,先做 voxelization 清走點級重複,再用 Determinantal Point Process(DPP)挑出特徵夠多樣的 anchor tokens,最後在空間限制下合併其餘 token,重點是保持 geometric coherence。

3DZip 提供 LLaVA-3D 的 inference 與 evaluation code,代表你可以把它理解成偏向研究驗證、效能比較同既有模型加速的項目,而不是即裝即用的完整產品。核心演算法放在 llava/model/multimodal_encoder/video_encoder.py 的 3dzip pooling branch,部署思路也很直接:以 LLaVA-3D 為基礎模型,把壓縮流程接到 multimodal encoder,再用基準測試看 token 數、速度同回答質素之間的取捨。
3DZip 在三個 3D question answering benchmarks 上,壓到128 tokens之後仍保留94.7%原始表現,推理速度提升到1.92×。這類數字最適合需要在有限 GPU 記憶體內跑 3D VLM、又不想為加速重新訓練整個模型的研究團隊;代價是目前公開重點仍集中在推理與評估,Hugging Face 權重與更完整版本例如 3DZip++ 仍未釋出。
- 免訓練設計,重點在於直接壓縮 projection-based 3D VLM 的 token 成本
- 與 2D token compression 不同,3DZip 同時處理空間結構同特徵多樣性
- 已公開 LLaVA-3D 的 inference 與 evaluation code,較適合研究與基準比較
- 128 tokens 仍保住 94.7% 原始表現,推理速度可達 1.92×
- 現階段較像演算法模組,未見完整產品化封裝









