
對需要同時理解文字與影像、甚至生成影像的模型來說,最難處理的不只是資料量,而是不同能力會否互相拖累。這項由 Meta FAIR、Reality Labs 與 University of Oxford 團隊進行的研究,以統一多模態預訓練為焦點,探討語言、視覺理解和視覺生成怎樣共同學習。
研究發現,跨模態知識流動並不對等。語言資料可普遍提升各類視覺任務;視覺理解會為影像生成提供強而有力的先驗知識;視覺生成對其他能力的直接幫助則較有限,主要透過加快低階概念學習,間接改善理解能力。團隊亦以 CLEVR 合成資料集配合真實世界資料,分辨不同概念之間的轉移方式。
- 語言可增強視覺理解與視覺生成能力
- 任務愈複雜,模態之間愈可能出現競爭
- 參數共享方式會改變不同模態能否產生協同效果
- 視覺路徑應由預訓練初期同步學習
- 延後加入視覺訓練,可能造成「vision laziness」
「vision laziness」指模型過度依賴語言捷徑,未有充分學習影像訊號。研究比較早期統一訓練、後期整合及順序式訓練後認為,視覺與語言由一開始共同演化,表現會較穩定;將視覺資料延後加入,即使模型其後接觸影像,也未必能補回早期錯失的表徵學習。
團隊把受控實驗得出的資料混合比例與擴展策略,套用至以 2T tokens 訓練的 13.5B Mixture-of-Experts(MoE)模型驗證。對設計多模態基礎模型的人而言,研究提供的價值不在單一架構,而是指出資料配比、任務難度、共享設計與整合時機,均會直接影響模型是否真正學會運用視覺。