
影片生成模型愈來愈強,但推理速度依然是開發者和創作團隊最常卡住的地方。NVIDIA Research 提出的 Sol-Attn,正正針對這個矛盾:它把「訓練用嘅成本」同「推理時嘅效率」分開處理,讓預訓練模型無須重新訓練就可以直接加速。
Sol-Attn 屬於免訓練(training-free)嘅稀疏注意力機制,做法是動態計算一個 query 相關嘅閾值,即場篩走低貢獻嘅注意力區塊,同時把未選中嘅分數重用做近似補償,整個過程喺一次 online-softmax 內完成。換句話講,它毋須事先計好一張路由表,亦唔會直接丟棄被跳過嘅區塊,因此能保留長尾分佈對最終畫面嘅影響。
喺 Wan 2.1、Hunyuan 1.5、LTX 2.3、Bernini 等多個主流模型上,Sol-Attn 都做到約 2 倍嘅速度提升,同時畫質幾乎唔受影響。若配合 Sol-Engine 中其他加速技巧,仲可以推到 5 倍嘅端到端加速。對於要跑長影片、做後製編輯,或者本地有限顯示卡環境嘅使用者來說,呢個幅度算係幾實用嘅改進。
對比以往「離線先揀一次、再丟棄」嘅做法,Sol-Attn 最大嘅差異在於即場判斷同重用機制。讀者如果本身就喺度搵方法縮短生成等待時間,又唔想額外花資源微調模型,呢套方案值得留意。