清華大學與香港科技大學的研究團隊近日提出 LiveEdit,一個面向通用文本指令的即時流式影片編輯框架。該方法以因果、分塊的方式處理持續到來的影片,在 4 步/影片塊的推理條件下實現 12.66 FPS 的流式編輯,同時保持被編輯區域的準確性以及未編輯區域的一致性。相關論文《LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing》已被計算機視覺頂級會議 ECCV 2026 接收,訓練、測試程式碼和模型均已開源。
流式影片編輯與常規影片生成任務存在本質差異:影片生成可以從高斯噪聲中自由合成新內容,而編輯任務需要在改變目標區域的同時,儘可能保持原始影片中的人物結構、背景紋理、光照和運動軌跡。因此,直接複用面向生成的流式框架,往往會帶來背景閃爍、結構漂移或編輯範圍失控等問題。
研究團隊指出,高質量影片擴散模型通常依賴對完整影片進行雙向時空注意力處理,即模型需要等待未來幀到齊再聯合處理整段影片。這種範式雖能獲得較好的編輯結果,卻難以滿足低延遲、持續輸入與即時輸出的要求。進入流式場景後,模型只能檢視當前與歷史內容,如果直接截斷未來幀,原本集中於鄰近幀的注意力會被攤薄到更長的歷史範圍,破壞預訓練階段形成的區域性時序先驗,最終表現為對原始影片結構的“遺忘”,並在長時間編輯中出現閃爍或漂移。
此外,在多數編輯任務中,真正發生語義變化的區域只佔畫面的一部分,背景、結構和大量靜態紋理在相鄰影片塊之間高度相似,但標準影片擴散模型仍會讓所有空間 Token 反覆通過 Self-Attention、Cross-Attention 和 FFN,對未編輯區域進行密集重計算,浪費算力並可能讓本應保持不變的內容被反覆“重畫”。
LiveEdit 設計了漸進式的三階段蒸餾流程。其基礎模型建立在 Wan2.1-T2V-1.3B 之上,訓練資料由從現有影片編輯資料集 Ditto-1M 篩選得到的兩萬組高質量資料對構成。第一階段保留完整的雙向 DiT 結構,讓模型充分學習從原始影片、編輯指令到編輯結果的複雜對映,並在輸入端將原始影片潛變數與噪聲潛變數沿通道維度注入,以避免序列長度增長帶來的計算開銷。第二階段引入塊狀因果注意力,每個影片塊只能訪問當前塊和歷史塊,時間塊大小設定為 3 個潛空間幀,通過教師強制讓雙向模型的區域性結構先驗逐步遷移到單向、分塊的因果擴散模型中。第三階段使用分佈匹配蒸餾(Distribution Matching Distillation)壓縮取樣過程,生成器直接由第二階段的因果擴散模型權重初始化,最終將推理步數從 100 次降至 4 次,同時移除需要額外前向計算的 Classifier-Free Guidance。
僅減少擴散步數仍不足以實現穩定高效的即時影片編輯,LiveEdit 進一步提出面向自迴歸的掩碼快取(AR-oriented Mask Cache)。該方法比較前一個影片塊中原始影片潛變數與編輯結果的差異,按照一定閾值預測當前影片塊中可能發生編輯的空間區域掩碼,將 Token 劃分為活躍編輯區域與未編輯區域:需要編輯的 Token 繼續執行完整計算,未編輯 Token 則優先複用先前快取的中間特徵。閾值並非固定設定,而是根據當前 Token 的冗餘程度動態調整,在論文采用的推理配置下,70% 的冗餘空間 Token 被裁剪。
快取位置同樣經過專門設計。消融實驗發現,Self-Attention 特徵在相鄰時刻之間具有較強的重複性,更適合進行跨時間複用;相比之下,FFN 保留了更多紋理和區域性結構等高頻空間資訊,直接複用容易造成畫面模糊甚至結構不穩定。因此,最終方案將快取應用在 Self-Attention 層,而不是簡單快取整個 DiT 塊。
在效率測試中,LiveEdit 處理 81 幀影片的總延遲為 7.89 秒,達到 12.66 FPS。為評估通用流式編輯能力,研究團隊建立了包含 120 組樣本的測試集,並從文本對齊度、背景一致性、運動平滑度、動態程度、美學質量和影片質量等六個維度進行比較。定性結果顯示,LiveEdit 能夠準確完成區域性顏色、材質和屬性替換,並減少向非編輯區域漂移的情況,快取機制在保持背景一致性的同時沒有削弱文本指令對齊和運動連續性。使用者研究邀請 20 名志願者對指令一致性、背景保留和整體質量三方面進行排序,LiveEdit 的 Top-3 偏好率分別達到 100.0%、87.5% 和 95.8%。
LiveEdit 的目標並不只是一個更高的 FPS 數字,而是為“流式影片編輯”設計即時化路徑,為直播特效、視訊會議、即時內容創作與互動提供更直接的技術基礎。不過,當前方法仍依賴相鄰影片塊編輯區域較穩定的假設;當目標快速移動、編輯區域劇烈變化或出現大範圍全域性修改時,掩碼估計與快取複用策略仍有最佳化空間。如何在更長影片、更高解析度和複雜互動指令下保持穩定,將是後續值得關注的問題。