色哟哟国产精品_亚洲视频视频在线_欧美顶级少妇做爰_亚洲欧美在线视频

首頁 資訊 > 金融 > 正文

ICML 2026 | 我們讓蒸餾模型當了采樣器,Diffusion RL采樣成本降低一個數量級 即時看

擴散模型已經成為圖像和視頻生成的重要底座,但當研究者希望用在線強化學習進一步優化審美質量、文本一致性和視頻綜合表現時,訓練成本很快成為瓶頸:每次 policy rollout 往往要完成大量去噪步驟,在線采樣占據了大量訓練時間。

過去的 Diffusion RL 多聚焦于獎勵設計與優化算法,訓練時的采樣成本被忽視。DMSampler 指出:在在線 RL 中,限制規模化的不只是獎勵信號或優化器,很多時候是 rollout 本身太貴。

最直接的想法是減少采樣步數,例如從 50 步降至 10 步,但這會導致樣本質量下降。一旦獎勵模型基于劣化樣本進行評估,策略更新便可能偏離高質量分布。


【資料圖】

圖 1:傳統 Diffusion RL 框架(左)與 DMSampler(右)的概念對比。傳統方法每次 RL 更新依賴約 50 步采樣;DMSampler 引入共同演化的少步蒸餾采樣器,圖中給出了 VBench 訓練耗時從 900 小時降至 288 小時的對比。

讓蒸餾模型跟著 policy 一起進化

DMSampler 的核心判斷是:蒸餾模型不應僅是訓練結束后的推理加速工具,更可作為低成本采樣器,深度參與 Diffusion RL 的每一輪策略更新。

  • 論文標題:Distillation Models are Good Samplers for Diffusion Reinforcement Learning
  • 論文地址:https://openreview.net/pdf?id=VkMWujvv2c
  • 項目地址:https://github.com/HiDream-ai/DMSampler

具體來說,該框架維護一個與 policy model 共同演化的 few-step distilled sampler。此采樣器僅需 4 至 8 步(圖像任務 7 步,視頻任務 16 步),并通過周期性重蒸餾來追隨更新后的策略。

圖 2:DMSampler 整體框架

整個框架由兩個階段交替組成。

RL 階段:蒸餾采樣器參數凍結,用混合蒸餾采樣快速生成樣本;樣本經 reward model 打分后,用于更新 policy model。實驗以 DiffusionNFT 為底層優化器,但 DMSampler 的改動在采樣環節。

蒸餾階段:更新后的 policy model 充當 teacher,對 distilled sampler 進行重蒸餾,使其重新貼近當前 policy 分布。其中,軌跡分布匹配(TDM)保證基礎對齊,而獎勵感知蒸餾則確保高獎勵軌跡的能力得以保留。

兩階段循環推進后,policy 通過 RL 獲得更好的生成能力,sampler 通過蒸餾同步追上新的 policy 分布,下一輪 RL 又能以更低的采樣成本繼續訓練。

蒸餾:從后處理變為 RL 訓練的一環

傳統流程中,蒸餾往往發生在訓練之后。DMSampler 改變了這個順序,讓蒸餾從「后處理」變成訓練閉環的一部分。

在此框架中,RL 階段借助蒸餾模型降低 rollout 成本,蒸餾階段又利用 RL 優化后的 policy 提升蒸餾模型本身。兩者不再是先后關系,而是共同演化關系。

混合采樣:保住結構,提速后半程

在采樣策略上,DMSampler 并未把整個去噪鏈路都交給蒸餾模型。擴散采樣的前半程更決定結構、語義布局和主體內容,后半程更多影響紋理與細節。因此,讓 policy model 先完成早期去噪,再由蒸餾模型接手后期步驟,可以在保持分布對齊的同時減少計算。

圖 3:四種采樣策略對比

論文比較了四種策略:S1 使用原 policy model 完成完整采樣并啟用 CFG,質量強但成本高;S2 全程使用少步蒸餾模型,速度最快但分布漂移明顯;S3 先由 policy model 完成早期去噪,再切換到蒸餾模型處理后期步驟,是最終采用的方案;S4 則反過來先用蒸餾模型,早期偏差會影響后續結構,policy model 難以完全修正。

結果顯示,S3 在圖像任務中將步數從 40 步減至 7 步,視頻任務從 50 步減至 16 步,同時保持了較高的 OCR 表現。

獎勵感知蒸餾

只讓蒸餾模型追上 policy 的平均分布還不夠,Diffusion RL 真正要保留的是高 reward 樣本背后的能力。

DMSampler 在 RL 階段記錄生成樣本、初始噪聲和對應 reward;進入蒸餾階段后,框架從中篩選高 reward 軌跡。若無樣本超過閾值,則至少保留 reward 最高的一條。隨后,reward-weighted trajectory loss 會讓蒸餾模型更重視這些軌跡,權重隨 reward 單調增加。

消融實驗顯示,去掉獎勵感知蒸餾后,圖像 OCR 從 0.97 降到 0.96,視頻 OCR 從 0.50 降到 0.48。提升幅度有限,但說明高 reward 軌跡有助于穩定迭代。

少步采樣帶來加速,性能基本不掉

在文本渲染任務上,DMSampler 將圖像采樣從 40 步降到 7 步、視頻采樣從 50 步降到 16 步,性能基本保持。與直接減少采樣步數(DRS)相比,優勢顯著:DRS1 將步數減半并保留 CFG;DRS2 在此基礎上關閉 CFG;DRS3 進一步降到 10 步。視頻任務對樣本質量更敏感,DRS3 的視頻 OCR 回到基線水平,而 DMSampler 在 7 步圖像采樣和 16 步視頻采樣下仍保持接近完整采樣的表現。

表 1:DMSampler 與直接減步策略的對比。DMSampler? 為去掉 Reward-aware Distillation 的消融版本。

圖 4:不同加速策略生成的視頻效果對比。DRS 導致明顯質量退化,DMSampler 保持高質量。

GenEval 綜合評測:從 0.63 提升到 0.96

在 GenEval 基準測試上,DMSampler 取得 Overall 0.96,超過 FlowGRPO 和 DiffusionNFT 的 0.95;相比 Base(SD3.5-M)的 0.63,提升更為明顯。作為參照,GPT-4o 為 0.84,Qwen-Image 為 0.91。訓練效率方面,論文報告 DMSampler 需要 360 GPU hours,低于 FlowGRPO 的 2000 GPU hours 和 DiffusionNFT 的 480 GPU hours。

表 2:GenEval 基準測試結果。

1.3B 模型超過 14B,訓練時間降至約三分之一

在 VBench 視頻評測上,DMSampler 將 Wan2.1-1.3B 的總分從 81.23 提升到 85.00,超過 Wan2.1-14B(83.69)及 CausVid(83.88)、HunyuanVideo(83.43)。相比 DiffusionNFT,DMSampler 將訓練時間從約 900 小時降至約 288 小時,總分從 84.74 提升至 85.00。

表 3:VBench 基準測試結果(完整 16 個評測維度,分兩組展示)。

續表 3:其余 8 個評測維度

圖 5:VBench 生成視頻效果對比。

不綁定優化器,可作為通用采樣模塊

DMSampler 不依賴某一個 RL 優化器。研究者將其分別接入 FlowGRPO 和 DGPO,并在 GenEval 上驗證:FlowGRPO 的訓練成本從超過 1000 GPU hours 降到 400 GPU hours,GenEval 分數從 0.95 提升到 0.96;DGPO 的訓練成本從 240 GPU hours 降到 192 GPU hours,GenEval 分數保持 0.97。

表 4:DMSampler 接入不同 RL 優化器的效果。

這表明,DMSampler 更像是一個面向在線 Diffusion RL 的采樣加速模塊。它不改變優化器本身的目標函數,而是降低 rollout 成本,因此可以與不同 RL 方法組合使用。

副產品:蒸餾模型同步增強

DMSampler 的主要目標是訓練更強的 policy model,但共同演化的蒸餾采樣器本身也獲得了性能提升。在 VBench 上,該蒸餾模型取得 84.21 的總分和 85.60 的 Quality 分數,超過 CausVid(82.88)、Self Forcing(83.80)和 BLADE(83.38)等蒸餾方法。

表 5:DMSampler 蒸餾模型與其他蒸餾方法的對比。

傳統蒸餾側重推理加速,而 DMSampler 的蒸餾采樣器會在訓練過程中不斷吸收 RL 優化后的高 reward 能力。因此,它不僅是加速器,也成為經過 reward 對齊的少步生成器。

圖 6:DMSampler 蒸餾模型的生成示例。

從訓練加速到協同進化

整體來看,DMSampler 首次將可訓練、共同演化的蒸餾模型作為 Diffusion RL 的采樣引擎。通過雙階段交替訓練、混合蒸餾采樣和獎勵感知蒸餾,將 rollout 采樣成本降到更適合在線訓練的范圍。

其意義不僅在于加速,更在于重新審視了采樣成本這一瓶頸,并將蒸餾從后處理前移,使之與 RL 后訓練在同一閉環中相互增益。實驗中,DMSampler 在 GenEval 上取得 0.96,在 VBench 上取得 85.00,均達到當前最優水平。訓練效率上,GenEval 任務從 DiffusionNFT 的 480 GPU hours 降到 360 GPU hours,VBench 任務從約 900 小時降到約 288 小時。它不綁定特定 RL 優化器,也可以與 FlowGRPO、DGPO 等方法組合使用。

對后續研究來說,DMSampler 的協同進化思路可以遷移到其他需要大量 rollout 的生成模型 RL 場景,也為擴散模型蒸餾與強化學習的結合提供了新的技術參考。

關鍵詞: rl 樣本 采樣器 蒸餾模型 diffusion

最近更新

關于本站 管理團隊 版權申明 網站地圖 聯系合作 招聘信息

Copyright © 2005-2023 創投網 - www.69066a.com All rights reserved
聯系我們:311 3831 582@qq.com
皖ICP備2022009963號-3

主站蜘蛛池模板: 国产在线一区二区三区欧美| 不卡视频一区| 久久精品视频91| 日本精品二区| 色综合久久久久久中文网| 日韩欧美一区二区三区四区五区 | 欧美激情极品视频| 久久这里精品国产99丫e6| 成人免费网站在线| 久久国产精品视频在线观看| 亚洲a区在线视频| 91极品视频在线| 国产精品入口福利| 欧美激情在线一区| 欧洲精品在线一区| 欧美日韩一区二区三区在线观看免 | 亚洲熟妇无码另类久久久| 国产精品美女久久久久av超清 | 亚洲综合精品伊人久久| 国产精品亚洲综合天堂夜夜| 久久99久久精品国产| 国产精品一区电影| 久久999免费视频| 蜜桃视频一区二区在线观看| 精品久久精品久久| 亚洲AV无码成人精品一区| 欧美人成在线视频| 国产伦精品免费视频| 午夜精品蜜臀一区二区三区免费| 97精品免费视频| 精品视频导航| 日本亚洲欧洲精品| 欧美亚洲第一页| 中文字幕久久一区| 久久精品午夜福利| 日韩一二三区不卡在线视频| 国产一区二区视频在线免费观看| 国产高清不卡av| 国产日产欧美一区二区| 久久久久久草| 欧美日韩午夜爽爽|