ICML 2026 | 我們讓蒸餾模型當了采樣器,Diffusion RL采樣成本降低一個數量級 即時看
擴散模型已經成為圖像和視頻生成的重要底座,但當研究者希望用在線強化學習進一步優化審美質量、文本一致性和視頻綜合表現時,訓練成本很快成為瓶頸:每次 policy rollout 往往要完成大量去噪步驟,在線采樣占據了大量訓練時間。
過去的 Diffusion RL 多聚焦于獎勵設計與優化算法,訓練時的采樣成本被忽視。DMSampler 指出:在在線 RL 中,限制規模化的不只是獎勵信號或優化器,很多時候是 rollout 本身太貴。
最直接的想法是減少采樣步數,例如從 50 步降至 10 步,但這會導致樣本質量下降。一旦獎勵模型基于劣化樣本進行評估,策略更新便可能偏離高質量分布。
【資料圖】
圖 1:傳統 Diffusion RL 框架(左)與 DMSampler(右)的概念對比。傳統方法每次 RL 更新依賴約 50 步采樣;DMSampler 引入共同演化的少步蒸餾采樣器,圖中給出了 VBench 訓練耗時從 900 小時降至 288 小時的對比。
讓蒸餾模型跟著 policy 一起進化
DMSampler 的核心判斷是:蒸餾模型不應僅是訓練結束后的推理加速工具,更可作為低成本采樣器,深度參與 Diffusion RL 的每一輪策略更新。
- 論文標題:Distillation Models are Good Samplers for Diffusion Reinforcement Learning
- 論文地址:https://openreview.net/pdf?id=VkMWujvv2c
- 項目地址:https://github.com/HiDream-ai/DMSampler
具體來說,該框架維護一個與 policy model 共同演化的 few-step distilled sampler。此采樣器僅需 4 至 8 步(圖像任務 7 步,視頻任務 16 步),并通過周期性重蒸餾來追隨更新后的策略。
圖 2:DMSampler 整體框架
整個框架由兩個階段交替組成。
RL 階段:蒸餾采樣器參數凍結,用混合蒸餾采樣快速生成樣本;樣本經 reward model 打分后,用于更新 policy model。實驗以 DiffusionNFT 為底層優化器,但 DMSampler 的改動在采樣環節。
蒸餾階段:更新后的 policy model 充當 teacher,對 distilled sampler 進行重蒸餾,使其重新貼近當前 policy 分布。其中,軌跡分布匹配(TDM)保證基礎對齊,而獎勵感知蒸餾則確保高獎勵軌跡的能力得以保留。
兩階段循環推進后,policy 通過 RL 獲得更好的生成能力,sampler 通過蒸餾同步追上新的 policy 分布,下一輪 RL 又能以更低的采樣成本繼續訓練。
蒸餾:從后處理變為 RL 訓練的一環
傳統流程中,蒸餾往往發生在訓練之后。DMSampler 改變了這個順序,讓蒸餾從「后處理」變成訓練閉環的一部分。
在此框架中,RL 階段借助蒸餾模型降低 rollout 成本,蒸餾階段又利用 RL 優化后的 policy 提升蒸餾模型本身。兩者不再是先后關系,而是共同演化關系。
混合采樣:保住結構,提速后半程
在采樣策略上,DMSampler 并未把整個去噪鏈路都交給蒸餾模型。擴散采樣的前半程更決定結構、語義布局和主體內容,后半程更多影響紋理與細節。因此,讓 policy model 先完成早期去噪,再由蒸餾模型接手后期步驟,可以在保持分布對齊的同時減少計算。
圖 3:四種采樣策略對比
論文比較了四種策略:S1 使用原 policy model 完成完整采樣并啟用 CFG,質量強但成本高;S2 全程使用少步蒸餾模型,速度最快但分布漂移明顯;S3 先由 policy model 完成早期去噪,再切換到蒸餾模型處理后期步驟,是最終采用的方案;S4 則反過來先用蒸餾模型,早期偏差會影響后續結構,policy model 難以完全修正。
結果顯示,S3 在圖像任務中將步數從 40 步減至 7 步,視頻任務從 50 步減至 16 步,同時保持了較高的 OCR 表現。
獎勵感知蒸餾
只讓蒸餾模型追上 policy 的平均分布還不夠,Diffusion RL 真正要保留的是高 reward 樣本背后的能力。
DMSampler 在 RL 階段記錄生成樣本、初始噪聲和對應 reward;進入蒸餾階段后,框架從中篩選高 reward 軌跡。若無樣本超過閾值,則至少保留 reward 最高的一條。隨后,reward-weighted trajectory loss 會讓蒸餾模型更重視這些軌跡,權重隨 reward 單調增加。
消融實驗顯示,去掉獎勵感知蒸餾后,圖像 OCR 從 0.97 降到 0.96,視頻 OCR 從 0.50 降到 0.48。提升幅度有限,但說明高 reward 軌跡有助于穩定迭代。
少步采樣帶來加速,性能基本不掉
在文本渲染任務上,DMSampler 將圖像采樣從 40 步降到 7 步、視頻采樣從 50 步降到 16 步,性能基本保持。與直接減少采樣步數(DRS)相比,優勢顯著:DRS1 將步數減半并保留 CFG;DRS2 在此基礎上關閉 CFG;DRS3 進一步降到 10 步。視頻任務對樣本質量更敏感,DRS3 的視頻 OCR 回到基線水平,而 DMSampler 在 7 步圖像采樣和 16 步視頻采樣下仍保持接近完整采樣的表現。
表 1:DMSampler 與直接減步策略的對比。DMSampler? 為去掉 Reward-aware Distillation 的消融版本。
圖 4:不同加速策略生成的視頻效果對比。DRS 導致明顯質量退化,DMSampler 保持高質量。
GenEval 綜合評測:從 0.63 提升到 0.96
在 GenEval 基準測試上,DMSampler 取得 Overall 0.96,超過 FlowGRPO 和 DiffusionNFT 的 0.95;相比 Base(SD3.5-M)的 0.63,提升更為明顯。作為參照,GPT-4o 為 0.84,Qwen-Image 為 0.91。訓練效率方面,論文報告 DMSampler 需要 360 GPU hours,低于 FlowGRPO 的 2000 GPU hours 和 DiffusionNFT 的 480 GPU hours。
表 2:GenEval 基準測試結果。
1.3B 模型超過 14B,訓練時間降至約三分之一
在 VBench 視頻評測上,DMSampler 將 Wan2.1-1.3B 的總分從 81.23 提升到 85.00,超過 Wan2.1-14B(83.69)及 CausVid(83.88)、HunyuanVideo(83.43)。相比 DiffusionNFT,DMSampler 將訓練時間從約 900 小時降至約 288 小時,總分從 84.74 提升至 85.00。
表 3:VBench 基準測試結果(完整 16 個評測維度,分兩組展示)。
續表 3:其余 8 個評測維度
圖 5:VBench 生成視頻效果對比。
不綁定優化器,可作為通用采樣模塊
DMSampler 不依賴某一個 RL 優化器。研究者將其分別接入 FlowGRPO 和 DGPO,并在 GenEval 上驗證:FlowGRPO 的訓練成本從超過 1000 GPU hours 降到 400 GPU hours,GenEval 分數從 0.95 提升到 0.96;DGPO 的訓練成本從 240 GPU hours 降到 192 GPU hours,GenEval 分數保持 0.97。
表 4:DMSampler 接入不同 RL 優化器的效果。
這表明,DMSampler 更像是一個面向在線 Diffusion RL 的采樣加速模塊。它不改變優化器本身的目標函數,而是降低 rollout 成本,因此可以與不同 RL 方法組合使用。
副產品:蒸餾模型同步增強
DMSampler 的主要目標是訓練更強的 policy model,但共同演化的蒸餾采樣器本身也獲得了性能提升。在 VBench 上,該蒸餾模型取得 84.21 的總分和 85.60 的 Quality 分數,超過 CausVid(82.88)、Self Forcing(83.80)和 BLADE(83.38)等蒸餾方法。
表 5:DMSampler 蒸餾模型與其他蒸餾方法的對比。
傳統蒸餾側重推理加速,而 DMSampler 的蒸餾采樣器會在訓練過程中不斷吸收 RL 優化后的高 reward 能力。因此,它不僅是加速器,也成為經過 reward 對齊的少步生成器。
圖 6:DMSampler 蒸餾模型的生成示例。
從訓練加速到協同進化
整體來看,DMSampler 首次將可訓練、共同演化的蒸餾模型作為 Diffusion RL 的采樣引擎。通過雙階段交替訓練、混合蒸餾采樣和獎勵感知蒸餾,將 rollout 采樣成本降到更適合在線訓練的范圍。
其意義不僅在于加速,更在于重新審視了采樣成本這一瓶頸,并將蒸餾從后處理前移,使之與 RL 后訓練在同一閉環中相互增益。實驗中,DMSampler 在 GenEval 上取得 0.96,在 VBench 上取得 85.00,均達到當前最優水平。訓練效率上,GenEval 任務從 DiffusionNFT 的 480 GPU hours 降到 360 GPU hours,VBench 任務從約 900 小時降到約 288 小時。它不綁定特定 RL 優化器,也可以與 FlowGRPO、DGPO 等方法組合使用。
對后續研究來說,DMSampler 的協同進化思路可以遷移到其他需要大量 rollout 的生成模型 RL 場景,也為擴散模型蒸餾與強化學習的結合提供了新的技術參考。
您可能也感興趣:
為您推薦
中國紅APP正式上線發布
第十二屆東亞地方政府會議將在山東臨沂召開 促進東亞地區交流合作
(鄉村行·看振興)山西柳林依托“數商興農”打造鄉村e鎮 電商交易9個月達3.5億元
排行
最近更新
- ICML 2026 | 我們讓蒸餾模型當了采樣器,Diffusion RL采...
- 熱訊:德天空:哲科今天接受沙爾克體檢,隨后將簽下一份1年合同
- “發現好多大學生不懂郵件禮儀”上熱搜!網友:強烈建議納入...
- 生意社LLDPE8月2日均線下穿 均差為-33.83元/噸|焦點訊息
- 理想汽車(02015.HK)7月交付新車3.05萬輛 實時焦點
- 萊萬:美職聯對我而言是另一個世界,我的身體狀態會越來越好
- 大連北看臺發布預告:英博vs鐵人賽前會有全場拼圖TIFO 當前熱議
- 比亞迪(002594):2026年7月產銷快報
- 老詹打完現有合同就能捧杯?麥迪一番表態,撕裂湖人球迷兩大...
- 速訊:貸款“明白紙”,讓借款人不再“霧里看花”(政策解讀)
- 焦點簡訊:皇馬2-2佛羅倫薩,球隊展現“兩面性”,恩德里克破...
- 焦點要聞:“桂BA”北部賽區第五輪激戰來賓 梧州市隊客場取勝
- 圖片新聞|瑤歌繞山鄉!富川“桂鄉新風·富川有約”賽歌會熱...
- 華海藥業(600521.SH):產品擬中選第十二批全國藥品集中采購
- 每日動態!格靈深瞳(688207.SH):已累計回購1.17%公司股份
- 國城礦業(000688.SZ):首次回購115.1萬股公司股份
- 新動態:王仕鵬回應將重返老東家宏遠,那句"我必須挺身而出"...
- 咋了!中山大學、廈門大學多輪征集志愿,無人填報
- 8月3日,中原科技學院2026年藝術高職(專科)批征集志愿開始...
- 成本哪些規則資產配置要關注?|百事通
- “固收+”7月遇損,121只“績優生”僅剩零頭,困局要如何解?
- 第12批國家組織藥品集采開標 覆蓋常用藥救命藥_信息
- 國產機器人有觸覺了,機器人的電子皮膚來了 焦點熱文
- 【獨家焦點】托管怎樣估算資產配置更關鍵?
- 成交價格怎樣影響投資回報更穩妥?-當前聚焦
- 今日熱搜:風控紀律哪些細節交易決策需重視?
- 2026年暑期檔電影票房(含預售)已超71億元
- 焦點滾動:米體丨分析拉莫斯能否打破9號球衣魔咒
- 最新:時代變了,杜蘭特:當年勇士3巨頭被罵不公平,現在76人...
- 深圳退休金大起底!月入5000元在鵬城竟只算“中等偏上”?_每...
今日要聞
- ICML 2026 | 我們讓蒸餾模型當了采樣器,Diffusion RL采樣成本降低一個數量級 即時看
- 老詹打完現有合同就能捧杯?麥迪一番表態,撕裂湖人球迷兩大陣營 熱資訊
- 咋了!中山大學、廈門大學多輪征集志愿,無人填報
- 成交價格怎樣影響投資回報更穩妥?-當前聚焦
- 每日熱議!拜仁公布韓國行大名單:迪亞斯在列,凱恩、奧利塞無緣
- 【高校歆球漫游】如何識別有前途的科技企業,并把錢投給他們? AI識別已在路上 每日快播
- 華潤新能源上市后發展交流暨合作答謝會在港成功舉辦攜手中國政企合作基金開啟高質量發展新篇章
- 近580股7月獲調研 電子、機械板塊高占比 這些權重股獲機構關注_天天快報
- 每日速看!“ChinaCool”圈粉世界 海外游客解鎖避暑新方式
- 強悍泥人兒童障礙挑戰賽落地秦皇島北戴河新區


