HKUST团队提出DGPO:解决扩散模型强化学习瓶颈,实现30倍训练提速!
在文本-图像生成领域,Stable Diffusion等扩散模型早已能产出高质量图像,但要让模型精准贴合人类偏好——比如严格遵循“红裙子女孩在绿猫右侧”的指令、生成清晰无模糊的文字标牌——却一直面临强化学习(RL)微调的瓶颈。此前主流的Group Relative Preference Optimization(GRPO)方法,虽在大语言模型中表现亮眼,却在扩散模型上“水土不服”,要么训练效率低下,要么牺牲图像质量。由HKUST等团队联合提出的Direct Group Preference Optimization(DGPO),不仅打破了这一困境,还实现了近30倍的训练提速,同时在关键指标上反超现有SOTA方案。

目前GRPO这类基于策略梯度的算法,需要模型具备“随机策略”——即输出结果需带有概率波动以支持探索。但扩散模型的优势恰恰在于确定性ODE采样:这种方式像“直达车”,能在控制计算成本的同时保证样本质量,是当前主流的高效采样方案。为了适配GRPO的需求,此前研究不得不改用SDE采样——类似“绕远路的慢车”,不仅生成的样本画质下降,每轮训练还需遍历完整采样轨迹,导致GPU消耗剧增,动辄需要上千小时才能完成训练。
DGPO的创新之处,在于跳出了“为适配算法而改造模型”的思维定式。研究团队发现,GRPO真正有价值的并非复杂的政策梯度框架,而是其“利用组内样本相对偏好信息”的核心逻辑。DGPO彻底舍弃了策略梯度流程,转而直接从“样本组的好坏差异”中学习。首先用ODE采样快速生成一组(如24张)样本,避免SDE的低效与画质损失;接着通过奖励模型对样本打分,将其划分为“好样本组”(符合指令、画质清晰)与“坏样本组”(指令偏离、细节模糊);最后设计“优势权重”——让好样本中得分更高的权重更大、坏样本中得分更低的权重更大——直接优化“好组优于坏组”的目标,同时巧妙避开了此前困扰算法的“分区函数”计算难题。
以SD3.5-M为基线模型,在衡量文本-图像对齐能力的GenEval基准测试中,DGPO将模型得分从基线的63%提升至97%,不仅超过Flow-GRPO(当前SOTA)的95%,训练速度更是快了近30倍——此前需要上千GPU小时的训练任务,如今只需几十小时就能完成,大幅降低了算力成本。在细分任务中,无论是“物体计数”(精准生成5只猫而非4只)、“空间位置识别”(确保三明治在熊的左侧),还是“属性绑定”(红狗头上的蓝色汉堡不串色),DGPO都表现出远超基线与Flow-GRPO的稳定性。在Aesthetic(美学评分)、DeQA(画质退化评估)等离线指标上,DGPO的表现甚至略优于基线模型,场景还原度也更高。
AI大模型从0到精通全套学习大礼包
我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。
只要你是真心想学AI大模型,我这份资料就可以无偿共享给你学习。大模型行业确实也需要更多的有志之士加入进来,我也真心希望帮助大家学好这门技术,如果日后有什么学习上的问题,欢迎找我交流,有技术上面的问题,我是很愿意去帮助大家的!
如果你也想通过学大模型技术去帮助就业和转行,可以扫描下方链接👇👇
大模型重磅福利:入门进阶全套104G学习资源包免费分享!

01.从入门到精通的全套视频教程
包含提示词工程、RAG、Agent等技术点

02.AI大模型学习路线图(还有视频解说)
全过程AI大模型学习路线


03.学习电子书籍和技术文档
市面上的大模型书籍确实太多了,这些是我精选出来的


04.大模型面试题目详解


05.这些资料真的有用吗?
这份资料由我和鲁为民博士共同整理,鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位,在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利,同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。
所有的视频由智泊AI老师录制,且资料与智泊AI共享,相互补充。这份学习大礼包应该算是现在最全面的大模型学习资料了。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。


智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念,通过动态追踪大模型开发、数据标注伦理等前沿技术趋势,构建起"前沿课程+智能实训+精准就业"的高效培养体系。
课堂上不光教理论,还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!

如果说你是以下人群中的其中一类,都可以来智泊AI学习人工智能,找到高薪工作,一次小小的“投资”换来的是终身受益!
应届毕业生:无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
零基础转型:非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
业务赋能 突破瓶颈:传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。
👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

更多推荐



所有评论(0)