提出Stepwise-Flow-GRPO方法,通过Tweedie公式估计每步去噪的中间图像奖励,并基于步间奖励增益(g_t = r_{t-1} - r_t)进行细粒度信用分配,从而改进Flow-GRPO中忽略时间结构的均匀信用分配问题;同时引入DDIM启发的SDE以生成更高质量样本,提升样本效率与收敛速度。
机构:CMU
来源:arXiv 2603.28718 | AI4Papers 论文推荐平台
AI4Papers 是一个以每日 arXiv 论文发现为入口的 AI 科研工作流平台,帮助研究者用最短时间掌握最新 AI/ML 前沿动态。
核心功能完全免费。高级 AI 功能(对比分析、深度研究、灵感工作台)支持自带兼容 API Key(如 OpenAI、通义千问)无限使用。
免费注册 | 使用教程