跳到主要内容
返回时间线
arXiv来源发表:

PEARL用推理-反思循环从用户历史生成个性化图像,在自建PMH-IG基准上平均提升15%

核心概要

该工作提出首个基于真实用户历史(亚马逊评论与Instagram帖子)的个性化图像生成统一基准PMH-IG,包含个性化场景生成与个性化创意生成两项任务及多轴评测协议,并提出PEARL框架,将多模态推理器与冻结图像生成器耦合为交错的推理-反思循环,用差分数据奖励优化,在两项任务上于个性化指标上平均提升15%。

AI-generated editorial illustration: Personalized Image Generation with Reasoning and Reflection

深度剖析

论文提出PMH-IG,一个从真实用户历史出发的个性化图像生成基准,包含个性化场景生成(基于亚马逊评论历史,把给定商品放入反映用户生活方式与偏好的场景)与个性化创意生成(基于Instagram帖子历史,就指定主题生成符合用户审美与视觉身份的新图)两项互补任务。 既有基准(如Xu等、Dunlop等)通常为每位用户提供少量精选参考图,并在新提示下评测概念复现;PMH-IG改用自然产生的多模态历史,评测模型能否推断用户身份并据此合成新图,且把生成条件(要画什么)与用户历史(怎么画)明确区分开。 论文给出数据集统计:场景生成任务共5,000名用户、50,000条评论,创意生成任务共4,413名用户、50,656条帖子、1,271对(用户,目标);用户按约80:10:10做用户级不重叠划分,测试集为未见过的用户。

论文提出PEARL框架:Stage-1规划器对用户历史推理,产出思维链与场景描述,由冻结渲染器生成初图;Stage-2反思器把初图与历史对照,识别场景不协调、生活方式线索缺失、审美偏离等个性化错配,修订计划后重新渲染。 既有历史个性化方法(如Pigeon、PMG)把历史作为统一条件信号直接融合进生成器,缺少对历史含义的显式推理;PEARL把推理外显为文本计划,并让计划在渲染证据上被检验和修正。 规划器与反思器均以Qwen2.5-VL-7B初始化,渲染器为SDXL-1.0(1024×1024),用LoRA微调;Stage-1用Gemini2.5-Flash教师模型在可访问身份锚点的条件下蒸馏银轨迹,Stage-2用交替策略DPO,每个策略由包含另一策略与渲染器的完整下游管线打分,全部实验在单张4090 GPU上运行。

在PMH-IG两项任务上,PEARL在个性化指标上平均提升15%,并在多数指标上优于PMG、Pigeon、LaVIT、LLaVA等基线。 论文强调多轴评测的价值:在创意生成任务中,赢得LPIPS或MS-SSIM的方法在检索指标上表现不佳,说明单一保真度指标可以在不提供个性化的情况下被赢得。 场景生成任务中PEARL的H@5为0.2297、MRR为0.1639,均高于基线;创意生成任务中PEARL在10列中7列最优,包括全部检索与MLLM评审指标,CIS为0.645、DIS为0.289,类间R@1为0.876、类内R@1为0.701;所有基线共用同一SDXL渲染器以作公平比较。

消融显示反思模块带来可测量的增益,且增益集中在细粒度个性化细节上。 论文把完整PEARL与仅用监督微调、去掉交替策略DPO的PEARL-Reflection对比,说明闭环的推理-渲染偏好优化优于单纯监督蒸馏。 论文报告PEARL在两项任务与MLLM评审的五个聚合维度中的四个上优于PEARL-Reflection,最大提升出现在风格与内容维度;整体分数有低于某阈值的边际下降,作者据此认为反思主要对齐细粒度细节而非做大幅调整,并指出这与IRG的观察一致。

启示与展望

该结果面向从用户累积历史推断身份并生成图像的研究与工程场景,适用于电商商品呈现与社交媒体内容创作两类设定,也可迁移到论文附录列出的个性化广告、虚拟试穿与生活方式布景、创作者工具、个性化故事板、生成式推荐以及个性化多模态智能体评测。基准与评测协议本身可独立使用:身份元素抽取管线可作为用户身份建模的诊断工具,基于检索的指标可支撑生成式推荐研究,多轴评测套件可作为个性化多模态智能体的标准化测试台。对实践者而言,论文建议在部署前用检索与推荐指标作为可复现的离线代理,来评估个性化商品图像的生成模型。

场景生成任务没有自然存在的(用户,商品)真值场景图,用户对齐只能通过检索式与评审式指标间接衡量,而非直接与参考图比较。PEARL的训练只做了一轮规划器与反思器之间的交替策略DPO更新,论文把多轮优化的系统研究留作未来工作。人工评测为单标注者、每任务25对比较的初步判断,衡量的是外部观察者对历史契合度的评估,论文明确说明它不建立标注者间一致性、总体偏好或统计显著性;创意生成比较中两种方法使用了各自的历史子集,并未在完全相同的条件下隔离方法效应。此外,一个场景账号在后续重渲染中被标记存在目标评论泄漏,其原始SDXL生成输入无法核验,原始输出是否受污染尚未解决,论文以剔除该账号的敏感性分析作为参考。读者若只读到摘要层面,将无法看到这些范围与开放问题。

来源