Design Creativity Bench:15个前沿模型生成的UI设计在原创性上比人类低0.12、在跨简报变化上低0.27,尽管其需求满足率超过90%
核心概要
该工作提出 Design Creativity Bench,用80个任务、每个任务两条同目标不同产品域的开放式UI简报,对15个前沿模型各生成160份HTML设计,并以嵌入相似度衡量原创性(模型间0.592,人类-模型0.764)与创意跨度(模型0.581,人类0.902),同时用逐条验收标准衡量适当性(各模型均超90%,最高99.2%,人类98.0%)。
Figure 1: Diversity in LLM UI generation compared with human designs. The examples are drawn from the benchmark 𝒟 B \mathcal{D}_{B} . The model-generated designs are markedly more similar across domain and content variants than the corresponding human reference designs. Each row pairs two prompts that share the goal shown (paraphrased) and differ in product domain and content; similarity is the pair score, from 0 to 1, where higher means more alike. We ask models to generate desktop designs for a 1280 × 720 1280\times 720 target viewport.
arXiv深度剖析
该基准把UI设计创造力拆成三个可分别测量的量:原创性(同一提示下不同模型设计之间的平均差异度)、创意跨度(同一模型在同一目标、不同产品域的两条简报之间的设计差异度)和适当性(设计满足简报验收标准的百分比),并给出一个综合分。 此前关于LLM输出同质性的证据主要来自文本与代码生成任务,该工作把这一测量扩展到UI设计,并同时覆盖跨模型重复与跨相关简报重复两个方向。 15个模型各生成160份设计,共2,400份主模型设计,覆盖80个任务、每个模型80个差异化简报对;原创性基于15,840个模型-模型对,人类参照基于2,400个人类-模型对;置信区间用20,000次按整任务重抽样的自助法(seed 7)得到。
模型生成的设计彼此之间比它们与人类参照之间更相似:原创性为0.592(95% CI [0.582, 0.602]),而人类-模型对为0.764(95% CI [0.751, 0.778]);最原创的GPT-6 Astra为0.646,最低的Kimi K3为0.547,没有任何模型的置信区间触及人类值。 该结果把“输出同质性”从文本、代码任务延伸到UI设计,并给出模型群体内部相似度的量化基线。 同一提示下跨模型配对,排除同实验室模型;人类参照由多位人类设计师在相同简报下、参考公开灵感库(如Behance、Kombai Gallery)完成。
改变提示并不能改变设计:同一模型在同一目标、不同产品域的两条简报之间,设计差异度平均仅0.581(95% CI [0.567, 0.597]),而人类为0.902(95% CI [0.884, 0.919]);同一模型设计两个不相关任务时差异度为0.811,说明两条简报之间的变化本应足以引发差异。 该工作把“跨简报变化”作为独立于跨模型差异的第二个多样性维度,并显示两者排序基本无关(Spearman相关;探索性95%模型自助区间,20,000次重抽样,seed 7)。 每个模型80个两提示配对;模型间跨度从GLM-5.3的0.634到GPT-6 Astra的0.472,但没有任何模型区间达到人类值;最不具区分度的原型是settings(0.554),最高是listing(0.590)。
适当性普遍很高:每个模型满足其简报90%以上的标准,且满足96%以上的关键标准;Claude Opus 5.5最高为99.2%,GPT-6 Astra为99.1%,均略高于人类参照的98.0%。最常见的适当性失败是缺少简报所述工作流的控件(33%)以及示例数据的计数与合计不匹配(26%)。 该结果说明高适当性与高多样性并不冲突:人类基线在98.0%适当性的同时达到0.902的创意跨度,因此多样性差距不是由满足需求所迫。 每条简报配有是/否验收标准,其中关键标准标记为失败即设计未完成简报要求;综合分对适当性与多样性等权,多样性按原创性0.9、创意跨度0.1加权(附录B8给出权重来源与敏感性:创意跨度权重取0或0.15时排序相关至少0.99)。
启示与展望
该基准面向UI设计这一具体任务,适用于在相同生成设置下比较模型输出与人类参照;其测量对象是“可接受设计之间的差异”,而非设计质量或用户偏好。它可用于评估旨在提升多样性同时保持简报满足度的方法,也可用于把新模型放到已冻结的15模型面板标尺上(附录B9给出18个后续模型的放置规则)。人类参照由多位设计师参考公开灵感库完成,支持模型-人类以及人类跨配对简报的比较。
解码参数未受控:托管API以默认温度与采样调用,因此结果刻画的是默认输出而非采样策略的效果。同一上下文内的重复未被测量,每次设计都在全新上下文中生成。未尝试任何以多样性为目标的提示技术。人类参照不测量同一设计师的重复,也不测量不同设计师对同一提示的差异。综合分中创意跨度的权重0.1来自对模型使用份额的代理估计(OpenRouter前二十模型token排名,2026年9月30日检索),该代理会高估真实份额。附录A1对单一提示的选项枚举使用“LLM判断的常规程度”作为权重,作者明确说明这些权重是假设而非从真实设计师选择中估计。此外,正文中若干公式与部分数值在提供的文本中以占位形式出现,若需复现具体校准常数应查阅原文附录。
