跳到主要内容
返回时间线
arXiv来源发表:

Iris-3B 从零预训练 3B 像素空间文生图模型,并在深度与复原任务上未发现像素先验优于潜空间先验

核心概要

作者从零预训练了 3B 参数的像素空间文生图 Transformer Iris-3B(256→512→1024 课程,采用 v-prediction 与 DINOv2 REPA),并把潜空间模型 FLUX.2 Klein base 4B 转换为像素空间;将两类像素骨干微调用于单目深度估计与图像复原后,未发现像素空间生成先验带来显著提升:深度上 Iris-3B 与潜空间 FLUX.2 Klein 持平、转换模型落后,DIV2K 复原上两个像素模型也未超过潜空间微调。

Source-provided article image: Iris-3B: Going Beyond the Latent with Pixel-Space Diffusion Training, Conversion and Fine-Tuning
Fig. 2 ·

Fig. 2: x x - versus v v -prediction at 256 2 256^{2} , absolute scores at matched steps (EMA, 25-step FlowDPM++, CFG 4.5). Following JiT [ 5 ] , the x x -prediction arm also uses its logit-normal timestep distribution ( 0.8 , 0.8 ) (0.8,0.8) instead of ( 0.0 , 1.0 ) (0.0,1.0) , so the contrast does not isolate the prediction target.

arXiv

深度剖析

Iris-3B 表明像素空间文生图预训练可以扩展到 3B 参数:在官方评测器下 GenEval 0.798、DPG 86.52、LongText 0.857、OneIG 0.540,OneIG 上与 Qwen-Image 相当,GenEval 上落后于 i1、Z-Image 与 Qwen-Image(后两者使用 prompt rewriting),英文长文本渲染是最明显的短板。 此前像素空间生成多在中小编模或转换模型上验证,这里给出一个从零训练、公开权重与训练代码的 3B 像素空间文生图模型,并配套 256px 消融选出的配方。 使用 GenEval、DPG-Bench、LongText-Bench、OneIG-Bench 的官方未修改评测器,1024 分辨率、CFG 3、100 步、每 prompt 4 样本且全部计分(无 best-of),报告的是 SFT 第 665K 步的发布检查点。

在 1.3B PixelDiT 复现上的 256px 消融显示:v-prediction 与 x-prediction 在 GenEval 各里程碑持平,x-prediction 在 DPG 与 FID 上更差;表示对齐中 REPA+DINOv2 综合最强,换 DINOv3 教师在各里程碑降低 GenEval 并恶化 FID,iREPA 仅在 150K/200K 的 FID 上占优且到 250K 几乎消失,Self-Flow 在四项指标上明显落后。 把预测目标与四种对齐目标(REPA、iREPA、DINOv3 教师、Self-Flow)放在同一数据子集、同一 batch 256 与同一评分协议下逐臂对照,为像素空间预训练配方选择提供受控比较。 每臂与自身对照在匹配步数下比较,统一使用 EMA 权重、25 步 FlowDPM++ 采样、CFG 4.5、GenEval、DPG-Bench、FID-10K 与 CLIP 分数;作者也指出 x-prediction 臂同时改用了 JiT 的 logit-normal 时间步分布,因此该对比并未单独隔离预测目标。

把像素空间生成先验用于密集预测并未带来预期收益:深度上 Iris-3B 与潜空间 FLUX.2 Klein 在 AbsRel 与 δ1 均值上持平(均值 AbsRel 0.071 对 0.072),转换的像素模型在除 KITTI 外每个基准上都落后;DIV2K 复原上转换像素模型在 SSIM、NIQE 等多数指标上更差,Iris-3B 在 MUSIQ 上为表中最优但在保真度与 DeQA 上略低。 这是对“像素空间因去掉有损 VAE 而应在细节任务上更强”这一假设的直接检验,覆盖从零训练与潜空间转换两条路线,并给出可复现的深度与复原配方。 深度用同一直接回归配方、同一预算在 NYUv2、KITTI、ETH3D、ScanNet、DIODE 上用 Marigold V2 未修改评测代码评分;复原用 HYPIR 单步配方在 DIV2K 上比较 PSNR、SSIM、LPIPS、NIQE、MUSIQ、DeQA。作者说明每臂为单次运行、预算较短且未做显著性检验,因此小差异应读作“无优势”。

像素空间模型在密集预测中留下可测量的 patch 网格:以 patch 边界处预测深度的平均曲率除以其余区域,潜空间模型约为 1(0.97–0.99),转换像素模型为 1.31–1.44,Iris-3B 最高达 1.61–2.25。 把肉眼难辨的网格伪影量化为一个直接指标,并将其归因于非重叠 patch 切分与逐 patch 解码,而潜空间 VAE 解码器具有重叠感受野。 在 Hypersim、KITTI、ETH3D、DIODE 四个基准上给出该比值;作者同时指出 PixelUMM 独立报告了同类网格,并发现卷积输出头可抑制该网格。

启示与展望

这项工作面向正在权衡像素空间骨干的研究者与工程师:它给出一个可下载的 3B 像素空间文生图模型及其训练代码,一套在 256px 上选出的预训练配方(v-prediction 加 DINOv2 REPA),以及可直接复用的深度直接回归配方与 HYPIR 单步复原配方。潜空间到像素空间的转换部分还给出两条具体工程手段——对新输入投影做 gain-matched ridge 初始化,以及按父模型权重 RMS 与参考模型之比缩放 trunk 学习率——作者报告二者合用可在 1K 步内把 patch 噪声变成写实且贴合 prompt 的图像,而单独使用任一项都不产生连贯图像。这些结果适用于约一百万像素预算的文生图、以及以生成模型为骨干的单目深度与图像复原设定。

作者自己指出下游对比存在混杂:Iris-3B 没有潜空间孪生,其与潜空间 FLUX.2 Klein 的深度对比混合了表示空间与模型规模、预训练数据和算力的差异;两个匹配对比共用同一个转换父模型,而该模型的生成先验可能弱于其来源的潜空间模型,因此比较的是短暂转换的模型与完整预训练的模型;每个深度与复原臂都是短预算单次运行且无显著性检验;Iris-3B 的复原臂与 FLUX.2 Klein 各臂并不匹配。转换模型的生成质量(GenEval、DPG、FID)未被测量,因此“转换而非像素空间导致落后”仍是假设。转换配方中的 ridge 初始化与学习率缩放只在 global batch 8、1K 步的探针中验证,是否在 Jiang 等人使用的 global batch 128 下仍有效未被测试。此外,本文为快速解析,公式与部分数值以占位形式呈现,若需精确复现具体超参与损失权重,应回到原文核对。

来源