arXiv 该工作提出 Form and Void Agent(FaV-A),一个面向正负空间(positive-negative space)构图的分阶段多模态智能体:先生成基础物体,再分析其形状与空间结构以识别候选负空间语义,最后生成构图指令用于最终图像生成;实验与消融分析表明,相比直接零样本 MLLM 基线,FaV-A 能生成视觉更连贯、语义更对齐的正负空间构图。
该工作提出 Form and Void Agent(FaV-A),一个面向正负空间(positive-negative space)构图的分阶段多模态智能体:先生成基础物体,再分析其形状与空间结构以识别候选负空间语义,最后生成构图指令用于最终图像生成;实验与消融分析表明,相比直接零样本 MLLM 基线,FaV-A 能生成视觉更连贯、语义更对齐的正负空间构图。
该工作提出 Form and Void Agent(FaV-A),一个面向正负空间(positive-negative space)构图的分阶段多模态智能体:先生成基础物体,再分析其形状与空间结构以识别候选负空间语义,最后生成构图指令用于最终图像生成;实验与消融分析表明,相比直接零样本 MLLM 基线,FaV-A 能生成视觉更连贯、语义更对齐的正负空间构图。
该工作提出 Form and Void Agent(FaV-A),一个面向正负空间(positive-negative space)构图的分阶段多模态智能体:先生成基础物体,再分析其形状与空间结构以识别候选负空间语义,最后生成构图指令用于最终图像生成;实验与消融分析表明,相比直接零样本 MLLM 基线,FaV-A 能生成视觉更连贯、语义更对齐的正负空间构图。