生成式AI视频模型如何描绘抑郁:对OpenAI Sora 2的混合方法研究
核心概要
该研究用单词提示“Depression”在Sora 2的消费端应用与开发者API各生成50个视频(共100个),由两名受训编码者独立编码叙事结构、视觉环境、物体、人物人口学与人物状态,并提取视觉美学、音频、语义内容与时间动态等计算特征进行比较,发现应用端视频呈现明显的“康复偏向”(78%即39/50呈现从抑郁状态走向缓解的叙事弧,API端为14%即7/50),应用端视频随时间变亮(平均斜率2.90,SD 2.43每秒,对比API的-0.18,SD 1.24每秒;Cohen d=1.59;q<.001)且运动量约为API的3倍(Cohen d=2.07;q<.001),而两种接入方式共同收敛于狭窄的视觉语
Generalized system architecture for generative AI video platforms, illustrating the distinction between the developer API and consumer app access pathways. Both pathways share core safety infrastructure (center), including input and output moderation. Consumer apps additionally route prompts through an app layer (prompt processing, user experience [UX] constraints, default clip parameters, and policy-aware transformations) before generation and through a product surface layer (feed curation, distribution controls, feature thresholds, watermarking, and distribution controls) after generation. The developer API bypasses these layers, accessing only the shared safety infrastructure and base model. CSAM: child sexual abuse material.
PubMed深度剖析
研究刻画了Sora 2对“抑郁”这一敏感概念所生成的视觉叙事,发现其并未发明新的视觉语法,而是压缩并重组既有文化图像志。 此前对生成式视频模型如何表征抑郁等心理健康状况所知甚少,该研究以100个视频的编码与计算特征分析填补了这一空白。 两名受训编码者独立编码,并以Cohen κ评估评分者间信度,信度不足的维度被排除在分析之外;计算特征比较采用双尾Welch t检验并经Benjamini-Hochberg错误发现率校正。
同一模型的不同接入点产生显著不同的叙事:消费端应用呈现明显的康复偏向,而开发者API很少如此。 该研究将平台层面的中介(产品层差异)识别为塑造用户所见叙事的重要变量,而不仅是模型本身。 应用端78%(39/50)对API端14%(7/50)的叙事弧差异,并在亮度变化斜率(Cohen d=1.59;q<.001)与运动量(Cohen d=2.07;q<.001)等多个通道上得到一致印证。
两种接入方式的视频共同收敛于一套狭窄的视觉语汇与人物设定。 研究以具体计数呈现了抑郁表征的刻板化程度,包括坐姿(94/100)、向下凝视(93/100)、连帽衫(n=194)、窗户(n=148)、雨(n=83),以及年轻(88%为20-30岁)且独处(98%)的人物。 基于100个视频的系统编码与物体计数,样本覆盖两种接入点各50个视频。
抑郁与康复阶段在语言与视觉上呈现可测量的反转模式。 研究将叙事阶段与可量化的语言、亮度、凝视方向变化对应起来,而不仅是定性描述。 抑郁阶段转录语言强调“heavy”“drowning”“room”,康复阶段亮度增加26.6%(Cohen d=0.68;P<.001)、67%(30/45)的康复视频凝视上移并出现“light”“breath”等词。
启示与展望
该研究界定了Sora 2在单一提示词“Depression”下、通过消费端应用与开发者API两个接入点所生成的抑郁视觉叙事,适用于关注AI生成心理健康内容如何触达用户的临床医生、平台设计者与研究者;其结论针对该模型与这两个接入点,而非所有生成式视频系统。
读者仍可关注:单一提示词“Depression”是否足以代表更广泛的抑郁相关表达;编码维度中信度不足而被排除的部分具体涉及哪些内容;以及在其他生成式视频模型或其他接入点上是否会出现类似的康复偏向与视觉语汇收敛。
