跳到主要内容
返回时间线
arXiv来源发表:

面向密集健康叙事的结构化主张级话语表示

核心概要

该工作提出以(原子主张、主题方面、立场、六维语用属性)元组刻画密集健康叙事,构建覆盖GLP-1减重药、睾酮替代疗法、胶原蛋白补充与间歇性禁食四个领域、来自60个视频的1191条人工标注主张的基准,并系统评测大语言模型在不同话语上下文设置下的结构化话语预测表现。

Source-provided article image: Structured Claim-Level Discourse Representations for Dense Health Narratives
Figure 1 ·

Figure 1: An illustration of our formal task: decomposing high-density narratives into structured tuples. This segment demonstrates multi-aspect entanglement and shifting rhetorical profiles, moving from prescriptive medical policy (Row 2) to hedged physiological outcomes (Rows 3–4) and attributed personal narrative (Row 6).

arXiv · 第 2 页

深度剖析

提出主张级结构化话语表示,将每条原子主张与主题方面、立场以及六维语用话语画像(逻辑关系、可验证性与意图、证据基础、确定性、时间性、主张焦点)联合建模。 既有方法多依赖粗粒度主题、情感或立场标签,本文把话语拆解为可分析的元组,并指出同一主题与立场下两条主张可在全部六个语用维度上分化。 以TRT领域两条共享“Fertility & HPTA”方面与负面立场却在六轴上完全分化的主张作定性对照,并给出完整元组示例。

构建首个面向密集健康叙事结构化主张级话语分析的基准,覆盖四个健康领域,含1191条人工标注主张,平均密度为每分钟13.22条原子主张。 此前基准多在较受限的话语环境中孤立研究各维度,该基准在同一标注体系下同时覆盖主题、立场与多维语用结构。 60个视频、约90分钟话语、约400人时标注与协调;陈述抽取成对F1为0.93,原子分解一致率0.92,方面标注κ=0.83,立场κ=0.80,六轴κ=0.76。

评测显示大语言模型在主题分类与立场预测上表现较强,但在高维语用画像上明显下降,且不同话语任务受益于不同形式的上下文推理。 主题任务在批量窗口加定义与关键词、轻量思维链下达到79.23%方面准确率与91.55%立场准确率;语用任务在局部±2窗口配合启发式约束下达到86.44%平均准确率,而显式思维链反而降至73.12%。 以Gemini 2.5 Flash为主干,在六种上下文设置与多种提示策略下做消融,并在TRT数据上以温度0.0至0.8、每档三次共12次运行检验稳定性。

跨模型评测表明开放权重模型在方面与立场分类上具竞争力,但在高维语用画像上退化更明显。 在相同提示与上下文设置下比较Gemini 2.5 Flash、Llama 3.3、Qwen 3.5 35B与Gpt-oss 20B,Qwen 3.5 35B在方面与立场任务上持续接近专有模型表现。 四个模型在四个领域上以同一B2-CoT流程评测,报告准确率与Cohen's κ。

启示与展望

该框架面向英语、YouTube短视频、四个健康领域的单说话人叙事话语,以转录文本为分析单元;其表示被定位为可扩展而非固定模式,作者提出可能适用于金融建议、政治评论、科学辩论与法律话语等复杂叙事场景,但完整跨领域验证留待未来工作。对希望开展主张级话语分析、健康信息质量评估或标注体系设计的研究者,该基准与元组表示为在相同设置下复现与扩展提供了起点。

读者仍可关注:最佳语用画像结果依赖从标注协调中手工提炼的启发式约束,其向新领域或新标签体系的迁移性尚未检验;基准以转录文本为单元,未纳入视觉演示、屏幕文字与创作者情感等多模态信号;框架聚焦单说话人叙事,未显式建模轮次转换与跨说话人立场动态;此外,正文为快速解析版本,部分表格与附录细节以文本形式呈现,若需核对具体数值与提示模板,建议查阅原文图表。

来源