不改一行SAS源码,用元数据层把558个宏的临床报表库变成LLM可读JSON,14份真实报表中11份达到80%以上单元格一致
核心概要
该研究提出一种非破坏性元数据层框架(桥接映射、带类型的中间表示IR、编排器),在不修改已验证SAS源码的前提下把遗留临床报表库的输出重新暴露为机器可读JSON,并在一个558组件、372,698行的工业SAS宏库上验证:共存模式下即刻获得AI就绪输出,可选整合使专有代码减少92%,内部III期研究PROT008-SR1的14类报表中11类达到80%以上单元格级一致(均值82.7%,最高99.2%),公开CDISC CDISCPilot01基准5类报表4,764个单元格实现100%一致,LLM实验进一步完成表格摘要、不良事件异常检测与试验配置生成。
a coverage matrix. Figure 1 presents the taxonomy breakdown for the case-study library. The methodology requires no proprietary tools and is applicable to any pharmaceutical SAS macro library.
· 第 7 页深度剖析
框架把AI就绪与源码级改造解耦:桥接映射(365条,1:1覆盖全部可调用组件)加带类型IR加Python编排器包裹遗留库,遗留SAS文件只被读取、从不被写入,输出即被转为结构化JSON供LLM、R、Python消费。 既有方案默认AI就绪必须改动遗留源码,因而触发再验证成本;本文把部署面从SAS源码移到元数据,使AI集成成为Day-0能力而非多年重写后的终点。 在558组件、400个SAS源文件、372,698行的工业库上实施;共存模式下组件数不变即产出机器可读输出,整合为可选增量升级。
带类型IR是核心架构创新:ir_cells按单元格记录原始数值cell_value、格式化字符串cell_formatted与受控词表的cell_type(INTEGER、DECIMAL、PVALUE、PERCENTAGE、TEXT、HEADER、LABEL、FOOTNOTE、EMPTY),ir_structure定义行列维度,cl_ir_reconcile以默认1×10⁻¹⁰容差回溯校验数值完整性。 此前遗留库在统计计算与渲染输出之间不存在机器可读中间层,RTF只编码视觉格式;IR把语义分类与数值从排版中分离,使单元格级QC、格式无关渲染与源计算对账成为可能。 IR由计算到渲染的每次交接自然产生;同一IR驱动RTF、PDF、HTML、JSON四种渲染引擎,渲染层不含统计逻辑。
在内部III期研究PROT008-SR1的14类报表上,11类达到80%以上单元格级一致(均值82.7%,中位数89.6%,最高99.2%),未达标的3类源于遗留系统用PROC TRANSPOSE把治疗组转置为行造成的布局几何差异,而非计算错误。 论文给出可复用的12类分歧分类法与七道门(Gate A–G)验证流程,72处修复全部落在框架层,形成“改一次、全库生效”的杠杆,使一致率从初期8/14提升到11/14。 14类报表覆盖不良事件、基线特征、处置、依从性、ECG、实验室、风险管理和列表;19/365条桥接条目做了端到端验证,其余346条通过Gate A–D单元级结构检查。
公开基准CDISC CDISCPilot01上5类报表实现100%单元格级一致(4,764个单元格,0处不匹配),且LLM(Claude Opus 4.6)在IR上完成三项任务:74个单元格的表格摘要全部数值正确、不良事件异常检测命中5/5预期临床模式且零误报、从自然语言SAP片段生成映射全部5项需求的合法YAML配置。 这些AI能力是架构分离的涌现属性,无需额外实现;两个表格输入的IR由遗留SAS宏在共存模式下原样运行产生,说明AI就绪在采纳第0天即可获得。 公开数据集可外部复现,真值经已发表CDISCPilot01汇总统计核对(如安慰剂组年龄均值75.2对应已发表75.21,N=86/84/84与已发表入组一致);AI实验为单模型概念验证,未做IR与RTF的受控精度对比。
启示与展望
该框架面向拥有大型已验证SAS宏库、希望在不放弃既有计算投资的前提下获得AI可读输出的制药组织,适用于监管提交场景下的TFL生成与药物警戒分析。共存模式(只包裹、不改源码)是设计上最可能直接迁移的部分,因为它只依赖存在定义良好的宏入口,而不依赖库的内部结构;整合模式则是可选增量路径,减少幅度与组织选择整合的比例成正比。IR与JSON导出在两种模式下相同,因此AI工作流可在采纳第0天启动。作者同时把该框架定位为通向CDISC ARS的务实过渡:IR的report_id、execution_id、cell_type与ir_structure已与ARS的结果展示标识、结果值类型、行列规范在结构层面对应,ARS对齐可在IR层增量引入而不扰动遗留计算层。
一致性证据来自两条互补轨道,作者明确说明二者合起来应被读作机制证据而非普适正确性证明:真实数据轨道11/14达80%以上,公开轨道5/5达100%,但都未穷尽监管提交中的边界情形(缺失数据模式、方案偏离、复杂访视结构、组织特有派生规则)。365条桥接条目中仅19条做了端到端验证,其余为单元级结构检查。AI演示使用单一LLM,未做IR与RTF的受控精度对比,也未做对抗输入测试,作者把多模型基准与正式IR对RTF精度研究列为未来工作。框架尚未经过正式IQ/OQ/PQ确认,遗留库留在既有验证范围内、只有框架层需要确认。软件指标(LOC、参数数、嵌套深度、耦合、内聚)是间接质量度量,未收集缺陷率、平均解决时间与程序员生产率等直接指标。此外,工业案例的现代化框架源码因组织政策未公开,公开的是IR模式、5类公开基准报表的YAML规范与一致性验证工具。
