跳到主要内容
返回时间线
Frontiers in Toxicology来源发表:

用ChatGPT推导ATBC口服PDE时,同一提示反复运行给出5至300 mg/天的不同结果,作者据此提出分模块、人工监督的LLM毒理风险评估工作流

核心概要

该工作由合作工作组完成,先综述大语言模型(LLM)在毒理风险评估(TRA)中的原理、优势与局限,再以乙酰柠檬酸三丁酯(ATBC,CAS 77-90-7)在ICH Q3E草案框架下的口服每日允许暴露量(PDE)推导为示例案例,用ChatGPT(GPT-5及后续GPT-5.2)测试零样本端到端提示、结构化分步提示和文档约束配置,观察到模型可支持文献筛选、信息提取与证据摘要,但关键起点(PoD)常在100与300 mg/kg bw/day之间摆动、口服PDE在约5、20、100、300 mg/day(文档约束下约14、25、100 mg/day)之间变化,并出现覆盖不全、推理偏浅和个别引用不实,据此提出将数据检

Source-provided article image: A pragmatic workflow for integrating large language models into toxicological risk assessment
FIGURE 1

FIGURE 1 From case-study observations to a proposed LLM-powered workflow for TRA. The study foundations comprise a background analysis of LLMs in the context of TRA, the regulatory context, and the perspectives of the working group. An exemplar case study on the derivation of a Permitted Daily Exposure (PDE) for acetyl tributyl citrate was then conducted. Exploratory LLM investigations generated observations on the use of LLMs for core TRA tasks, including evidence retrieval, summarization, and reasoning. These observations were interpreted in the context of the available literature to identify both strengths and limitations of LLM-assisted approaches and to inform potential mitigation strategies. Together, the study foundations, case-study observations, and their interpretation informed the workflow hypothesis that LLMs may be most appropriately integrated into TRA as components of structured, modular, human-supervised workflows that support, rather than replace, expert judgment. Exploratory investigations were conducted primarily using ChatGPT, with selected Claude and Gemini runs reported in the Supplementary Material.

· 第 3 页

深度剖析

作者提出并论证了一个把LLM嵌入TRA的四模块、人在环工作流假设:数据检索、信息提取、整合分析与摘要、专家解释,每个模块都是专家审核的检查点,最终PoD选择与修饰因子应用仍由毒理学家负责。 相对于把LLM当作端到端问答工具或单纯提取工具的既有做法,该工作把案例观察转化为一个与ICH Q3E草案和监管透明度、可追溯性要求对齐的流程结构,并明确把数据检索与提取、摘要拆成不同阶段。 依据是对ATBC口服PDE推导的示例性案例研究(GPT-5/GPT-5.2,经ChatGPT访问,含Auto与Deep Research模式,多次独立运行、不同用户与无痕会话),并对照现有文献;作者明确说明这不是统计基准测试、定量性能比较或正式验证。

案例显示LLM在TRA中的可用价值集中在模式识别、定向检索和快速摘要:可加速全文PDF信息提取、生成结构化表格(研究标识、暴露途径与时长、物种与性别、终点、NOAEL/LOAEL及直接引用),并帮助发现可能被人工遗漏的研究。 该工作把已有关于LLM提取与证据综合的讨论延伸到“提取出的证据如何被组合并用于推导化合物特异限值”这一环节,并给出可审核的表格化中间产物。 来自案例中模块化提示的观察性结果,作者同时指出与人工提取者的严格比较仍然有限。

端到端提示下输出不稳定:同一提示重复运行会改变所引证据、PoD选择与修饰因子,导致口服PDE在约5、20、100、300 mg/day之间变化;即使把模型限制在已上传文档内,仍出现100或300 mg/kg bw/day的PoD差异和约14、25、100 mg/day的PDE差异。 该工作把这种变异同时归因于模型随机性与TRA本身依赖专家判断的非唯一性,并指出仅靠文档约束(grounding)不足以消除分歧,因为同一证据基础可支持多个结论。 多次独立运行(含不同用户与无痕会话)的定性观察,作者未做跨提示配置、模型或部署模式的系统比较,也未量化幻觉发生率。

作者给出针对已识别局限的缓解措施表:结构化检索协议锚定同一经验证证据集、逐份文档处理后再汇总、每条主张强制引用原始文献、记录工具/模型/版本/时间与知识截止日期,以支持可追溯与审计。 这些措施把“人在环”从原则落实为可操作的控制点,并强调在数据丰富场景中检索必须与提取、摘要分离,而在数据贫乏场景可合并为单一端到端提示但仍需专门检索验证。 基于案例观察与文献综合提出的建议性方案,作者说明模块化工作流目前仍需要专家审核、来源核验与逐步控制,效率收益可能被审核与纠错成本部分抵消。

启示与展望

该工作面向毒理风险评估实践者、监管科学研究者与需要撰写PDE等化合物特异限值的评估团队,适用场景是数据丰富物质在ICH Q3E草案框架下的PDE推导,以及类似的证据密集评估。它提供的是一个工作流假设与缓解措施清单,用于把LLM限定在检索、提取与摘要等定义明确的子任务上,并把PoD选择、修饰因子应用与最终结论保留给人类毒理学家。作者指出,数据贫乏场景可把检索与提取合并为单一端到端提示,但仍需专门检索验证;下一步是把该工作流应用到更多数据丰富与数据贫乏物质及再评估案例,并尽早与监管机构沟通。

读者仍需留意:本文为不完整读取,图1至图3、补充材料中的提示示例、提取证据示例与基准快照未在正文中展开,因此无法核对具体提示措辞与逐次运行细节;幻觉仅被描述为个别出现且未量化;案例只覆盖ATBC一种数据丰富物质与GPT-5/GPT-5.2为主的平台,Claude Sonnet 4.5与Gemini 3仅作探索性对照;作者也指出效率收益可能被审核与纠错成本部分抵消,模块化工作流在真实监管流程中的净收益与长期可靠性仍是待检验的问题。

来源