RadOnc-Agent 将放疗全流程拆为四阶段与 26 个可调用函数,单函数执行意图命中率达 98.79%
核心概要
该工作提出 RadOnc-Agent,一个将放疗流程形式化为四个临床阶段、并通过对话界面提供 26 个可调用函数的智能体框架,由大语言模型控制器把临床意图映射为受模式约束的调用并保留患者与流程上下文;在 2,600 条单函数请求、200 个预设合成跨阶段场景和来自 60 份去标识病历的 120 个流程实例上,单函数执行意图命中率为 98.79%,脚本化跨阶段流程完成率为 96.50%,真实患者流程完成率为 96.67%。
[Uncaptioned image]
arXiv深度剖析
框架把放疗纵向流程形式化为四个临床阶段,并以对话界面暴露 26 个可调用函数,使分散在不同临床阶段、软件环境和数据模态中的能力被统一编排。 此前 AI 多用于改进单个放疗任务,能力彼此隔离;该工作把从治疗决策到随访的纵向流程作为编排对象,而非单一任务。 以四阶段形式化与 26 个函数的接口设计为描述性证据,配合后续执行评测。
大语言模型控制器将临床意图映射为受模式约束的调用,保留患者与流程上下文,并把请求路由到专门服务。 将模式约束、身份校验与纵向状态作为架构组件显式纳入,而非仅依赖模型自由生成调用。 消融显示,移除纵向状态使跨阶段完成率从 96.50% 降至 84.00%;在重放/测试评测中禁用模式与身份校验使后端派发不匹配从 0% 升至 95.28%。
系统执行评测覆盖单函数、合成跨阶段与真实患者流程三类设置,报告了较高的执行完成率。 评测同时包含 2,600 条单函数请求(7,800 次重复执行)、200 个预设合成跨阶段场景(600 次执行)与 120 个真实患者流程实例(360 次干净执行),覆盖决策到计划、计划到自适应两类流程。 单函数执行意图命中率 98.79%,脚本化跨阶段流程完成率 96.50%,真实患者流程完成率 96.67%。
作者明确界定结论范围:这些发现确立的是 LLM 编排架构在协调异构放疗能力与信息上的技术可行性。 把可行性验证与临床正确性、临床效用或前瞻性获益区分开,避免将执行成功率等同于临床效果。 原文直接声明这些结果不确立临床正确性、临床效用或前瞻性获益。
启示与展望
该结果面向放疗流程中异构能力与信息的协调场景,适用于从治疗决策到随访的纵向工作流,包括决策到计划与计划到自适应两类流程。对读者而言,其价值在于展示一种可复用的架构范式:把领域流程形式化为阶段、把能力封装为可调用函数、由 LLM 控制器在模式约束下完成意图映射与路由,并以纵向状态维持上下文。这一范式可被借鉴到其他需要跨阶段协调的临床或工程流程设计中,用于构建原型与执行层面的验证。
原文为摘要级信息,未提供各函数的实现细节、模式与身份校验的具体规则、纵向状态的表示方式,也未说明合成场景的构造依据与真实患者流程实例的选取标准。执行成功率与临床正确性之间的关系仍需进一步研究;消融中的重放/测试评测设置与真实部署条件的差异也值得关注。这些属于范围与开放问题,而非对工作的否定。
