面向观察式临床实习的AI即时反馈系统:设计与可行性研究
核心概要
本研究采用设计本位研究框架,为89名柔道整复专业本科生在为期四天的观察式临床实习中部署了一套AI驱动的即时反馈系统,学生每日提交反思笔记并在1分钟内获得基于量规的AI评分与反馈;系统356次请求全部成功处理,每日笔记提交率超过98%、自评完成率超过95%,学生问卷反馈积极;作为探索性外部检验,3名盲评临床教育者对30名随机抽取学生的120份笔记独立评分,与AI总分呈中等秩相关(Spearman's ρ = .495)但绝对一致性有限(ICC = .399),AI总分从第1天到第2天上升后趋于平稳,而人类评分未再现这一早期上升,不过人类对观察具体性的评分从第1天到第4天有所提高。
深度剖析
研究构建并落地了一套AI驱动的即时反馈系统,可在1分钟内对学生每日反思笔记给出基于量规的评分与反馈,并在真实临床实习场景中稳定运行。 以往观察式早期临床实习中的形成性反馈常受督导容量限制而难以及时、个性化地提供,本研究将AI即时反馈嵌入日常反思笔记流程,并以设计本位研究方式在真实实习中实现。 以系统性能为直接证据:全部356次系统请求均成功处理;89名学生在四天实习中的每日笔记提交率超过98%、自评完成率超过95%,学生问卷显示对可用性与反馈持积极看法。
AI生成的量规总分与盲评临床教育者的人类评分之间呈中等秩相关但绝对一致性有限,提示AI分数应被视为系统内部指标。 研究不仅报告系统可用性,还引入3名盲评教育者对120份笔记的独立评分作为探索性外部检验,从而把AI评分与外部人类判断并置比较。 基于30名随机抽取学生的120份笔记、3名盲评教育者使用同一量规独立评分,得到Spearman's ρ = .495与ICC = .399;作者据此明确说明AI生成分数不应作为教育改善的独立证据。
AI总分从第1天到第2天上升后保持相近水平,但这一早期上升未在人类总分评分中再现,而人类对观察具体性的评分从第1天到第4天上升。 研究将AI评分的时间趋势与人类评分的时间趋势分开呈现,揭示两者在短期变化模式上的差异,而非仅以AI分数代表学习进展。 趋势描述来自四天实习中AI评分记录与盲评人类评分记录的对照;作者将其定位为探索性短期模式,并指出需要采用外部结果指标的对照研究。
启示与展望
本研究旨在检验系统在观察式临床实习中的可行性与短期模式,适用于在临床教育者监督下、以每日反思笔记和量规评分为核心的形成性反馈场景;其结果为89名柔道整复专业本科生在四天实习中的实施经验,可为其他专业或实习安排提供参考,但AI生成分数应被理解为系统内部指标,而非教育改善的独立证据。
读者仍会关注:AI评分与人类评分绝对一致性有限(ICC = .399)在多大程度上受量规、评分者或笔记内容影响;AI总分早期上升与人类观察具体性上升之间的差异应如何解释;学生问卷的积极反馈与反思质量变化之间的关系;以及在没有外部结果指标的对照研究之前,系统对学习成效的作用仍属开放问题。
