跳到主要内容
返回时间线
The International journal of prosthodontics来源发表:

人工智能在评估口腔医学本科生中的表现:以学生成绩为基准的AI平台对比

核心概要

这项横断面比较研究让49名口腔医学二年级学生在标准化条件下完成45道修复工艺学多选题期末考试,并将同一套题目提交给ChatGPT、Gemini和DeepSeek三个AI系统,用ANOVA、Cronbach Alpha和Tukey HSD分析组间差异,结果显示DeepSeek在高难度题上取得满分、ChatGPT在多次尝试中表现出适应性提升,两者均显著优于学生群体,而Gemini准确率较低且稳定,模型间差异具有统计学意义(P=0.036,η²=0.891),据此提出无监督在线总结性考试在学术诚信方面需要重新审视。

AI-generated editorial illustration: Artificial Intelligence in Evaluating Undergraduate Dental Students: Benchmarking AI Platforms Against Student Performance.

深度剖析

在修复工艺学标准化期末考试这一具体学科场景中,AI模型可以持平或超过本科口腔医学生的表现。 以往关于LLM教育评估潜力的讨论多停留在一般性论述,本研究把比较落到一门具体课程、同一套45道多选题和同一批49名二年级学生上,提供了直接的组间对照。 横断面比较设计,学生样本49人、题量45题,采用ANOVA、Cronbach Alpha与Tukey HSD进行组间差异检验,并报告了P=0.036与η²=0.891。

不同AI系统在同一考试中的表现差异明显:DeepSeek在高难度题上取得满分,ChatGPT在多次尝试中表现出适应性提升,Gemini则准确率较低且保持稳定。 研究没有把AI当作单一整体,而是并列比较三个平台,揭示出模型间能力分层,而统计检验确认了这种差异的显著性。 三模型同题作答,配合ANOVA与Tukey HSD的组间比较,模型间差异达到统计学显著(P=0.036),效应量η²=0.891。

AI能够达到或超过学生水平这一事实,直接指向无监督数字化评价的学术诚信风险。 研究把性能比较的结果转化为对考核方式的政策含义,提出总结性考试不应在没有严格监考或安全验证环境的情况下在线进行。 该结论建立在本研究观察到的AI优于学生群体的成绩差异之上,属于基于比较结果的推论性建议。

启示与展望

本研究面向口腔医学本科二年级修复工艺学标准化期末考试这一具体场景,适用于关心数字化考核诚信的教师、考试管理者与课程设计者。它提示在类似学科考核中,AI可能达到或超过学生水平,因此在线总结性评价需要严格监考或安全验证环境;这一结论的适用范围应限定在与本研究相近的题型、难度分布与考生群体。

读者仍需留意:本次加载的是摘要性文本,未包含逐题表现、分难度得分、ChatGPT多次尝试的具体次数与提升幅度、以及各模型的运行配置等细节,因此模型间差异的具体来源尚不清楚。此外,AI成绩优势是否会随题型、语言或课程内容变化,以及严格监考之外是否存在其他可行的评价替代方案,都是值得后续观察的开放问题。

来源