药学教育中的严肃游戏止步于参与度和短期知识,而非临床胜任力

一项伞状综述发现,药学教育中的严肃游戏能提升参与度和短期知识,但对临床胜任力或患者结局并无改善。

直接答案

一项2026年的范围综述伞式评价综合了十项二次证据来源,得出结论:药学教育中的严肃游戏始终与学习者参与度和短期知识增益相关,但关于工作场所行为和患者结局的证据仍然有限[1]。该综述将这一模式映射到米勒金字塔和柯克帕特里克模型上,显示大多数评估集中在“知道”和“知道如何”层级,而非“展示如何”或“实际做到”层级[1]。关键在于,纳入的十项综述中有七项将数字化和实体干预合并汇总,而未报告特定模态的结果,这削弱了数字游戏可供性能够独立驱动学习的任何主张[1]。一项2025年在神经科急诊医学中开展的随机比较研究发现,严肃游戏产生的多项选择题测试结果与传统临床病例研讨班相当,进一步印证了知识增益可以实现,但并非严肃游戏独有优势[2]。综合来看,这些发现将严肃游戏定位为补充性形成性工具,而非用于高风险能力认证的经过验证的测评工具[1]

8篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

关于游戏和模拟在健康教育中已有证据的既有结论

在锚定综述之前,该领域已经证明严肃游戏能够在医学教育中产生可测量的知识增益。Heidrich等人于2025年开展的一项随机对照干预研究,在205名医学专业毕业班学生中,将一款关于癫痫发作和缺血性卒中的严肃游戏与传统的临床病例研讨会及无干预对照组进行了比较,发现在即时或三周随访时,严肃游戏组与研讨会组在多项选择题测试结果上均无显著差异[2]。这确立了设计良好的严肃游戏在事实性知识保持方面可以媲美传统教学,但并未检验这些知识是否能转化为工作场所行为或患者结局[2]。另外,2023年一项关于药学教育中高仿真评估的系统综述考察了学生对总结性模拟评估的感知,提供了一个先行前沿,凸显了药学模拟中更强效度证据和胜任力对齐的必要性[3]。这些早期研究共同奠定了基线:游戏和模拟能够教学,但该领域尚未系统地追问它们是否改变了临床实践。

评估框架本身也已相当成熟。Miller金字塔区分了临床胜任力的四个层级——知识、知识运用、操作展示和实际执行——而Kirkpatrick模型则区分了反应、学习、行为和结果[1]。一项2023年的系统综述将Kirkpatrick模型应用于涉及药学学生的跨专业模拟活动,发现纳入的六项研究未能将模拟的学习成果与胜任力建立合理关联,这表明教育干预与临床胜任力框架之间的对齐早已被视为一个公认的薄弱环节[4]。这一验证证据确认,锚定综述所识别的问题并非新问题,但该锚定综述是首个在综述层面将整个严肃游戏药学文献与这些框架进行对照映射的研究[1]

锚定综述的贡献:将十篇综述映射到能力框架

作为锚定的范围综述伞形评价,该研究检索了Web of Science、PubMed和Scopus数据库中2015年1月1日至2025年12月31日期间的出版物,筛选了914条唯一记录,最终纳入十项二级证据来源——八项来自数据库检索,两项来自 backward 引文追踪[1]。纳入的综述发表于2017年至2023年间,其中仅2023年就有五项,其第一作者分布于六个国家,包括美国(n=4)和澳大利亚(n=2)[1]。研究人群以药学受训人员为主(n=9),部分综述扩展至执业药师和药学辅助人员(n=4),一项纳入了接受药物管理干预的患者[1]。干预措施涵盖数字游戏化学习、游戏化教学模块、教育密室逃脱和计算机模拟系统,应用场景主要集中于高等教育教学环境(n=9)[1]

该综述运用米勒金字塔、柯克帕特里克模型以及Graafland严肃游戏有效性框架进行分析,发现参与度和短期知识是纳入综述中最常报告的结果[1]。关于工作场所行为和患者结局的证据仍然有限,集中在这两个框架的较低层级[1]。AMSTAR 2评估将十篇纳入综述中的九篇评为极低质量,一篇评为低质量,主要原因是前瞻性方案注册、明确的排除清单以及将偏倚风险评估纳入解释等条目缺失或不完整[1]。作者将这些评级解读为报告和评估透明度的指标,而非对 underlying 教育研究的 definitive 否定,并指出若干纳入综述为范围综述或结构化叙述性综述,其设计目的是描绘该领域全貌,而非估计合并效应[1]

为何混合模态报告会削弱对数字游戏的归因

锚定综述的一个核心发现是,十篇纳入综述中有七篇将数字化和实体干预合并分析,而未报告特定模态的结果,这限制了将观察到的获益归因于数字化原生特性(如实时反馈、自适应难度或交互日志记录)的能力[1]。例如,Sera和Wheeler、Hope等人、Oestreich和Guy以及Kanaan等人的综述综合了屏幕类和纸笔类游戏的结果,却未将数字化效应与实体效应分开[1]。类似地,Hintze等人将数字平台与实体锁箱线索合并,Garnier等人将实体练习通风橱与3D交互程序结合,均未将数字特征与更广泛的模拟分开报告[1]。只有三篇综述——Abraham等人、Silva等人和Gharib等人——明确聚焦于纯数字化环境,但即便这些综述在评估效度和能力转化方面也表现出类似的局限,主要依赖自评量表和认知测试,而非隐蔽评估或高阶临床行为数据[1]

这种聚合问题不仅仅是方法学上的整理工作。由于数字与实体模态在可供性上存在差异,将它们合并可能掩盖所观察到的收益究竟与数字反馈、重复练习、社会协作、新颖性还是其他教学特征相关[1]。锚定综述将媒介混杂视为综述层面解释的一项局限,而非数字工具缺乏独立价值的证据,但其结论是,当前证据无法将数字干预的增量贡献与周围的课程设计或教学情境隔离开来[1]。这一局限还因一个更广泛的问题而加剧:在系统综述中,控制变量很少被视为异质性的来源;一项2025年对50篇观察性研究系统综述的总括综述发现,仅有50篇中的5篇(10%)提到混杂因素集的差异是异质性的潜在来源,而零篇综述提到对中介因素和碰撞变量的控制[7]。尽管该综述聚焦于观察性流行病学而非教育干预,但它说明了系统综述在处理情境变量方面的一个可推广的弱点,这些变量同样可能混杂严肃游戏的结果[7]

评估效度差距:从自我报告到隐蔽评估

锚定综述发现,许多纳入综述报告依赖于事后自我报告满意度调查和认知前后测分析,这些测量捕捉的是主观体验和短期知识增益,但捕捉决策过程或行为改变的能力有限[1]。从米勒金字塔的视角来看,这种评价模式将证据主要集中在“知道”和“知道如何”层级,而涉及临床有意义的“展示如何”或“实际做到”结果的数据较少[1]。该综述指出,隐蔽评估——即在与数字系统自然交互过程中,通过后端交互日志实时捕捉决策路径、反应时间和资源使用模式——在当前二级证据基础中仍未得到充分考察[1]。大多数研究仍主要将数字工具视为内容传递平台,而非能够支持更嵌入式评估的环境[1]

这一评估缺口并非药学教育所独有。2023年一项关于药学教育中高保真评估的系统综述发现,有六项研究未能将模拟的学习成果与胜任力建立合理关联,该综述呼吁在总结性模拟评估中提供更强的效度证据[3]。锚定综述通过表明即使采用数字游戏,评估范式仍与传统纸笔或自我报告形式基本无异,进一步拓展了这一关切[1]。在Graafland框架下,要提出关于教育有效性的更强主张,需要具备与构念效度和同时效度相关的证据;如果评估方式仍局限于无法捕捉真实临床行为的测试,则难以证实游戏内表现与专业胜任力之间的关联[1]。因此,该综述将数字严肃游戏定位为更适合形成性评估和情境化培训,而非高利害胜任力认证,未来任何高利害用途都需要更强的构念效度、同时效度和客观表现证据[1]

结论的边界与尚不确定之处

锚定综述的结论明确受限于其范围界定伞式设计以及所纳入综述的局限性。作者指出,该综合研究最好被理解为对综述层面证据和报告缺口的审慎图谱,而非完整的原始研究回溯或重新评估[1]。检索仅限于三个数据库——Web of Science、PubMed和Scopus——作者承认,以教育、心理学、护理和工程为重点的数据库可能包含该策略未捕获的额外记录[1]。AMSTAR 2评级虽然表明报告局限性普遍存在,但不应被解读为对 underlying 教育研究无效的判断,因为若干纳入综述是面向图谱绘制而非面向有效性评估的[1]。该综述无法证明严肃游戏在临床胜任力转化方面无效;它只能表明,当前综述层面的证据不支持关于此类转化的强主张[1]

关于数字干预在卫生专业教育中的更广泛证据基础也表明,情境和实施因素至关重要。一项2026年关于护士主导的远程姑息治疗的范围综述伞状综述发现,在28项研究中,远程医疗干预改善了症状管理和家庭支持,但作者警告称,由于研究设计的异质性、对二手证据的依赖以及方法学质量的参差不齐,研究结果应谨慎解读[5]。同样,一项2024年关于地中海饮食用于心血管预防的伞状综述发现,需要更高质量的综述,且AMSTAR 2评级常常处于极低水平,这表明报告质量的挑战并非教育技术综述所独有[6]。一项2025年关于大学生精神障碍症状的伞状综述发现,65%的纳入荟萃分析在AMSTAR 2上被评为极低质量,进一步表明方法学透明度是二手证据综合中普遍存在的问题[8]。这些平行发现强化了一点:锚定综述的审慎结论反映的是综述文献的普遍状况,而非严肃游戏研究特有的缺陷[1][5][6][8]

关于这些来源

本研究页面基于8项同行评审研究——发表于2023年至2026年,其中6项发表于2024年及以后,合计被引用189次——这些研究是从通过质量筛选的13项研究中选出的最相关研究,而这13项研究又从超过5亿篇文献的数据库中检索到的85篇论文中筛选而来。

本文引用的文献

1

药学教育中严肃游戏的干预保真度与能力转化:一项范围综述伞状评价

一项针对十种二级证据来源的范围综述伞状评价发现,药学教育中的严肃游戏最常报告的是参与度和短期知识成果,而关于工作场所行为和患者结局的证据有限;十项综述中有七项将数字和实体干预合并分析,未按模态分别报告,限制了对数字功能特性的归因[1]。

2

教育研究:通过严肃游戏开展神经科急症教学:一项随机对照干预研究

一项于2025年在神经急诊医学领域开展的随机对照干预研究发现,在205名六年级医学生中,严肃游戏组与传统临床病例研讨组在多项选择题测试结果上无显著差异,这表明严肃游戏在事实性知识方面可媲美传统教学,但并未展现出更优的知识获取效果[2]。

3

转向真实性评估?药学中高保真评估的学生认知系统综述

2023年一项关于药学教育中高保真评估的系统综述考察了学生对总结性模拟评估的看法,发现纳入的六项研究未能将模拟学习成果与胜任力建立合理关联,凸显了药学模拟中需要更强效度证据的必要性[3]。

4

柯克帕特里克评估模型在涉及药学学生的跨专业模拟活动评估中的应用:一项系统综述

一项2023年的系统综述将柯氏评估模型应用于涉及药学学生的跨专业模拟活动,发现六项研究未能将模拟的学习成果与能力标准相对应,这验证了人们对药学模拟教育中能力对齐问题的担忧[5]。

5

护士主导的远程姑息护理用于症状管理和家庭支持:综述与原始研究的混合伞形综述

一项2026年关于护士主导的远程姑息治疗的混合伞式综述发现,在28项研究中,远程医疗干预改善了症状管理和家庭支持,但提醒称,由于研究设计的异质性、对二手证据的依赖以及方法学质量的参差不齐,对研究结果应谨慎解读[6]。

6

地中海饮食对心血管疾病一级和二级预防的有效性:一项伞状综述

2024年一项关于地中海饮食用于心血管预防的伞状综述发现,需要更高质量的综述,且AMSTAR 2评级常常处于极低水平,这表明报告质量的挑战并非教育技术综述所独有[7]。

7

一项伞状综述揭示,在观察性研究的系统综述中,控制变量很少被视为异质性的来源。

一项2025年对50项观察性研究系统综述的伞状综述发现,在50项综述中,仅有5项(10%)提到混杂因素集合的差异是异质性的潜在来源,而零项综述提到对中介因素和碰撞变量的控制,这表明在系统综述中,控制变量很少被视为异质性的来源[8]。

8

大学生心理障碍症状的患病率:一项伞状综述。

一项2025年关于大学生精神障碍症状的伞状综述发现,65%的纳入荟萃分析在AMSTAR 2评估中被评为“极低质量”,进一步表明方法学透明度是二次证据综合中普遍存在的问题[10]。