DOI:10.20047/j.issn1673-7210.25111149
中图分类号:R47
王思桦1,2, 曾莉2, 张欣宇1, 俞佳1, 纪丹3, 冯玉洁4
| 【作者机构】 | 1同济大学医学院; 2同济大学附属同济医院护理部; 3上海市浦东新区周浦社区卫生服务中心护理部; 4广东外语外贸大学高级翻译学院 |
| 【分 类 号】 | R47 |
| 【基 金】 | 同济大学附属同济医院优秀学科后备人才计划(杰出青年)项目(HBRC2303) 上海市哲学社会科学规划课题(2025BJC005)。 |
在人工智能(artificial intelligence,AI)技术迅猛发展与科技强国战略实施的双重驱动下,AI与医疗护理领域的深度融合成为必然趋势[1]。AI作为实现护理数智化转型的辅助工具,其实践落地不仅需要推动临床护士的认知与能力转型,而且需要培养具备AI素养的护理新生力量[2]。护理专业学生作为未来临床护士的预备人才及潜在技术应用的执行者,为应对这一时代变革,需掌握AI相关知识及应用技能,做好充分应用AI的准备[3]。医学AI准备度是指医护人员结合自身专业知识利用AI技术提供预防、诊断、治疗等服务时感知的综合准备状态[4]。有效评估护理专业学生的医学AI准备度并识别准备缺口,是护理教育者精准制订AI相关教学内容的重要依据,对培育兼具专业知识和AI素养的创新型护理人才发挥重要作用。Karaca等[4]在2021年开发医学AI准备度量表(medical artificial intelligence readiness scale for medical student,MAIRS-MS),从认知、能力、前瞻及伦理4个维度综合评估医学生的AI准备度,并验证其良好的信效度。该量表已被伊朗、沙特阿拉伯、马来西亚等多个国家翻译使用,均具有良好的信效度[5-7]。鉴于国内目前针对护理专业学生AI准备度的评估体系仅关注AI态度,缺乏多维度的综合评估工具,因此对英文版MAIRS-MS进行汉化并检验其信效度,旨在为国内有效评估护理专业学生的AI准备度提供工具。
MAIRS-MS由Karaca等[4]于2021年编制,用于评估医学生对AI技术及其应用的感知准备水平。该量表共22个条目4个维度,即认知(8个条目)、能力(8个条目)、前瞻(3个条目)、伦理(3个条目)。各条目均采用Likert 5级评分法,得分1~5分分别对应“非常不同意”到“非常同意”,总分范围22~110分,得分越高表明学生AI准备水平越高。量表总体及认知、能力、前瞻、伦理维度的Cronbach’s α系数分别为0.877、0.830、0.770、0.723、0.632,累计方差解释率达50.9%,验证性因子分析结果提示模型拟合良好。
1.2.1 量表翻译 在获得原量表作者授权后,根据Brislin翻译模型,对英文版MAIRS-MS进行汉化[8]。①正译:邀请2名护理研究生(母语为中文、护理专业知识扎实且通过英语六级考试)对量表进行独立翻译,分别形成中文版A1和A2。②综合:邀请1名拥有国外留学背景的护理学博士对中文版A1、A2进行比较分析并加以整合,如遇分歧由3名研究人员讨论决定,最终形成中文翻译版A3。③回译:在均不熟悉原量表的条件下,由1名已通过英语专八考试的英语专业硕士研究生和1名具有留学经历的内科学博士将MAIRS-MS中文版A3回译为英文,形成英文版量表B1、B2。④校对:由研究者和2名回译人员共同对比原量表、英文版量表B1和B2,对内容存在差异的条目进行反复讨论修订直至符合中国文化背景,最终形成中文版初稿C。
1.2.2 文化调适 采用专家函询法进行文化调适。专家纳入标准:①在医疗/护理领域具备至少8年的从业或教学经验;②本科及以上学历;③中级及以上职称;④自愿参与本研究。共邀请8名相关领域专家,其中医疗信息专家1名、护理教育专家2名、护理管理专家1名、重症护理专家2名、临床护理专家2名;工作年限9~35年,平均(14.50±8.57)年;年龄31~57岁,平均(38.13±8.08)岁;正高级职称2名,副高级职称3名,中级职称3名;获得博士学位4名,硕士学位3名,学士学位1名。要求对中文版量表C各条目的语义、用词合适与否及内容的关联性进行评价。共进行两轮专家函询,汇总专家意见对量表内容进行修订,最终形成预调查版MAIRS-MS。
1.2.3 预调查 采用便利抽样法,于2025年5月至6月选取同济大学附属同济医院的30名实习护理专业学生进行预调查。纳入标准:①年龄 ≥18岁,专科及以上护理专业在读生;②具备良好的理解与表达能力,能真实反映个人体验;③充分知情且自愿参与本研究,并签署知情同意书。排除标准:①因时间限制无法参与本研究;②中途退出。研究者在预调查过程中询问被调查者对量表每个条目的理解及建议,调查完成后研究小组整理预调查结果,对护理专业学生存在异议的条目进行调整优化,最终形成中文测试版MAIRS-MS。
1.3.1 研究对象 调查对象为2025年6月至7月采用便利抽样法从同济大学附属同济医院选取的实习护理专业学生,纳入及排除标准同预调查。按照量表汉化标准与准则要求,探索性因子分析样本量通常需控制在量表条目数的5~10倍[9];验证性因子分析要求样本量至少200[10]。中文版MAIRS-MS共22个条目,一般资料共7个条目,考虑10%的无效率,则本研究所需最少样本量为(条目数×10)/(1-10%),即(29×10)/(1-10%)=322名。本研究已经同济大学附属同济医院伦理委员会审核批准[(同)伦审第(K-2025-095)号]。
1.3.2 调查工具 ①一般资料调查表:该部分由研究小组自行编制,用于收集研究对象的人口统计学信息,即年龄、性别、文化程度;AI使用情况包括AI使用经验、频率、精通程度及对其态度如何。②中文测试版MAIRS-MS。
1.3.3 资料收集方法 将中文版MAIRS-MS录入问卷星平台,由经过统一培训、熟练掌握量表的使用方法、评分标准的研究者与医院取得联系后说明调研目的,取得医院护理部同意,于2025年6月至7月将问卷星二维码发至医院护理实习生微信群,问卷所有题目均设置为必答题,填写首页注明统一指导语,向研究对象说明研究的目的及意义,并强调所有调研数据将严格保密。共发放问卷396份,回收有效问卷370份,有效问卷回收率为93.43%。间隔2周后,随机抽取30名护理专业学生再次进行调查,以评估量表的重测信度。
1.4.1 项目分析 ①临界比值法:将370名护理专业学生的MAIRS-MS总得分按降序排列后,取总分排名前27%和后27%分别划分为高分组和低分组,将高分组和低分组进行独立样本t检验,比较两组间各条目得分差异,若决断值>3.0且P<0.05,则保留该条目,否则予以删除[11]。②相关系数法:通过Pearson相关性分析计算中文版MAIRS-MS各条目得分与总分(所在维度)之间的相关系数,若相关系数<0.3或相关无统计学意义(P>0.05),表明相关性不足,则予以删除[11]。
1.4.2 效度检验 ①内容效度:邀请8名专家(同文化调试专家一致)使用Likert 4级评分(即非常不相关=1,不相关=2,相关=3,非常相关=4)对量表条目与总体关联程度进行评估。根据专家打分情况计算出各条目水平内容效度(item-level content validity index,I-CVI)、量表水平的内容效度指数(scale-level content validity index,S-CVI/Ave),当专家人数 ≥6时,以I-CVI ≥0.78,S-CVI/Ave ≥0.90提示量表内容效度较好[12]。②结构效度:对样本进行随机分组处理,分别选取160例开展探索性因子分析,另210例用于验证性因子分析。探索性因子分析:当KMO值>0.8且Bartlett’s球形检验结果差异有统计学意义(P<0.05)时,说明样本数据适合进行因子分析[13]。采用主成分分析法结合最大方差法对数据进行正交旋转,提取特征值>1的公因子,以因子载荷 ≥0.4确定各条目因子归属,将因子载荷<0.4及双重载荷条目予以删除[14]。验证性因子分析:采用极大似然法进行模型拟合度评价,当卡方自由度比值(chi-square divided by degrees of freedom,χ2/v)<3.000;近似误差均方根(root mean square error of approximation,RMSEA)<0.080;均方根残差(root mean square residual,RMR)<0.05;拟合优度指数(good-ness-of-fit index,GFI)、比较拟合指数(comparative fit index,CFI)、增量拟合指数(incremental fit index,IFI)、非规准适配指数(Tucker-Lewis index,TLI)>0.800,表明模型拟合良好,若>0.900则表明模型拟合优秀[11]。
1.4.3 信度检验 ①内部一致性:当Cronbach’s α系数>0.7时,表明内部一致性良好。②折半信度:当折半信度系数>0.7,表明内部一致性良好。③重测信度:随机抽取第1次调查中的30名护理专业学生,在调查后2周重新调查,计算重测信度,相关系数>0.7,表明量表前后稳定性较好[15]。
第1轮专家函询意见及修改情况:①条目1~4中“我知晓”语义深度把握不到位,建议修改为“我能阐述”;②条目7中“我能设计”用词过重,建议修改为“我能梳理出”;③条目8中语言组织条理不够清晰,将“数据收集、分析、评估、及安全体系”修改为“数据质量(收集、分析、评估)和数据安全”;④条目13中“如何解决医疗领域的具体问题”不符合中国语言表达习惯,修改为“如何为医疗保健中的问题提供解决方案”;⑤条目14“我认为将AI应用于教育、服务和科研具有重要价值”表述不贴合“能力”维度,修改为“我通过AI在教育、服务和科研中的应用发现其重要价值”;⑥条目20末尾建议增加“并履行保密职责”,更符合医疗护理领域的职业素养要求;⑦应答选项表述不恰当,该量表是事实性陈述,而非态度测量,建议修改为“完全不符合/不符合/不确定/符合/完全符合”。第2轮专家咨询意见及修改情况:条目5、10、13、15和22中“医疗领域/服务”用词涵盖范围不全,是否包含护理领域存在争议,建议修改为“医疗保健领域/服务”。课题组依据2轮专家咨询意见修订完成后形成预调查版MAIRS-MS。在修订过程中未删减条目。
经预调查反馈发现,护理专业学生对条目11中“既定功能”的理解存在一定差异,为使量表条目更加清晰、准确,将“既定功能”修改为“设计用途/目的”,最终形成测试版MAIRS-MS。
370名调查对象年龄17~25岁,平均(20.55±1.47)岁;女性居多,共302名(81.62%);文化程度以本科为主,共276名(74.59%),其他资料见表1。
表1 人口统计学资料(n=370)
项目例数构成比(%)性别男6818.38女30281.62年龄(岁)17~<209024.3220~<2324566.2223~25359.46文化程度专科7620.54本科27674.59硕士研究生184.87 AI使用经验是33490.27否369.73使用AI的频率几乎不123.24偶尔16544.60经常15942.97每天349.19 AI精通程度非常生疏82.16比较生疏9124.60一般精通20856.22比较精通5214.05非常精通112.97对AI的态度非常悲观20.54比较悲观30.81中立态度15742.43比较乐观16845.41非常乐观4010.81
注 AI:人工智能。
①临界比值法分析结果显示,高分组和低分组间比较结果显示比值比为9.375~17.071(均P<0.001),提示各条目区分度较理想。②通过Pearson相关性分析计算各条目得分与总分的相关系数,结果提示各条目与量表总分相关系数为0.517~0.768(均P<0.001),各条目与各维度的相关系数为0.748~0.917(均P<0.001),提示各条目同质性良好。综上所述,各条目区分度及同质性较好,故保留原量表所有条目。
2.4.1 内容效度 根据专家评价结果,计算出该量表的各条目I-CVI为0.875~1.000,S-CVI/Ave为0.955,提示量表总体内容效度较好。
2.4.2 结构效度 ①探索性因子分析:将370例样本随机分为两个部分,其中160例用于探索性因子分析,结果显示KMO值为0.903,Bartlett’s球形检验χ2=2 107.169(P<0.001),表示该量表满足探索性因子分析要求。采用主成分分析法结合最大方差正交旋转法,提取特征值>1的4个公因子,累计方差贡献率为65.859%(>50%),各条目因子载荷为0.518~0.887( ≥0.400),各条目在每个维度的归属与原量表保持一致,见表2。最终形成的中文版MAIRS-MS包括4个维度22个条目,4个维度分别命名为认知、能力、前瞻、伦理。②验证性因子分析:将剩余210例样本进行验证性因子分析,结果显示,χ2/v=2.195,RMSEA=0.076,RMR=0.043,GFI=0.841,IFI=0.924,TLI=0.913,CFI=0.924,提示模型拟合较好。
表2 中文版MAIRS-MS各条目因子载荷矩阵
条目因子1因子2因子3因子41.我能阐述数据科学的基本概念0.8110.079-0.1520.1562.我能阐述统计学的基本概念0.7870.0570.0740.2043.我能阐述AI系统的训练原理0.8120.177-0.0180.0884.我能阐述AI的基本概念和术语0.8400.1450.0150.0795.我能正确分析医疗保健领域中AI生成的数据0.7300.3680.1540.0356.我能区分AI相关工具和应用程序的功能与特点0.6770.328-0.0180.1157.我能梳理出兼容AI的工作流程0.6970.3710.0490.0508.我能阐述数据质量(收集、分析、评估)和数据安全在医疗AI发展中的重要性0.7150.3980.088-0.0149.我能将AI信息与专业知识融合应用0.1940.7550.1120.02210.我能在医疗保健服务中高效运用AI技术0.3520.6550.0690.06111.我能按照AI应用程序的设计用途/目的进行规范使用0.1030.7190.1660.25712.我能运用信息与通讯技术获取、评估、利用、共享及创造新知识0.2590.7160.1220.18413.我能解释AI应用程序如何为医疗保健中的问题提供解决方案0.3480.6090.0420.37714.我通过AI在教育、服务和科研中的应用发现其重要价值0.1530.6530.3540.22415.我能向患者解释医疗保健服务中使用的AI应用0.2730.5180.2870.24416.我能针对医疗保健领域中的问题选择合适的AI应用0.2930.5530.0450.37717.我能阐述AI技术的局限性0.0490.3410.0870.78318.我能阐述AI技术的优势和不足0.2930.3020.2240.63119.我能预见AI技术可能带来的机遇和挑战0.0840.1000.2630.72420.我能遵循法律要求与伦理规范使用健康数据,并履行保密职责0.0310.1380.8870.11721.我能在使用AI技术时遵循伦理原则-0.0240.2510.8250.15322.我能遵守医疗保健领域AI应用的相关法律法规-0.0210.1210.8770.190特征值8.7693.1961.4101.115累计方差贡献率(%)23.96443.57655.83765.859
注 MAIRS-MS:医学人工智能准备度量表;AI:人工智能。
中文版MAIRS-MS的Cronbach’s α系数为0.942,认知、能力、前瞻、伦理维度的Cronbach’s α系数分别为0.924、0.902、0.771、0.894;折半信度为0.803,认知、能力、前瞻、伦理维度的折半信度分别为0.879、0.875、0.712、0.905;重测信度为0.956,认知、能力、前瞻、伦理维度重测信度分别为0.920、0.904、0.859、0.917。
本研究在获取原量表作者授权后严格遵循Brislin翻译模型进行汉化[8]。翻译阶段共邀请4名译者,其中2名正译人员均具备较强的护理专业能力及英语水平,2名回译人员均具备较深厚的双语素养,确保翻译的准确性与可靠性;且正、回译过程中2名翻译人员保持独立完成,各翻译版本进行综合时均由第3名研究者与翻译人员共同商讨决定,极大减少个人特质的引入,避免单人翻译造成的偏倚。文化调适阶段邀请医疗信息、AI及护理教育等领域的专家从多学科角度进行2轮文化调适,并针对专家意见开展多次小组讨论修订条目,确保条目表述更贴合中国文化背景、医疗护理背景及语言表达习惯。预调查阶段从护理专业学生的角度评估量表条目的可读性和可理解性,以进一步修改量表,确保中文版MAIRS-MS的语言适用性。正式调查阶段,在护理专业学生中进行大样本调查检验中文版MAIRS-MS的信效度,结果证实中文版MAIRS-MS的信效度指标均在较理想范围。综上所述,中文版MAIRS-MS的汉化过程具备严谨性及科学性。
效度是指测量工具能准确反映所测量事物的程度,是衡量量表科学性的重要参考依据[16]。本研究采用内容效度、结构效度对中文版MAIRS-MS进行检验。内容效度通常由相关领域专家依据理论和实践经验对其进行评价[17]。本研究邀请来自医疗信息、AI、护理教育等领域的8名专家对量表维度及条目进行评议,专家函询结果显示中文版MAIRS-MS的I-CVI为0.875~1.000,S-CVI/Ave为0.955,均符合标准值,表示量表具有良好的内容效度。结构效度是评价量表结构稳定性的关键指标[14]。本研究采用探索性因子分析法提取4个公因子,分别为认知、能力、前瞻、伦理,条目归属与原量表保持一致,旋转后各条目因子载荷为0.518~0.887,累计方差贡献率为65.859%,均达到标准要求,表明中文版MAIRS-MS结构效度良好。验证性因子分析结果显示,χ2/v、RMSEA、RMR、IFI、TLI、CFI均达到可接受范围,提示量表总体模型拟合较好,与波斯语版MAIRS-MS研究结果一致[5]。提示该量表具备良好的心理测量学属性,能在不同文化中保持较高的效度,普适性较好。综上所述,中文版MAIRS-MS的内容效度和结构效度均表现良好,说明量表的内容全面、结构稳定。
信度是反映测量工具的稳定性和内部一致性的关键指标[18]。本研究从内部一致性、折半信度和重测信度3个方面对量表进行评价。内部一致性通常用Cronbach’s α系数表示,结果显示中文版MAIRS-MS的总体及认知、能力、前瞻、伦理维度Cronbach’s α系数分别为0.942、0.924、0.902、0.771、0.894,均>0.7;总体及认知、能力、前瞻、伦理维度折半信度分别为0.803、0.879、0.875、0.712、0.905,均>0.7,提示该量表内部一致性较好。重测信度是评价量表稳定性的重要指标。中文版MAIRS-MS的总体及认知、能力、前瞻、伦理维度重测信度分别为0.956、0.920、0.904、0.859、0.917,提示具有良好的时间稳定性。中文版MAIRS-MS在护理专业学生群体中具有较好的信度。此外,将中文版MAIRS-MS的信度与波斯语版进行比较发现,波斯语版总体及认知、能力、前瞻、伦理维度信度分别为0.938、0.886、0.851、0.841、0.899,两个版本均表现出良好的信度,提示该量表内部一致性较好,可靠性高[5]。综上所述,中文版MAIRS-MS的信度表现良好,适用于评估护理专业学生的AI准备度。
在政策引领、技术革新及临床需求的驱动下,亟须培养AI复合型护理人才以推动AI技术在护理领域的落地实践[19]。护理专业学生作为未来护理队伍的新生力量、交叉人才培养的前端,其AI准备度将直接影响护理高等教育培养效果[20]。因此,亟须科学有效地评估护理专业学生的AI准备度,及时发现和解决其AI准备度缺口。国内关于护理专业学生AI准备度的评估工具仅关注AI技术应用态度,测量维度单一片面[20]。本研究汉化的中文版MAIRS-MS评估内容全面,条目具体清晰、用词及语义符合中文表达习惯且易于理解,能较好地反映医学生的AI准备水平,且量表填写完成时间为2~5 min,可操作性较强,为评估中国护理专业学生的AI准备度提供可靠工具。认知维度可有效识别护理专业学生对AI相关知识的薄弱点;能力维度可了解护理专业学生对AI使用技能的掌握程度;前瞻维度可深入剖析护理专业学生对AI的批判性思维水平;伦理维度可审视护理专业学生对应用AI的法律意识,通过4个维度的评估可全面了解护理专业学生的AI准备度现状,为针对现有缺陷制定合理的监管和课程培训计划提供有力参考。此外,该量表不仅可指导AI相关教学内容设计,还可用于衡量AI相关课程或培训实施后的有效性[4]。综上所述,中文版MAIRS-MS具有良好的应用价值。
本研究样本仅来源于同济大学附属同济医院,样本代表性存在一定局限;本研究存在一定局限性,仅将中文版MAIRS-MS在护理专业学生群体中进行信效度检验,而在其他医学生群体中的应用效果尚未知,其普适性存在一定限制。建议未来扩大样本收集的地域范围并扩展研究群体,开展多中心、大样本量调查进一步验证该量表的科学性和可推广性。
利益冲突声明:本文所有作者均声明不存在利益冲突。
[1] 刘漫,沈鹏熠,张茹梦. 人工智能技术在医疗护理中的应用研究[J]. 中国农村卫生事业管理,2025,45(3):177-182.
[2] CHEN J. Playing to our human strengths to prepare medical students for the future [J]. Korean J Med Educ,2017,29(3):193-197.
[3] HAMAD M,QTAISHAT F,MHAIRAT E,et al. Artificial intelligence readiness among jordanian medical students:using medical artificial intelligence readiness scale for medical students (MAIRS-MS) [J]. J Med Educ Curric Dev,2024,11:23821205241281648.
[4] KARACA O,ÇALIŞKAN S A,DEMIR K. Medical artificial intelligence readiness scale for medical students (MAIRS-MS)-development,validity and reliability study [J]. BMC Med Educ,2021,21(1):112.
[5] KHAJEALI N,KOHAN N,REZAEI S,et al. Psychometric assessment of the persian translated version of the “medical artificial intlligence readiness scale for medical students” [J]. PLoS One,2025,20(5):e0323543.
[6] AL SHAHRANI A,ALHUMAIDAN N,ALHINDAWI Z,et al.Readiness to embrace artificial intelligence among medical students in saudi arabia:a national survey [J]. Healthcare(Basel),2024,12(24):2504.
[7] TUNG A Y Z,DONG L W. Malaysian medical students’ attitudes and readiness toward AI (artificial intelligence):a cross-sectional study [J]. J Med Educ Curric Dev,2023,10:23821205231201164.
[8] 王晓娇,夏海鸥. 基于Brislin经典回译模型的新型翻译模型的构建及应用[J]. 护理学杂志,2016,31(7):61-63.
[9] 田亚杰,郑晓娜,韩智培,等. 乳腺癌患者身体接受度量表的汉化及信效度检验[J]. 护理学杂志,2025,40(16):45-48.
[10] 吴明隆. AMOS的操作与应用[M]. 重庆:重庆大学出版社,2010.
[11] 蒋红梅,江庆华,吕俊,等. 乳腺癌病人压力源量表的汉化及信效度检验[J]. 护理研究,2025,39(10):1654-1661.
[12] 李峥,刘宇. 护理学研究方法[M]. 2版. 北京:人民卫生出版社,2018.
[13] MARSH H W,HAU K T,BALLA J R,et al. Is more ever too much? the number of indicators per factor in confirmatory factor analysis [J]. Multivariate Behav Res,1998,33(2):181-220.
[14] 胡雁,王志稳. 护理研究[M]. 5版. 北京:人民卫生出版社,2017.
[15] 邓灿,浩育盈,画妍,等. 老年人记忆丧失的恐惧与回避量表的汉化及信效度检验[J]. 护理研究,2025,39(13):2234-2238.
[16] 史静琤,莫显昆,孙振球. 量表编制中内容效度指数的应用[J]. 中南大学学报(医学版),2012,37(2):49-52.
[17] 汪张毅,李利平,邸淑珍,等. 慢性病患者预期病耻感量表的汉化及信度效度检验[J]. 中国护理管理,2024,24(5):681-686.
[18] 郑日昌. 心理测量与测验[M]. 2版. 北京:中国人民大学出版社,2013.
[19] 孙娜,赵文晓,赵雪莲,等. 学科交叉融合背景下我国护理学科人才培养路径分析[J]. 护士进修杂志,2024,39(4):369-371,389.
[20] 牛瑞,张娜,宋晓东,等. 护士人工智能准备度的研究进展[J]. 护理学报,2025,32(17):24-28.
Siniciation and reliability and validity test of medical artificial intelligence readiness scale for medical student
王思桦(2001.9-),女,同济大学医学院2024级护理专业在读硕士研究生;研究方向:护理教育、急危重症护理。
[通讯作者] 曾莉(1987.3-),女,博士,副主任护师,副教授,博士生导师;研究方向:护理教育、急危重症护理、慢性疾病管理。
X