五种国产人工智能聊天机器人作为乳腺癌健康信息来源的可靠性与可读性评估研究

李丹, 张楠楠, 李睿, 田雅琦, 张国庆, 吴超, 聂思月, 高乐

【作者机构】 中国人民解放军总医院肿瘤医学部
【分 类 号】 R737.9
【基    金】 国家卫生健康委员会能力建设和继续教育中心慢病管理专项课题(GWJJMB202510010069)。
全文 文内图表 参考文献 出版信息
五种国产人工智能聊天机器人作为乳腺癌健康信息来源的可靠性与可读性评估研究

五种国产人工智能聊天机器人作为乳腺癌健康信息来源的可靠性与可读性评估研究

李 丹 张楠楠 李 睿 田雅琦 张国庆 吴 超 聂思月 高 乐

中国人民解放军总医院肿瘤医学部,北京 100071

[摘要] 目的 评价5种国产人工智能(AI)聊天机器人生成乳腺癌健康信息的可靠性与可读性。 方法 选取2020年10月至2025年10月知乎、丁香医生、百度高频且经专家审定的16个乳腺癌热点问题输入豆包、DeepSeek、通义千问、文心一言、智谱清言收集回复。使用健康信息质量评价工具(DISCERN)、患者教育信息质量评估工具(EQIP)、美国医学会杂志基准评价标准(JAMA)、整体质量分数(GQS)评估可靠性,网络健康信息可读性评价工具(OHIRET)、医疗信息可读性评估、健康教育文本材料适用性量表(SAM)、患者健康教育平面材料评估工具(PEMAT)评估可读性。 结果 5种AI聊天机器人DISCERN、JAMA、PEMAT评分和R值比较,差异有统计学意义(P<0.05);5种AI聊天机器人EQIP、GQS、OHIRET评分和SAM比较,差异无统计学意义(P>0.05)。 结论 国产AI聊天机器人在乳腺癌信息传播中可靠性参差不齐、可读性普遍不足。建议通过规范来源并简化语言,以提升AI健康信息质量与应用规范。

[关键词] 人工智能聊天机器人;乳腺癌;信息;可靠性;可读性;信息质量评估

国际癌症研究署发布的报告显示,在女性群体中,乳腺癌是最常见的癌症类型[1]。人工智能(artificial intelligence,AI)的迅速发展正推动医疗健康领域进入智能时代,其在医疗影像、个性化服务及健康管理等方面的广阔前景,为解决我国医疗健康领域面临的多层次问题提供全面且有效的智能化策略[2]。伴随这一趋势兴起的国产生成式AI平台,为健康信息检索带来新范式。然而,其生成的内容可能存在引用捏造、指南过时、信息不完整或不准确等问题,加剧医疗错误信息的传播风险[3]。目前缺乏针对国产AI聊天机器人生成内容在特定疾病领域信息质量的系统评估。本研究旨在评估5种国产AI回复乳腺癌相关问题的可靠性与可读性,为AI在医疗健康领域的规范应用提供依据。

1 资料与方法

1.1 问题集构建

本研究采用横断面设计,收集中国健康信息平台(知乎、丁香医生、百度)在2020年10月至2025年10月搜索频率前20%且经专家确认的乳腺癌相关搜索及问答数据。由2名研究者独立对搜索结果进行去重和相关性筛选,分歧由第三方仲裁解决,最终确定16个查询问题,见表1。本研究使用的问题集来自公开的健康信息平台,回复数据来自公开的AI模型输出,不涉及任何人类参与者和临床信息,无需伦理审查委员会批准。

表1 乳腺癌问题集

诊维流行度断病与分学与型病因什什什什得乳乳乳腺腺腺乳么么么么是是腺是是癌癌癌乳癌炎高三怎怎四期腺性发么么阴的筛性原乳乳检癌年题查腺腺测乳龄?因目有是腺癌癌??癌多哪??少些?岁??维治临疗度床表与现预后与鉴别得乳乳乳乳乳转乳腺腺腺腺移房房了有疼乳性癌癌癌癌腺有乳肿肿痛手的术是腺块块什癌治疗方乳摸癌就可么起症方是腺式怎以题来状是法乳癌活么目腺什有有治多吗?疗久什癌么哪?些么吗???特??点?

1.2 研究方法

纳入5种国产AI聊天机器人:①豆包(北京字节跳动网络技术有限公司,Doubao-Seed-1.6);②DeepSeek(杭州深度求索人工智能科技有限公司,DeepSeek-V3.2);③通义千问(阿里云计算有限公司,Qwen3);④文心一言(北京百度网讯科技有限公司,ERNIE 4.5 Turbo);⑤智谱清言(北京智谱华章科技有限公司,GLM-4.6)。评估日期为2025年10月13日,输入提示词参考Sivri等[4]建议的“请用通俗易懂的语言回答”,将16个问题依次输入每个AI聊天机器人,独立采集每次回复,测试前均重置对话环境以排除上下文干扰。由2名肿瘤科专家对回答进行独立评估,分歧由第3名肿瘤科专家仲裁,并以仲裁结果为最终得分。

1.3 观察指标

1.3.1 可靠性评估指标 ①健康信息质量评价工具(health information quality evaluation tool,DISCERN)。该量表用于评估治疗选择信息的质量,优秀(63~75分)、良好(51~62分)、一般(39~50分)、差(27~38分)、极差(16~26分)[5]。②患者教育信息质量评估工具(evidence-based quality of information in patient education,EQIP)。该量表用于评价健康信息的全面性与质量,76%~100%为质量很好;51%~<76%为质量好,有小问题;26%~<51%为严重质量问题;0%~<26%为存在严重质量问题[6]。③美国医学会杂志基准评价标准(Journal of the American Medical Association benchmark criteria,JAMA)。该量表用于评估网络医学信息的四大核心标准(作者、归属、时效性、披露),得分为0~4分,分数越高,表明内容准确性和可靠性越好[7]。④整体质量分数(global quality score,GQS)。Likert 5级评分量表用于评估内容的整体流量与实用性,1~2分为质量差、3~4分为质量中等、5分为高质量[8]

1.3.2 可读性评估指标 ①网络健康信息可读性评价工具(online health information readability evaluation tool,OHIRET)[9]。中文网络健康信息的特异性量表由王蕾等[10]构建并验证, ≥70分为可读性水平较好。②医疗信息可读性评估。使用秦琴等[11]改良形成用于医疗信息评估的可读性量化公式,R值代表健康信息的可读性水平。R值越小,可读性越强;R值 ≥6.07提示可读性差[12]。③健康教育文本材料适用性量表(suitability assessment of materials,SAM)。该量表从内容、读写需求等6个维度评估材料适用性;70%~100%为适用很好,40%~<70%为适用,0~<40%为不适用[13-14]。④患者健康教育平面材料评估工具(patient education materials assessment tool,PEMAT)。本研究采用中文版PEMAT进行评估,分数越高提示可理解性越好,>70分为有较好的可理解性[15]

1.4 统计学方法

使用R 4.5.1统计学软件进行数据分析,不符合正态分布的计量资料以中位数(四分位数)[MP25P75)]表示,多组间采用Kruskal-Wallis检验。采用Cronbach’s α系数检验各量表的内部一致性信度,一致性检验采用Cohen’s Kappa系数。以P<0.05为差异有统计学意义。

2 结果

2.1 量表信效度及一致性评价

DISCERN的Cronbach’s α系数为0.826,EQIP的Cronbach’s α系数为0.795,JAMA的Cronbach’s α系数为0.763,GQS的Cronbach’s α系数为0.748,OHIRET的Cronbach’s α系数为0.812,SAM的Cronbach’s α系数为0.774,PEMAT的Cronbach’s α系数为0.831。所有量表的Cronbach’s α系数均>0.70,具有良好的内部一致性。

评分者间总体Kappa值为0.780(95%CI:0.720~0.840),具有高度一致性。

2.2 5种AI聊天机器人信息可靠性评估结果比较

5种AI聊天机器人DISCERN、JAMA评分比较,差异有统计学意义(P<0.05);5种AI聊天机器人EQIP和GQS评分比较,差异无统计学意义(P>0.05)。见表2。

表2 5种AI聊天机器人信息可靠性评估结果比较[MP25P75)]

AI聊天机器人DISCERN(分)EQIP(%)JAMA(分)GQS(分)豆包41.00(38.00,50.00)62.50(57.50,70.00)0.00(0.00,0.00)3.00(3.00,4.00)DeepSeek35.00(32.75,41.75)60.00(52.50,65.00)0.00(0.00,0.00)4.00(3.00,4.00)通义千问42.50(37.50,50.00)65.00(60.00,75.00)1.00(1.00,1.00)3.00(3.00,4.00)文心一言42.50(38.75,48.00)60.00(54.38,65.00)0.00(0.00,0.25)3.00(3.00,3.25)智谱清言43.00(40.75,49.50)65.00(57.50,71.88)0.00(0.00,1.00)4.00(3.75,4.00)H值10.2789.38443.7969.051 P值0.0360.052<0.0010.060

注 AI:人工智能;DISCERN:健康信息质量评价工具;EQIP:患者教育信息质量评估工具;JAMA:美国医学会评价标准;GQS:整体质量分数。

2.3 5种AI聊天机器人信息可读性评估结果比较

5种AI聊天机器人R值和PEMAT评分比较,差异有统计学意义(P<0.05);5种AI聊天机器人OHIRET评分和SAM比较,差异无统计学意义(P>0.05)。5种AI聊天机器人R值均>6.07,未达到推荐标准。见表3。

表3 5种AI聊天机器人信息可读性评估结果比较[MP25P75)]

AI聊天机器人OHIRET(分)R值SAM(%)PEMAT(分)豆包54.50(45.75,62.50)9.46(8.09,10.94)33.00(32.25,37.00)47.75(27.70,56.26)DeepSeek65.50(53.75,67.00)9.62(7.79,12.59)34.00(29.50,36.00)63.50(60.25,67.25)通义千问58.00(52.75,62.00)7.36(6.86,8.54)31.00(26.00,34.50)40.63(31.29,57.81)文心一言58.00(58.00,63.25)14.84(13.44,16.78)34.50(28.50,38.00)42.00(25.00,50.00)智谱清言57.50(54.00,64.00)8.48(7.80,9.21)32.50(30.00,37.00)56.00(49.25,63.00)H值5.17540.2002.50925.142 P值0.270<0.0010.643<0.001

注 AI:人工智能;OHIRET:网络健康信息可读性评价工具;SAM:健康教育文本材料适用性量表;PEMAT:患者健康教育平面材料评估工具。

3 讨论

本研究揭示国产AI聊天机器人在生成乳腺癌健康信息时,面临着“形式规范性”与“内容精确性”难以兼顾的矛盾。通义千问在JAMA评分上的优异表现确立其在引用规范与信息时效性上的标杆地位,印证了相关研究者的观点,具备持续、规范引用能力的AI模型更能获得用户的信任[16]。各模型虽然在形式上遵循引用规范,但并不等同于具备实质性的临床应用价值,国产AI在医疗垂直领域的应用仍存在显著的“质量可靠性短板”。尽管部分模型在形式上给出来源,但所有模型在DISCERN、GQS评分上的平庸表现提示其在阐述治疗方案的风险收益比、深度细节及个性化指导方面仍显乏力,无法提供足够的决策支持。以DeepSeek为代表的部分模型虽然文本生成流畅,但在可靠性指标上表现相对弱势,折射出当前生成式AI普遍存在的“事实幻觉”风险。Ghanem等[17]在评估阑尾炎信息时指出,这种为追求语言连贯性而凭空捏造参考文献的现象,极大地削弱医疗信息的科学性与严肃性,构成患者误用信息的隐形风险。

高昂的阅读认知成本已成为阻碍国产AI普及高质量健康信息的关键壁垒。本研究中所有AI聊天机器人生成的回复R值均远超推荐阈值,尤其是文心一言出现的极端高值,反映AI生成的健康信息普遍存在“学究气”过重、晦涩难懂的痼疾。这一现象并非乳腺癌领域独有,Musheyev等[18]在泌尿肿瘤领域的研究中得出相似结论,AI回复的高阅读门槛正在将低健康素养人群拒之门外。究其根源,大模型的训练语料过度锚定于专业医学文献与学术网站,导致模型缺乏将专业术语“语义降维”为通俗语言的内生能力。这种技术性的“精英偏好”若不加以人工干预或算法优化,极易产生“马太效应”,原本处于信息弱势的群体因无法理解AI生成的复杂内容而更加边缘化。有学者强调,如果AI无法提供适配大众认知水平的通俗表达,其不仅无法弥合现有的健康信息鸿沟,反而可能成为横亘在医患之间的新技术壁垒[16,19]

鉴于当前AI模型在处理单一复杂指令时存在的局限性,临床应用不应单纯依赖技术迭代,而应转向“人机协同”的动态策略。医护人员应主动承担“向导”角色,指导患者采用“由浅入深”的递进式提问策略,通过多轮交互构建精准的语境,辅助AI输出更具针对性且易于理解的内容。必须在患者教育中强调AI信息仅作为辅助参考,严禁将其作为自我诊断或替代专业医疗评估的依据。AI聊天机器人的研发应超越单纯的准确性评价,向健康素养适应性与临床场景化方向深度演进[20]。研究者应重点探索提示工程在改善可读性方面的实际效能,并开展纵向追踪研究以监测模型迭代对信息质量的影响。最终目标是将本研究基于静态评估发现的模型特性,转化为一套面向医护人员和患者的、行之有效的动态交互指南,确保AI技术真正服务于提升医疗服务的公平性与可及性。

4 小结

本研究结果显示,国产AI聊天机器人在乳腺癌健康信息生成中面临可靠性分化与可读性匮乏的双重挑战。其中,通义千问可靠性综合表现最优,DeepSeek在可理解性上具有优势,但所有模型均未达推荐可读性标准。受限于模型快速迭代及评估工具的静态性,本研究仅反映特定时点性能。未来亟须构建来源透明且语言适配的生成机制,推广“医护引导、人机协同”的问答范式。尽管现阶段存在局限,规范化的AI应用仍是提升医疗服务公平性与可及性的关键路径。

利益冲突声明:本文所有作者均声明不存在利益冲突。

[参考文献]

[1] KIM J,HARPER A,MCCORMACK V,et al. Global patterns and trends in breast cancer incidence and mortality across 185 countries [J]. Nat Med,2025,31(4):1154-1162.

[2] 刘洋,孙旭,王涟. 国内医疗健康领域人工智能研究热点及趋势分析[J]. 中国医药导报,2024,21(25):191-196.

[3] MÁJOVSKÝ M,ČERNÝ M,KASAL M,et al. Artificial intelligence can generate fraudulent but authentic-looking scientific medical articles:Pandora’s box has been opened [J]. J Med Internet Res,2023,25:e46924.

[4] SIVRI I,OZDEN F M,COLAK T. Comment on ‘AI chatbots as sources of STD information:a study on reliability and readability’ [J]. J Med Syst,2025,49(1):1-2.

[5] CHARNOCK D,SHEPPERD S,NEEDHAM G,et al.DISCERN:an instrument for judging the quality of written consumer health information on treatment choices [J]. J Epidemiol Community Health,1999,53(2):105-111.

[6] MOULT B,FRANCK L S,BRADY H. Ensuring quality information for patients:development and preliminary validation of a new instrument to improve the quality of written health care information [J]. Health Expect,2004,7(2):165-175.

[7] SILBERG W M,LUNDBERG G D,MUSACCHIO R A. Assessing,controlling,and assuring the quality of medical information on the internet:caveant lector et viewor-let the reader and viewer beware [J]. JAMA,1997,277(15):1244-1245.

[8] SINGH A G,SINGH S,SINGH P P. YouTube for information on rheumatoid arthritis-a wakeup call?[J]. J Rheumatol,2012,39(5):899-903.

[9] 李星,杨文娟,李冰艳,等. 中国糖尿病网络健康信息的可读性评价[J]. 中国健康教育,2024,40(9):850-855.

[10] 王蕾,李星,汪秋伊,等. 网络健康信息可读性评价指标体系的构建[J]. 中华护理教育,2022,19(1):14-20.

[11] 秦琴,柯青,丁松云. 中文在线健康教育信息可读性计算及应用实证-以食品安全领域为例[J]. 现代情报,2020,40(5):111-121.

[12] 柯青,丁松云,秦琴. 健康信息可读性对用户认知负荷和信息加工绩效影响眼动实验研究[J]. 数据分析与知识发现,2021,5(2):70-82.

[13] DOAK C C,DOAK L G,ROOT J H. Teaching patients with low literacyskills [M]. Philadelphia:Lippincott-Raven Company, 1996.

[14] 王芝为,方媛媛,汪秋伊,等. 高血压健康教育平面材料的可读性评估[J]. 中国健康教育,2020,36(12):1122-1125,1167.

[15] SHOEMAKER S J,WOLF M S,BRACH C. Development of the patient education materials assessment tool(PEMAT):a new measure of understandability and actionability for print and audiovisual patient information [J]. Patient Educ Couns,2014,96(3):395-403.

[16] YILDIZ H A,SÖĞÜTDELEN E. AI chatbots as sources of STD information:a study on reliability and readability [J]. J Med Syst,2025,49(1):1-10.

[17] GHANEM Y K,ROUHI A D,AL-HOUSSAN A,et al. Dr.Google to Dr. ChatGPT:assessing the content and quality of artificial intelligence-generated medical information on appendicitis [J]. Surg Endosc,2024,38(5):2887-2893.

[18] MUSHEYEV D,PAN A,LOEB S,et al. How well do artificial intelligence chatbots respond to the top search queries about urological malignancies?[J]. Eur Urol,2024,85(1):13-16.

[19] GÜL Ş,ERDEMIR İ,HANCI V,et al. How artificial intelligence can provide information about subdural hematoma:assessment of readability,reliability,and quality of ChatGPT,BARD,and perplexity responses [J]. Medicine(Baltimore),2024,103(18):e38009.

[20] GÖDDE D,NÖHL S,WOLF C,et al. A SWOT(strengths,weaknesses,opportunities,and threats)analysis of Chat-GPT in the medical literature:concise review [J]. J Med Internet Res,2023,25:e49368.

Study on the reliability and readability evaluation of five domestic artificial intelligence chatbots as a source of breast cancer health information

LI Dan ZHANG Nannan LI Rui TIAN Yaqi ZHANG Guoqing WU Chao NIE Siyue GAO Le

Department of Oncology, Chinese PLA General Hospital, Beijing 100071, China

[Abstract] Objective To evaluate the reliability and readability of breast cancer health information generated by five domestic artificial intelligence (AI) chatbots. Methods From October 2020 to October 2025, 16 high-frequency and expert-reviewed breast cancer hot topics were selected from Zhihu, Dingxiang Doctor, and Baidu and input into Doubao,DeepSeek, Tongyi Qianwen, Wenxin Yiyan, and Zhipu Qingyan for collection and reply. Reliability was assessed using health information quality evaluation tool (DISCERN), evidence-based quality of information in patient education(EQIP), Journal of the American Medical Association benchmark criteria (JAMA), and global quality score (GQS);readability was evaluated with online health information readability evaluation tool (OHIRET), readability assessment tool for medical information, suitability assessment of materials (SAM),and patient education materials assessment tool(PEMAT). Results The comparison of the scores of DISCERN, JAMA, and PEMAT and R values among the five AI chatbots showed statistically significant differences (P<0.05); there were no statistically significant difference in the scores of EQIP, GQS, and OHIRET and SAM among the five AI chatbots (P>0.05). Conclusion The reliability of domestic AI chatbots in disseminating breast cancer information varies significantly,and readability is universally insufficient. Standardizing information sources and simplifying language are recommended to enhance the quality and standardized application of AI-generated health information.

[Key words] Artificial intelligence chatbots; Breast cancer; Information; Reliability; Readability; Information quality assessment

[中图分类号] R737.9

[文献标识码] A

[文章编号] 1673-7210(2026)05(b)-0053-04

DOI:10.20047/j.issn1673-7210.25112037

[基金项目] 国家卫生健康委员会能力建设和继续教育中心慢病管理专项课题(GWJJMB202510010069)。

[作者简介]

李丹(1981-),女,副主任护师;研究方向:肿瘤护理。

[通讯作者] 高乐(1982-),女,副主任护师;研究方向:肿瘤护理。

收稿日期:2025-11-25)

修回日期:2026-01-21)

X