DOI:10.20047/j.issn1673-7210.25100397
中图分类号:R57
王天琪1, 战俊邑2, 赵玉洁3, 赵晓斌1, 朱家琪1, 吉诗羽1, 王东隶3
| 【作者机构】 | 1山东中医药大学第一临床学院; 2浙江省杭州市中医院消化科; 3山东中医药大学附属医院消化科 |
| 【分 类 号】 | R57 |
| 【基 金】 | 国家自然科学基金资助项目(82174177) 山东省自然科学基金中医药联合基金项目(ZR2022LZY012) 中医药经典理论教育部重点实验室开放课题项目 齐鲁卫生与健康杰出人才项目。 |
溃疡性结肠炎(ulcerative colitis,UC)是一种慢性非特异性肠道炎症性疾病,以直肠和结肠的浅表溃疡为特征,是结直肠癌的重要风险因素[1]。2023年,全球UC患病人数约为500万例,并且全球发病率和患病率呈上升趋势[2-3]。UC不仅严重影响患者的生活质量,还可能引发如中毒性巨结肠、肠穿孔和肠狭窄等严重并发症[4]。尽管当前UC的治疗已取得显著进展,但在预测疾病复发、评估长期疗效及术后并发症管理等方面,仍存在诸多挑战。
目前C反应蛋白和红细胞沉降率等生物标志物和UC临床评分,虽然在一定程度上反映病情变化,但是难以对各种复杂预后事件做出精准评估[5-6]。机器学习(machine learning,ML)算法相比于传统评估手段具有显著优势。ML算法不仅能融合多种临床特征、高效识别数据模式及动态优化预测过程,还可为临床医师更准确地评估UC患者病情变化、制订个体化治疗策略提供有力支持[7]。然而,目前基于ML的UC预后风险评估模型仍面临样本量不足、特征选择不完善和模型普适性差等问题,限制其临床应用。
因此,本研究通过开展系统评价综述,旨在评估基于ML算法的UC预后风险评估模型研究现状,分析其在应用中面临的挑战,并探讨如何优化这些模型,以提高其在临床实际中的可操作性与有效性。
在PubMed、Embase、Web of Science核心合集数据库、中国知网、万方数据知识服务平台、维普网、中国生物医学文献服务系统中采用主题词与关键词相结合的方式进行筛选,检索时限从建库到2025年11月21日。中文检索以中国知网为代表,检索词为溃疡性结肠炎、溃疡性直肠炎、炎症性肠病、人工智能、机器智能、数据挖掘、神经网络、机器学习、深度学习、预测模型、风险评分、风险模型、风险预测、预后模型、预测等;英文检索以PubMed为代表,检索词为Ulcerative colitis、Colitis Gravis、Inflammatory Bowel Disease、Inflammatory Bowel Disease,machine learning、neural network、Machine Intelligence、Computational Learning、prediction model、risk score、risk model、predictive medicine、prognostic model、decision model、Predict、Risk等。
纳入标准:①研究对象年龄 ≥18岁,性别不限;②研究关注ML算法在UC预后中的应用;③研究类型为队列研究。
排除标准:①仅涉及UC预后危险因素,但没有构建预测模型的文献;②无法获取全文、信息不全或无法提取的文献;③综述、信件或会议摘要,重复发表的文献;④建模数据来源于人体组织实验的文献。
由2名研究人员独立筛选文献、提取资料并交叉核对,如遇分歧,则由第3名研究人员协助讨论和裁决。提取的数据特征包括研究设计、主要结局指标、样本量、数据来源、预测变量、ML类型、模型训练与验证策略、性能指标和局限性。
本研究使用预测模型偏倚风险评估工具(prediction model risk of bias assessment tool,PROBAST)进行评估,该工具旨在评估研究对象、预测因素、结局、分析4个领域的偏倚风险,同时评估研究背景下预后模型的适用性[8]。根据PROBAST标准,将研究分为低风险、不明确风险、高风险偏倚。4个领域中的任何一项发现显著偏倚,则指定为高风险偏倚。
7个数据库共检索到7 879篇文献,经去重、筛选、阅读题目、摘要及全文后,最终纳入14篇[9-22]。见图1。
图1 文献筛选流程
14篇文献中9项[9-17]研究聚焦于UC的复发与缓解,4项[18-21]研究聚焦于手术及术后并发症,1项[22]研究主要探讨UC患者COVID-19感染后的预后情况。7项[10,17-22]研究为回顾性队列研究,7项[9,11-16]研究为前瞻性队列研究。10项[9,11-13,16-21]研究使用单一算法模型;而其余研究则使用多个模型,2~6个不等。卷积神经网络(convolutional neural network,CNN)是最常用模型,在4项[13-14,16,18]研究中被采用;逻辑回归(logistic regression,LR)次之,在3项[10-11,21]研究中被采用。纳入的UC预后风险评估模型包括1~10个预测变量,其中常见的预测变量分别为内镜图像、年龄、性别、类固醇类药物使用史等。见表1。
表1 纳入文献的基本特征
纳入研究国家研究设计主要结局指标ML算法总样(例本)量最终预测因子Takenaka等[9]2021日本前瞻性队列研究UC复发DNUC875内镜图像Pang等[10]2023中国回顾性队列研究UC复发RF、LR、DT、292性别、白细胞计数、白细胞百分率、ANN单核细胞百分率、中性粒细胞绝对值、红细胞沉降率Hosseini等[11]2015伊朗前瞻性队列研究UC复发LR157粪便钙卫蛋白水平、年龄、Seo活性指数、既往复发次数Lee等[12]2025韩国前瞻性队列研究UC复发DL432粪便图像Xue等[13]2025中国前瞻性队列研究UC复发CNN264内镜图像、内镜视频Iacucci等[14]2025爱尔兰、西班牙、英国、前瞻性队列研究UC缓解CNN、CLIP、102内镜视频美国、加拿大、日本、CONCH、MLP澳大利亚Iacucci等[15]2025爱尔兰、英国、西班牙、前瞻性队列研究UC缓解NN、DL356内镜图像意大利、比利时Ogata等[16]2025日本前瞻性队列研究UC复发CNN110内镜图像Sano等[17]2025日本回顾性队列研究UC缓解PWL4 003假性息肉、日常生活、类固醇类药物使用史、直肠炎、大便频次、连续性病变、手术、发病年龄、梅奥评分、大便出血情况Mizuno等[18]2022日本回顾性队列研究UC患者回肠贮袋肛门吻CNN43内镜图像合术后发生贮袋炎的风险Takayama等[19]2015日本回顾性队列研究UC患者接受细胞单采术ANN90年龄、性别、粒细胞分离术、白治疗后的远期预后细胞增多症、病情程度、持续时间、临床类型、细胞单采术Sofo等[20]2020美国回顾性队列研究急性重症UC患者全结肠SVM32术前低血清白蛋白水平、术前住切除术后的短期预后和并院时间(>4 d)、输血量( ≥1个单发症风险位)、体温( ≥37.5 ℃)、类固醇类药物使用史Sobotka等[21]2018美国回顾性队列研究UC患者结直肠切除术后LR4 797深静脉血栓形成、肺栓塞、肾功30 d内再入院的风险能不全、伤口感染、尿路感染、败血症/感染性休克、既往存在的充血性心力衰竭Roy等[22]2021美国回顾性队列研究UC患者COVID-19死亡率SVM、SGD、3 058年龄、性别、疾病活动度、吸烟、NC、DTC、药物使用情况、疾病严重程度、NN、NB合并症数量
注 ML:机器学习;UC:溃疡性结肠炎;DNUC:深度神经网络;RF:随机森林;LR:逻辑回归;DT:决策树;ANN:人工神经网络;DL:深度学习;CNN:卷积神经网络;CLIP:对比语言-图像预训练;CONCH:计算病理学的视觉语言基础;MLP:多层感知器;NN:神经网络;PWL:紧凑分段线性;SVM:支持向量机;SGD:随机梯度下降;NC:最近质心;DTC:决策树分类器;NB:朴素贝叶斯。
每项研究采用不同的指标来评估模型的性能,涉及曲线下面积(area under the curve,AUC)、灵敏度及特异度的文献各有9篇;6篇[10,12-15,22]报道准确度;所有模型均经过内部验证,仅2篇[15-16]进行外部验证;模型AUC为0.61~0.999。见表2。
表2 模型的综合性能及验证方式
纳入研究AUC准确度(%)灵敏度(%)特异度(%)验证方式Takenaka等[9]2021DNUC:92.00DNUC:91.30内部验证Pang等[10]2023RF:0.889;LR:0.781;RF:76.4;LR:75.4;DT:RF:78.50;LR:69.60;DT:RF:76.40;LR:77.70;DT:内部验证DT:0.838;ANN:0.80474.5;ANN:82.373.50;ANN:84.2074.50;ANN:82.30 Hosseini等[11]2015LR:0.957LR:80.00LR:97.10内部验证Lee等[12]2025DL:UCEIS>1为0.801;DL:UCEIS>1为84.5;DL:UCEIS>1为74.50;DL:UCEIS>1为95.80;内部验证UCEIS>2为0.860UCEIS>2为81.8UCEIS>2为73.00UCEIS>2为90.50 Xue等[13]2025CNN:图像炎症活动ACNN:图像炎症活动A级CNN:图像炎症活动A级CNN:图像炎症活动A内部验证级为0.999;B级为0.987;为99.0;B级为98.5;C级为97.38;B级为84.56;C级为99.25;B级为99.36;C级为0.964;D级为0.997为98.7;D级为97.6级为86.22;D级为97.74C级为99.90;D级为97.60 CNN:视频炎症活动A级CNN:视频炎症活动A级CNN:视频炎症活动A级CNN:视频炎症活动A级为0.979;B级为0.984;为94.3;B级为93.5;C级为75.56;B级为94.00;C级为98.17;B级为98.00;C C级为0.971;D级为0.991为97.7;D级为97.0为92.31;D级为95.24级为98.10;D级为93.25 Iacucci等[14]2025CNN+CLIP+CONCH+MLPCNN+CLIP+CONCH+MLPCNN+CLIP+CONCH+内部验证多模态模型:89.7多模态模型:89.72MLP多模态模型:89.67 Iacucci等[15]2025NN+DL多模态模型:NN+DL多模态模型:NN+DL多模态模型:NN+DL多模态模型:内部验证、外部验证UCEIS为0.92;组织学缓UCEIS为81.3;组织学缓UCEIS为81.10;组织学缓UCEIS为81.40;组织学缓解指数为0.89解指数为89.6解指数为82.10解指数为91.90 Ogata等[16]2025CNN:0.61内部验证、外部验证Sano等[17]2025PWL:模型注册时为0.628;内部验证注册1年为0.641;注册2年为0.774 Mizuno等[18]2022CNN:0.84内部验证Takayama等[19]2015ANN:96.00ANN:97.00内部验证Sofo等[20]2020SVM:感染性并发症为SVM:感染性并发症为内部验证87.50;大规模感染为25.0083.3;大规模感染为89.20 Sobotka等[21]2018LR:0.71内部验证Roy等[22]2021SVM:65.2;SGD:60.1;内部验证NC:58.9;DTC:67.9;NN:64.7;NB:60.7
注 AUC:曲线下面积;DNUC:深度神经网络;RF:随机森林;LR:逻辑回归;DT:决策树;ANN:人工神经网络;DL:深度学习;UCEIS:溃疡性结肠炎内镜下严重程度指数;CNN:卷积神经网络;CLIP:对比语言-图像预训练;CONCH:计算病理学的视觉语言基础;MLP:多层感知器;PWL:紧凑分段线性;NN:神经网络;SVM:支持向量机;SGD:随机梯度下降;NC:最近质心;DTC:决策树分类器;NB:朴素贝叶斯。
经过PROBAST评估,2篇[10-11]存在低偏倚风险,11篇[10-17,19-21]模型为高适用。见表3。
表3 偏倚风险及适用性
纳入研究研究对象预测因偏素倚风险结局分析研究对象预适测用因性素结局偏倚风险总体适用性Takenaka等[9]2021++-+--++-Pang等[10]2023----+++-+Hosseini等[11]2015----+++-+Lee等[12]2025---++++++Xue等[13]2025+++++++++Iacucci等[14]2025---++++++Iacucci等[15]2025---++++++Ogata等[16]2025---++++++Sano等[17]2025---++++++Mizuno等[18]2022-++++--+-Takayama等[19]2015---++++++Sofo等[20]2020---++++++Sobotka等[21]2018---++++++Roy等[22]2021++++---+-
注 “+”代表高风险/适用性高;“-”代表低风险/适用性低。
纳入文献所用结局指标主要包括疾病复发/缓解、手术及术后并发症及COVID-19相关不良结局,整体偏重疾病活动及短期预后评价,有助于临床决策。但各研究对“复发”“缓解”等结局定义及随访时间不一致,较少以生活质量、功能恢复等患者结局为主要终点。预测因子方面,多数模型以内镜图像为核心变量,并结合年龄、性别、类固醇类药物使用史、并存疾病及实验室指标等常规临床资料,兼顾预测性能与临床可获得性。内镜图像有利于捕捉黏膜微小改变,提高模型灵敏度,但对设备条件和操作规范依赖较大[23];其余预测因子如临床基本资料和实验室检测结果,更易获得,能够为模型提供良好的可操作性,且能在不同层级医疗机构中广泛应用;但其局限性在于可能忽略个体差异,导致一定的偏差。未来临床医师应在充分考虑常规临床因子的基础上,结合先进的影像学技术,提升模型的综合预测能力。
本研究结果显示,12篇[9,12-22]存在高偏倚风险。高偏倚风险论文除都存在未进行校准外,其余主要原因总结为纳入研究对象单一、样本量不足、预测变量定义不明确、结局定义不标准、性能指标单一、缺乏外部验证等。虽然纳入模型的AUC普遍较高(多项研究 ≥0.70),显示出良好的区分能力,但AUC主要用于衡量模型对正负样本的区分能力,并不等同于临床可用性。在实际决策中,灵敏度与特异度的平衡也具备一定的应用价值;高灵敏度模型更适用于早期筛查以避免漏诊,而高特异度模型有助于减少不必要的治疗或检查。本研究中部分AUC表现较高的模型并未同步报告校准度或仅进行内部验证,提示可能存在过拟合。未来可从以下几个层面进行改进:①研究设计层面。应制订统一且可量化的纳入及排除标准、结局判定标准,采用国际公认的评分体系并通过多中心联合建库或数据共享扩大样本规模,减少选择性偏倚。同时,在确定预测因子时,应考虑模型在临床实践中的可获得性,确保所需变量能够在实际环境中被准确、稳定地收集。②数据采集层面。可通过盲法评估、双评估一致性验证及引入客观生物标志物等方式,降低主观判断带来的误差,确保数据质量。③预测因子筛选层面。应根据不同数据维度与特征类型选择合适的筛选方法。例如,LASSO回归可有效处理高维数据并降低过拟合风险,而RF及XGBoost等集成算法更适用于捕捉非线性关系和变量交互效应[24-25]。④模型训练与评估层面。应加强交叉验证、数据增强等策略以降低过拟合,并采用独立外部数据进行验证。同时重视模型预测概率与真实风险之间的一致性评估,通过绘制校准曲线、开展Hosmer-Lemeshow检验、布里尔评分等方式全面评价模型的校准表现。
随着人工智能与医学大数据技术的迅速发展,ML算法在UC预后预测中的应用研究不断增加。对已发表的UC预后预测模型进行系统、客观的质量评估,有助于全面了解现有研究进展与不足,明确未来优化方向。本研究对14个基于ML算法构建的UC预后预测模型进行系统整理与分析,从基本特征,构建情况,模型的变量、性能与验证等多角度开展系统性评价,全面揭示不同算法的应用特点与局限性。同时,本研究基于PROBAST工具对模型偏倚风险进行严格评估,并结合结果提出从研究设计、数据采集、预测因子筛选到模型训练与评估的改进建议,为未来构建更准确的UC预后预测模型提供重要参考。
本研究仍存在一定的局限性:首先,不同研究在特征选择、算法选择、性能评价指标及结局定义等方面存在较大异质性,导致结果难以整合,从而无法进行系统的meta分析。其次,在方法学层面,多数研究未对缺失数据的处理方法进行明确说明,降低研究的透明度与可重复性,限制模型的推广与临床应用价值。未来研究应优先推动数据采集、特征定义和结局标准的统一,减少异质性,并为后续meta分析提供一致的数据支持。同时,研究应明确缺失数据的处理方法,并采用合适的策略(如多重插补法)以提高数据的透明度和可重复性。此外,加强多维度模型评估,不仅依赖传统的性能指标,还应结合临床决策曲线分析等方法,从多个维度全面评估模型的临床实用性与经济性。
本研究纳入14个UC预后风险预测模型的研究。模型总体适用性较好,但普遍存在高偏倚风险。未来研究应着重开展大规模前瞻性队列的多中心外部验证,收集更多层次的变量数据,并结合更先进算法以构建准确性更好、适用性更广的预测模型。
作者贡献声明:王天琪负责研究设计、文献检索、数据提取、统计分析及论文撰写;战俊邑参与文献筛选、数据核对及模型相关内容的专业审阅;赵玉洁协助研究设计、数据分析及方法学把关;赵晓斌参与结果整理与论文修改;朱家琪负责图表制作及参考文献管理;吉诗羽参与数据校对和模型性能复核;王东隶负责研究总体把关、结果解释及论文最终定稿。
利益冲突声明:本文所有作者均声明不存在利益冲突。
[1] VOELKER R. What is ulcerative colitis? [J]. JAMA,2024,331(8):716.
[2] LE BERRE C,HONAP S,PEYRIN-BIROULET L. Ulcerative colitis [J]. Lancet,2023,402(10401):571-584.
[3] RUBIN D T,ANANTHAKRISHNAN A N,SIEGEL C A,et al. ACG Clinical Guideline update:ulcerative colitis in adults [J]. Am J Gastroenterol,2025,120(6):1187-1224.
[4] SINGH S,LOFTUS JR E V,LIMKETKAI B N,et al. AGA Living Clinical Practice Guideline on Pharmacological Management of Moderate-to-Severe Ulcerative Colitis [J].Gastroenterology,2024,167(7):1307-1343.
[5] SANDBORN W J,SANDS B E,VERMEIRE S,et al. Modified Mayo score versus Mayo score for evaluation of treatment efficacy in patients with ulcerative colitis:data from the tofacitinib OCTAVE program [J]. Therap Adv Gastroenterol,2022,15:17562848221136331.
[6] SINGH A,GOYAL M K,MIDHA V,et al. Tofacitinib in acute severe ulcerative colitis(TACOS):a randomized controlled trial [J]. Am J Gastroenterol,2024,119(7):1365-1372.
[7] WARNER E,LEE J,HSU W,et al. Multimodal machine learning in image-based and clinical biomedicine:survey and prospects [J]. Int J Comput Vis,2024,132(9):3753-3769.
[8] MOONS K G M,WOLFF R F,RILEY R D,et al. PRO-BAST:a tool to assess risk of bias and applicability of prediction model studies:explanation and elaboration [J].Ann Intern Med,2019,170(1):W1-W33.
[9] TAKENAKA K,OHTSUKA K,FUJII T,et al. Deep neural network accurately predicts prognosis of ulcerative colitis using endoscopic images [J]. Gastroenterology,2021,160(6):2175-2177.e3.
[10] PANG W,ZHANG B,JIN L,et al. Serological biomarkerbased machine learning models for predicting the relapse of ulcerative colitis [J]. J Inflamm Res,2023,16:3531-3545.
[11] HOSSEINI S V,SAFARPOUR A R,TAGHAVI S A. Developing a novel risk-scoring system for predicting relapse in patients with ulcerative colitis:a prospective cohort study [J]. Pak J Med Sci,2015,31(6):1511-1516.
[12] LEE J W,WOO D,KIM K O,et al. Deep learning model using stool pictures for predicting endoscopic mucosal inflammation in patients with ulcerative colitis [J]. Am J Gastroenterol,2025,120(1):213-224.
[13] XUE P,GUO J,CHE Z,et al. An automatic severity grading system using confocal laser endomicroscopy to evaluate inflammatory activity of ulcerative colitis:a prospective study [J]. Sci Rep,2025,15(1):38008.
[14] IACUCCI M,SANTACROCE G,MESEGUER P,et al.Endo-Histo foundational fusion model:a novel artificial intelligence for assessing histologic remission and response to therapy in ulcerative colitis clinical trial [J]. J Crohns Colitis,2025,19(7):jjaf108.
[15] IACUCCI M,ZAMMARCHI I,SANTACROCE G,et al. A novel switching of artificial intelligence to generate simultaneously multimodal images to assess inflammation and predict outcomes in ulcerative colitis-(with video)[J].Dig Endosc,2025,37(10):1078-1088.
[16] OGATA N,MAEDA Y,MISAWA M,et al. Artificial intelligence-assisted video colonoscopy for disease monitoring of ulcerative colitis:a prospective study [J]. J Crohns Colitis,2025,19(1):jjae080.
[17] SANO M,KANATANI Y,UEDA T,et al. Explainable artificial intelligence for prediction of refractory ulcerative colitis:analysis of a Japanese Nationwide Registry [J].Ann Med,2025,57(1):2499960.
[18] MIZUNO S,OKABAYASHI K,IKEBATA A,et al. Prediction of pouchitis after ileal pouch-anal anastomosis in patients with ulcerative colitis using artificial intelligence and deep learning [J]. Tech Coloproctol,2022,26(6):471-478.
[19] TAKAYAMA T,OKAMOTO S,HISAMATSU T,et al. Computer-aided prediction of long-term prognosis of patients with ulcerative colitis after cytoapheresis therapy [J]. PLoS One,2015,10(6):e0131197.
[20] SOFO L,CAPRINO P,SCHENA C A,et al. New perspectives in the prediction of postoperative complications for high-risk ulcerative colitis patients:machine learning preliminary approach [J]. Eur Rev Med Pharmacol Sci,2020,24(24):12781-12787.
[21] SOBOTKA L A,HUSAIN S G,KRISHNA S G,et al. A risk score model of 30-day readmission in ulcerative colitis after colectomy or proctectomy [J]. Clin Transl Gastroenterol,2018,9(8):175.
[22] ROY S,SHEIKH S Z,FUREY T S. A machine learning approach identifies 5-ASA and ulcerative colitis as being linked with higher COVID-19 mortality in patients with IBD [J]. Sci Rep,2021,11(1):16522.
[23] 王子奇,谭诗云. 内镜成像技术在诊断溃疡性结肠炎中的应用进展[J]. 胃肠病学和肝病学杂志,2024,33(9):1237-1241.
[24] 张沥今,魏夏琰,陆嘉琦,等. Lasso回归:从解释到预测[J]. 心理科学进展,2020,28(10):1777-1791.
[25] 张雨晴,许宁,武云云,等. 应用随机森林分析非吸烟女性肺癌风险因素[J]. 环境卫生学杂志,2022,12(2):80-86.
Systematic review of a prognostic prediction model for ulcerative colitis based on machine learning
王天琪(1999.7-),女,山东中医药大学第一临床学院2023级中医内科学专业在读硕士研究生;研究方向:中西医结合诊疗消化系统疾病。
[通讯作者] 王东隶(1982.3-),男,硕士,副主任医师;研究方向:中西医结合诊疗消化系统疾病。
X