DOI:10.20047/j.issn1673-7210.25101753
中图分类号:R241
王坤宁1, 尤旭颖1, 张岱泽1, 于馨雅1, 刘菊2, 袁红霞3, 于志峰4
| 【作者机构】 | 1天津中医药大学研究生院; 2江苏省昆山市中医医院治未病科; 3天津中医药大学脾胃病基础研究中心; 4天津中医药大学中医学院 |
| 【分 类 号】 | R241 |
| 【基 金】 | 河北省中医药管理局科研计划项目(T2025074)。 |
中医四诊(望、闻、问、切)作为中医辨证论治的核心环节,其客观化一直是提升诊断一致性与可重复性、促进中医药客观化与规范化发展的关键瓶颈[1-2]。近年来研究者围绕单模态信息的可量化采集与建模开展大量探索:望诊多以舌象、面象等图像为核心,闻诊以语音等声学信号为主,问诊以症状、体征及病史等文本/结构化信息为载体,切诊以脉搏波等生理信号为代表;相关工作在局部征象识别、特征表征与分类预测等方面取得进展,为四诊信息数字化奠定基础[3-11]。但单模态研究仍存在明显局限:采集设备、环境与标注体系不统一导致数据难共享、结果难复现,且舌象、脉象等对采集条件敏感的模态尤为突出;同时单一指标易受时间、环境与情绪等因素影响而波动,难以体现四诊“互参校正-综合判断-动态修正”的辨证过程,易造成信息割裂与解释链不足。因此,面向更贴近临床流程的病-证联合诊断,亟须整合多源异构信息并开展跨模态协同建模[12]。
在此背景下,随着人工智能算法的持续迭代与多模态传感器技术的飞速发展,多模态数据融合(multimodal data fusion,MDF)为模拟中医师综合运用四诊信息进行临床决策的思维过程提供新的技术条件[13-15]。本文核心旨在探讨如何通过MDF技术,有效整合望、闻、问、切各模态的量化信息,实现从零散的“信息采集”到可验证的“智能辨证”的重要转变,为中医四诊客观化研究提供新的思路与方法。
MDF是指将来源、形式和维度不同的数据进行有机整合,以获取比单一模态更全面、更可靠的信息[16]。在中医四诊客观化研究中,望、闻、问、切各模态分别对应视觉、声学、语言与生理信号,其信息具有显著的异构性与互补性。广义上,多模态数据除四诊信息外,还可纳入体格检查、生命体征、仪器检查(如影像、超声、心电等)及实验室与病理理化指标等客观数据,以更贴近临床病-证联合诊断流程。从信息学角度,多模态融合旨在构建跨模态统一表示并实现协同推理;从中医诊断学角度,四诊合参强调多源信息互参校正、综合判断与动态修正,其信息整合逻辑与多模态融合的“互补建模-信息加权-协同决策”机制高度契合,可为中医四诊多模态研究提供理论依据。
在具体实现上,现有多模态融合主要可分为数据层融合、特征层融合和决策层融合3种典型路径[17]。三者在信息融合的阶段、粒度及复杂度上各具特点,形成由低级到高级的融合体系。
数据层融合是较早阶段的融合方式,指在特征提取之前对多模态原始数据进行配准与联合输入。其关键在于建立跨模态的数据对齐机制,如在同一受试者与同一采集时间点(或同一检查周期)下完成样本级配对,并在需要时进行时间同步、采样率统一与缺失模态标记,从而为后续建模提供一致的数据基础。
数据层融合的优势在于尽可能保留原始信号信息,有利于后续自动学习有效表示。但由于原始数据体量大、噪声与采集差异更易累积,且四诊模态异构导致对齐与统一表示成本高、计算复杂度较大,因此在中医四诊多模态研究中整体应用相对较少,更常见于同质且易对齐的模态组合;多数研究倾向采用特征层或决策层融合。
特征层融合是MDF的关键环节,目标是在特征提取后,将不同模态表示转换为可联合建模的统一表示,并通过交互建模实现跨模态信息互补。
在技术实现上,特征层融合可概括为简单特征融合与交互式深度融合两类。前者包括特征拼接、加权平均、门控等,计算开销较小但难以刻画复杂的模态依赖关系。后者以跨模态注意力网络与多模态Transformer为代表,可自动学习模态间的深层关联,已成为目前主流方向。如Zhang等[18]将使用ResNet18提取的舌像特征与人口学信息、合并症及血液生物标志物等结构化临床特征进行融合,并通过跨模态注意力实现交互加权,用于代谢相关脂肪性肝病群体的冠心病风险分层,显示融合多源临床特征可提升判别性能。Gan等[19]构建舌象图像——文本描述数据集,分别采用Vision Transformer和BERT模型提取图像与文本的深度特征,并以跨模态注意力,以图像特征为查询,文本特征为键和值,完成模态的交互融合,最终用于病理器官分类,性能优于单模态与传统方法。
此外,新兴的图神经网络为“知识-特征”的结构化融合提供新思路[20]。其可通过“症状节点-模态特征-证候标签”的图结构表达中医辨证逻辑。何圆娇[21]提出Deep-Att-Sage模型,将舌象图像与病历文本的初始特征构建为患者图表示并进行图学习,实现疾病诊断并提升准确率。
特征层融合在保留信息丰富性时能学习跨模态关联,是推动中医诊断信息协同建模的重要技术路径。
决策层融合指在各模态或子模态先独立完成识别或分类任务后,再在输出层对预测结果进行整合以获得最终诊断。该方法侧重高层语义如类别概率、风险评分或证据可信度的组合,适用于模态异质性较强、样本规模不均衡或难以进行统一表示学习的场景。
在目前的诊断多模态模型研究中,常见决策层融合包括加权平均、投票及基于贝叶斯推理或Dempster-Shafer证据理论的融合。如杨燕[22]针对冠心病辅助诊断,分别对临床、症状数据与舌图像建立单模态分类器,并对各分类器输出采用加权平均融合,从而提升整体预测性能。除线性加权外,有研究引入证据推理框架以处理多源输出的不确定性与冲突信息,Yang等[23]针对高血压风险预测,先分别基于问诊与脉诊建立独立模型,再在输出层采用动态Dempster-Shafer证据理论对两路预测结果进行融合,从而实现协同决策,五折交叉验证下,其准确率、灵敏度、特异度、F1分别为94.08%、93.43%、96.86%、93.45%。
决策层融合的优势在于实现灵活、便于与专家规则结合,且在模态缺失时易于降级处理;其不足在于整体性能受子模型性能制约,且融合权重与证据度量的稳定学习仍是研究重点。
面向病-证联合诊断的多模态研究,应在采集、预处理、标注与对齐环节建立可复用标准:采集阶段尽可能统一设备与关键参数,并规范光照/色彩校正、体位与采集时间窗、采样频率;同时设置质量控制流程,筛查噪声、遮挡与异常值。预处理阶段应统一感兴趣区裁剪、信号滤波与文本编码规则;标注阶段建议采用分层标签体系覆盖病名、证候、兼证与严重程度;并建立跨模态对齐与缺失处理机制(时间同步、患者级ID对齐、缺失掩码/插补)。其中舌象、脉象等对采集条件敏感的模态应优先推进一致化控制。
不同模态对病名诊断与证候辨识的贡献随任务与其他而变化,需建立可解释的评估框架。权值设定可来自专家先验、数据驱动(注意力/门控/动态加权)或两者结合;模态贡献可通过消融实验、重要性分析与跨中心外部验证加以检验。临床价值评估除准确率、曲线下面积等综合指标外,还应报告灵敏度、特异度与一致性等关键指标,并结合可解释结果说明模型如何体现四诊合参的协同作用。
综上所述,MDF技术为中医四诊客观化提供系统化的研究框架,是推动中医辨证思维数字化的重要技术路径。目前研究以特征层融合和决策层融合为主导,前者侧重于挖掘模态间的深层关联,后者侧重于高层语义的协同决策。
随着人工智能、传感技术及医学信息学的快速发展,MDF已逐步应用于中医四诊客观化的多个方向,主要涉及以舌象为主的图像信息,以脉象为主的生物学信息,以声音闻诊为主的声学信息,以问诊等为主的文字信息等,旨在通过多模态信息的融合实现由单模态识别向综合辨证的拓展。为更贴近临床病-证联合诊断流程,部分多模态系统还纳入体格检查体征、仪器检查、理化指标等文字或图像信息。下文将以四诊模态的联合诊断系统为线索,对代表性研究进行分析与归纳。
望诊与脉诊分别反映人体表征与内在生理功能状态,信息互补,联合有助于提升对涉及气血运行与脏腑功能失调类复杂证候的辨证精度。郭丹丹等[24]采用传统机器学习以舌、面、脉多模态数据构建非小细胞肺癌的中医辨证辅助诊断系统:围绕4种常见证型,采集性别、年龄及面象、舌象、脉象数据建立辨证分类模型,其中面、舌图像以Lab色彩与纹理指标表征,脉象以脉图参数表征,并在融合阶段采用特征拼接形成联合特征向量;研究将数据按8∶2划分训练集与测试集,并在训练集上采用10折交叉验证比较多种机器学习方法,以准确率、灵敏度、特异度、F1及曲线下面积等指标综合评价模型性能,结果显示不同证型的最优曲线下面积为0.796~0.873,其中气阴两虚证曲线下面积可达0.873;进一步变量重要性分析提示,多证型的关键变量以舌质及舌苔颜色、纹理及舌苔面积等舌象指标为主,并辅以面象纹理与脉图参数,提供模态贡献的可解释证据。该研究采用传统机器学习实现舌象、面象与脉象的特征层融合,结果不仅在模型性能上体现出MDF的优势,而且在特征重要性分析中得到中医辨证理论的印证,体现MDF在客观化辨证中的应用潜力。
望诊、闻诊分别从视觉与听觉层面反映个体的精神及生理特征,其联合有助于提高情志类疾病的识别精度。李锦珑等[25]虽不是以中医辨证理论为出发点,其任务与标签体系不属于典型中医病-证框架,但其采用的面部行为与语音信号分别对应四诊中“望”与“闻”的信息形态,因此可作为望-闻联合建模的方法学参考;基于同步获取的面部行为数据与语音信号构建重度抑郁识别模型,研究从72个样本中提取距离、面积和动作单元特征等面部行为特征,以及基频、梅尔频率倒谱系数和强度等语音特征,采用变分模态分解法构建特征集,并在特征层对两模态特征进行拼接形成多模态特征集;随后利用配对样本t检验和最大相关最小冗余算法进行特征选择并使用K近邻、朴素贝叶斯和支持向量机等传统机器学习分类器进行投票决策,实现抑郁分类;以准确率、灵敏度与特异度评价性能,结果显示多模态在男女分组中均优于单模态,男性组和女性组的准确率分别达81.1%和78.7%。该研究在特征层融合面部行为与语音信息,并在决策层通过投票实现结果集成,提供“面部行为-语音”联合建模的可复用流程与评价范式,可为后续面向中医场景的望-闻信息融合研究提供方法学参考。
望诊与问诊分别反映患者的外在表征与主观症状信息,两者结合可实现“形症并参”的综合诊断思路。夏庭伟等[26]以2型糖尿病并发肾病预测为目标,采集患者的西医临床指标、中医证型数据和舌图像,先基于临床综合指标构建基线模型,再将证型数据进行One-hot并与降维后的公共因子融合形成模型二(特征层融合),进一步引入舌图像深度学习单分类器,并在输出层以0.2~0.4的权重系数与模型二输出加权集成得到模型三(决策层融合);模型三取得准确率为88.46%、灵敏度为79.36%、特异度为91.51%,曲线下面积约0.906,显示“证型+舌象”可显著增益预测性能。
Tian等[27]针对糖尿病足风险预测的研究使用TFDA-1等标准光源设备采集舌象并提取客观化舌色指标,同时整合足底硬度与多项实验室指标;模型以ResNet50残差模块提取舌象深度特征,并与结构化临床特征在后续层进行联合建模,可视为在特征层的拼接式早期融合,最终准确率为0.95、灵敏度为0.93,且“纳入舌图像”较“去除舌图像”性能更优,提示舌象在风险分层中具有独立诊断价值。
在更贴近临床多源数据整合的框架下,Zhang等[28]构建自适应加权多模态融合模型用于无创预测冠状动脉显著狭窄,将舌、面图像与超声心动图、实验室生化等指标共同纳入;图像经ResNet50与自注意力提取特征后与处理及筛选后的临床结构化指标输入“自适应加权融合模块”,该模块对各模态特征进行可学习的动态赋权,实现最终分类。属于特征层后期的自适应加权融合。该研究还通过数据消融比较不同模态组合,显示“临床指标+舌象+面像”组合性能最佳,曲线下面积达0.973,且临床指标与舌象的联合带来更显著的性能增益,为模态贡献(权值及诊断价值)评估提供直接证据链。
四诊合参是中医辨证论治的重要诊断原则。随着数据采集与建模方法的发展,相关研究已开始探索对望、闻、问、切信息的联合融合与协同推理。
丁艳等[29]以四诊合参作为多模态融合的理论依据,基于标准化四诊采集设备建立客观化数据库,并采用深度学习实现四诊信息的联合建模,在2型糖尿病血瘀证研究中,作者共采集676例患者四诊客观化数据,经清洗后纳入406例进行分析,并分别对舌诊、脉诊、声诊及问诊开展单模态建模与对比;在多模态建模中,将各模态提取的特征向量与问诊信息在全连接层进行拼接,形成端到端融合模型以完成证候辨识,模型评价采用准确率、灵敏度、精确率与F1等指标,结果显示多模态总体优于单模态,且最优四模态组合(舌诊+脉诊+问诊+声诊)准确率达86.12%,同时给出不同模态组合的系统对照,能为“模态贡献评估”提供直接证据链。
在亚健康肝郁脾虚证研究中,作者同样以四诊客观化数据为基础,采用“各模态特征提取-特征级拼接-端到端分类”的融合范式完成联合诊断建模,结果显示多模态并非“模态越多越好”,其最优组合为舌诊+脉诊+问诊(三模态)准确率为84.00%,而加入闻诊后四模态准确率反降至75.33%[30]。提示四诊联合建模需显式关注不同模态在特定任务或群体下的贡献差异,并通过模态组合对照消融验证权值与诊断价值的合理性。
综上所述,多模态融合能在一定程度上提升中医辨证的准确性与稳定性,实现从单一信息采集向系统性智能辨证的转变。多模态融合技术正推动中医四诊从“感知数字化”向“智能辨证化”转变,相关研究已由实验性验证迈向临床原型阶段。然而,现有研究仍多集中在特定模态组合与算法性能验证,距离临床常规应用仍存在较大距离。
尽管MDF为中医四诊客观化提供新的技术路径,但在理论对接、数据标准化、模型泛化与临床转化等方面仍面临一定挑战。
①理论融合不足与知识表达困难:现有研究多偏重性能优化,中医辨证逻辑(阴阳、气血、脏腑相关等)在模型中的可表达与可验证机制仍不足,导致融合结果难以形成清晰的中医语义解释链。缺乏“中医知识-模态特征-证候标签”的统一表示可降低临床可接受性。近年来,知识图谱等知识工程方法被用于构建概念-关系的可计算表示,为多模态数据与先验知识的对接提供通用支撑,但如何面向辨证任务建立“中医知识-模态特征-证候标签”的统一表示,并在模型中实现可验证的推理与解释机制,仍需进一步研究[31]。②多模态数据标准与共享体系缺失:多模态研究依赖高质量同步采集与标准化标注,但不同团队在设备、环境与证候体系上的差异导致数据可比性与互操作性不足[32]。隐私与伦理限制进一步制约数据共享与跨中心验证,模型易受样本规模与分布偏移影响。建立统一标准与协作共享机制是实现可推广模型的前提。③模型泛化能力与临床适配性不足:多数模型仍停留在实验室验证阶段,性能对特定设备、群体与采集流程依赖较强,跨地区/跨设备迁移易出现偏差[33]。同时,多模态模型复杂度较高,部署与维护成本限制其在基层与移动场景落地。轻量化、可解释与人机协同流程是临床转化的关键支撑条件。
MDF为中医四诊客观化提供可操作的技术框架,并使四诊合参的信息整合过程具备可计算实现路径。未来研究应进一步聚焦标准化采集与标注、跨中心验证、模态贡献评估与可解释性提升,以推动中医病-证联合诊断模型的临床可用性与可推广性。
利益冲突声明:本文所有作者均声明不存在利益冲突。
[1] 李灿东,方朝义. 全国中医药行业高等教育“十四五”规划教材 中医诊断学[M]. 5版. 北京:中国中医药出版社,2021.
[2] 颉浩田,应佳蒙,吴秀艳,等. 人工智能在中医诊法研究中的应用现状及展望[J]. 中华中医药杂志,2025,40(1):93-97.
[3] 陈恩纳,李圣烨,胡毓亲,等. 中医舌诊图像采集与色彩信息分析研究进展[J]. 中华中医药杂志,2024,39(7):3586-3589.
[4] 姜天童,赵宇平,赵玉凤,等. 机器视觉技术在中医智能设备中的应用分析与探讨[J]. 中国中医基础医学杂志,2024,30(3):407-412.
[5] 门韶洋,陈绿洁,黄晓梅,等. 基于深度学习Transformer和迁移学习的声诊体质辨识研究[J]. 世界科学技术-中医药现代化,2025,27(6):1750-1757.
[6] 许子健,傅骞,蒋寅,等. 探究中医嗅诊之源流,初构数智嗅诊之体系[J]. 世界科学技术-中医药现代化,2025,27(10):2790-2799.
[7] 谭施言,曾琼,向红霞,等. 电子鼻联合机器学习对肺结节良恶性及中医证素呼气图谱辨识的单中心观察性研究[J]. 中国胸心血管外科临床杂志,2025,32(2):185-193.
[8] 丛慧源,玄明实,朱丹丹,等. 基于人工智能的中医标准化病人问诊模型开发与应用[J]. 中医教育,2025,44(4):131-135.
[9] 张春柯,郭睿,颜建军,等. 基于脉象信息融合的动脉粥样硬化性心血管疾病发病风险评估模型研究[J]. 中华中医药杂志,2024,39(8):4454-4460.
[10] 任扬帆,高国伟. 传感器在脉诊领域的研究与进展[J].制造业自动化,2023,45(11):50-56.
[11] GU T Y,YAN Z Z,JIANG J H. Classifying Chinese medicine constitution using multimodal deep-learning model [J].Chin J Integr Med,2024,30(2):163-170.
[12] 李红岩,李灿,郎许锋,等. 中医四诊智能化现状及关键技术探讨[J]. 中医杂志,2022,63(12):1101-1108.
[13] 张鹏飞,曾鹏飞,王德贤,等. 智能融合赋能中医四诊合参客观化[J]. 中国中西医结合杂志,2025,45(10):1165-1172.
[14] BESSON C,BAGGISH A L,MONTEVENTI P,et al. Assessing the clinical reliability of short-term heart rate variability:insights from controlled dual-environment and dual-position measurements [J]. Sci Rep,2025,15(1):5611.
[15] 宋逸杰,马素亚,戴亚盛,等. 人工智能辅助中医辨证的关键问题与技术挑战[J]. 中国工程科学,2024,26(2):234-244.
[16] 刘玉梅,王晓峰. 国内多模态研究热点与趋势(2010—2020):基于CiteSpace的可视化分析[J]. 外国语文,2021,37(6):66-74.
[17] 肖雯迪,朱龙,王洋,等. 中医望诊多模态融合技术的应用与思考[J]. 中医杂志,2024,65(17):1741-1746.
[18] ZHANG J J,FENG S,XUE J,et al. AI-driven multimodal fusion of tongue images and clinical indicators for identifying MAFLD patients at risk of coronary artery disease:an exploratory study [J]. ILIVER,2025,4(3):100181.
[19] GAN Q,WANG C,ZHONG Z,et al. Cross-modal attention model integrating tongue images and descriptions:a novel intelligent TCM approach for pathological organ diagnosis [J]. Front Physiol,2025,16:1580985.
[20] 张舒雅,杨涛,胡孔法. 图神经网络在中医诊疗领域的应用思路探析[J]. 中华中医药学刊,2025,43(5):18-21,261.
[21] 何圆姣. 智能中医舌诊和问诊表示学习算法研究[D].天津:南开大学,2022.
[22] 杨燕. 基于舌象客观化的冠心病中西医多模态特征融合证候诊断模型的构建[D]. 北京:北京中医药大学,2023.
[23] YANG J,WANG H,LIU P,et al. Prediction of hypertension risk based on multiple feature fusion [J]. J Biomed Inform,2024,157:104701.
[24] 郭丹丹,石玉琳,春意,等. 基于面象、舌象及脉象的非小细胞肺癌辨证诊断模型研究[J]. 中华中医药杂志,2025,40(7):3804-3809.
[25] 李锦珑,陈琼琼,丁志杰,等. 基于面部行为与语音融合特征的重度抑郁识别[J]. 北京邮电大学学报,2023,46(1):32-37.
[26] 夏庭伟,李炜弘,丁维俊,等. 2型糖尿病并发肾病中西医多模态特征融合预测模型构建[J]. 中华中医药杂志,2022,37(7):4116-4120.
[27] TIAN Z K,WANG D,SUN X,et al. Predicting the diabetic foot in the population of type 2 diabetes mellitus from tongue images and clinical information using multimodal deep learning [J]. Front Physiol,2024,15:1473659.
[28] ZHANG J Y,JIATUO X U,LIPING T U,et al. Construction and evaluation of a predictive model for the degree of coronary artery occlusion based on adaptive weighted multi-modal fusion of traditional Chinese and western medicine data [J]. Digit Chin Med,2025,8(2):163-173.
[29] 丁艳,王烨,刘佳,等. 基于客观化多模态数据融合的T2DM血瘀证诊断模型构建[J]. 中国中医基础医学杂志,2025,31(9):1592-1598.
[30] 丁艳,李阳,王烨,等. 基于客观化多模态数据融合的亚健康肝郁脾虚证诊断模型构建[J]. 中华中医药杂志,2025,40(1):71-76.
[31] 崔好丽,赵震. 多模态知识图谱补全研究综述[J]. 计算机技术与发展,2025,35(8):10-18.
[32] 蔡轶珩,胡绍斌,关静,等. 中医舌诊客观化技术发展分析及应用探讨[J]. 世界科学技术-中医药现代化.2021,23(7):2447-2453.
[33] 耿嘉蔚,田雨,王舒怡,等. 深度学习在中医四诊客观数据一体化集合模式的理论研究[J]. 中华中医药学刊,2025,43(11):21-27,278.
Research progress on objectification of four diagnostic methods of traditional Chinese medicine under multimodal data fusion
王坤宁(1995.10-),女,天津中医药大学研究生院2023级中医诊断专业在读博士研究生;研究方向:中医四诊客观化。
[通讯作者] 于志峰(1967.9-),男,博士,教授,博士生导师;研究方向:中医四诊及其客观化。
X