伊朗科技大学研发出“双眼看片“的AI乳腺癌诊断系统
这项由伊朗科技大学计算机工程学院主导的研究,以预印本形式于2026年7月7日发布在arXiv平台,编号为arXiv:2607.06309,目前正在向Elsevier旗下相关期刊投稿审核中。感兴趣的读者可以通过该编号查阅完整论文。
乳腺癌在全球范围内始终是威胁女性生命的重大疾病之一,而早期发现是提高生存率最关键的一步。钼靶X光片(也就是乳腺X线摄影)是目前筛查乳腺癌最常用的工具。然而,让机器自动读懂这些图像并给出准确判断,一直是医学影像领域的一道难题——病灶对比度低、组织结构复杂、不同类别之间的细微差异难以区分,这些困难叠加在一起,让自动诊断系统的研发举步维艰。
更重要的是,在临床实践中,放射科医生从不只看一张图。每次乳腺检查通常会拍摄两个角度的图像:一张从正上方俯视拍摄,称为"CC位"(颅尾位);另一张从斜侧方拍摄,称为"MLO位"(内外侧斜位)。这两张图好比两个侦探从不同角度观察同一个案发现场,各自捕捉到对方看不到的细节。经验丰富的医生会把两张图结合起来综合判断,但大多数现有的AI系统却只会"单眼看片"——要么只处理一张图,要么把两张图的结果简单叠加,并没有真正实现像医生那样的双视角联合分析。
正是为了填补这个缺口,伊朗科技大学的研究团队提出了一套全新的AI框架,让机器能够像经验丰富的放射科医生一样,真正把两个角度的图像"对话起来",通过结构化的信息交换来提升诊断准确性。
一、为什么"单眼看片"还不够,现有方法又差在哪里
在深入了解这套新系统之前,有必要先理解已有方法的局限性,这样才能体会新方法的价值所在。
早期的深度学习方法主要依靠卷积神经网络(一种擅长识别图像特征的AI结构)逐张处理钼靶图像。这类方法虽然取得了不错的成绩,但本质上是"单眼侦探"——它只能靠一张图判断,无论CC位还是MLO位,都被独立处理,两者之间毫无交流。
后来研究者们意识到这个问题,开始尝试把两个视角的信息融合起来。最常见的做法是"特征级融合"——分别提取CC图和MLO图的特征,然后通过平均、拼接等方式合并。这就好比两个侦探各自写完案情报告后,把两份报告简单装订在一起交给上级,却没有面对面讨论、相互补充细节。信息是合并了,但深层次的关联和互补关系并没有被充分挖掘。
更进阶的方法引入了"注意力机制"(Attention,一种让AI关注图像中重要区域的技术),让两个视角的特征能够相互"参考"对方。然而,这类方法存在两个关键缺陷:第一,信息交换的结果被直接叠加回原始特征上,导致"来自对方视角的信息"和"自己视角的原有信息"混在一起,难以区分,就像两个侦探的笔记被随意写在同一张纸上,混成一团;第二,这种信息交换通常只发生在网络的某一个固定深度,就像侦探只在案件调查的某个特定阶段开了一次会,之后就再也不沟通了,错过了在不同分析阶段不断碰撞、修正的机会。
此外,近年来出现的大型预训练视觉模型(可以理解为经过海量图像训练、具备强大通用视觉理解能力的"超级侦探")虽然在医学影像领域展示出巨大潜力,但已有的提示词学习(Prompt Learning,一种用极少量可训练参数来调整预训练模型行为的技术)方法都是为单张图像设计的,并不支持多视角之间的结构化交互。
二、这套新系统的核心思路:让两个侦探通过专属信使持续对话
伊朗科技大学的团队提出的解决方案,可以用一个形象的比喻来理解。
假设CC视角的侦探和MLO视角的侦探正在调查同一起案件。新方法的核心创新在于:不是让两个侦探把笔记混在一起,而是在两人之间安排了专属的"信使"。这个信使负责提炼一方侦探的关键发现,然后将其以一种独立的、干净的形式传递给另一方,让接收方侦探可以在不破坏自己原有笔记的前提下,参考这些新线索继续深化分析。
更妙的是,这种信使传递不是只发生一次,而是在整个案件分析过程的多个节点上反复进行。每一轮交流之后,双方侦探都能带着更丰富的信息继续深挖,形成一个持续迭代、螺旋上升的分析过程。
在技术层面,整套框架建立在一个被冻结(即不修改其内部参数)的大型预训练视觉模型MedSigLIP之上。MedSigLIP是一个经过大规模生物医学图像-文本配对数据训练的视觉编码器,具备强大的通用医学图像理解能力。整个框架分为两个训练阶段,每个阶段负责不同层面的能力建设。
三、第一阶段:用共享"暗号"让两个侦探说同一种语言
在第一阶段,研究团队引入了"深度共享视觉提示学习"策略。
所谓"提示词"(Prompt),在这里指的是一些可学习的小型向量(数字序列),被插入到预训练模型的输入序列中,就像在原有的图像信息前面加了几个"引导暗语",让模型以特定的方式处理后续信息。这个思路的精妙之处在于:整个预训练模型本身完全不动,只训练这几个小小的提示词,参数量极小,效果却相当显著。
在传统单视角应用中,提示词只针对单张图像设计。伊朗科技大学的团队则将这个思路扩展到双视角场景:CC图和MLO图共享同一套提示词。这就像给两个侦探发放相同的"机密工作手册",确保他们在分析案件时采用同样的框架和视角,使得两人产出的分析报告格式统一、语言一致,为后续的信息交换打下基础。
具体实现上,提示词被分层插入到模型的多个变换层(Transformer Layer,可以理解为模型内部处理信息的多个"分析站")中,每个分析站各有一个提示词。CC图和MLO图分别通过同一个共享编码器处理,得到各自的特征表示,然后拼接在一起,送入一个轻量级的分类器来做出最终判断。在这个阶段,只有提示词和分类器的参数会被更新,预训练模型的全部参数保持冻结不动。
这一阶段的效果在于:通过共享提示词,两个视角的特征表示被"对齐"到同一个语义空间中,就像让两个原本说不同方言的侦探学会了同一种标准语言,为后续的深度对话创造了条件。不过,此时两个侦探的"对话"依然是间接的——他们只是被迫使用了同一套分析框架,并没有直接交流各自发现的案情细节。
四、第二阶段:用专属"信使令牌"实现双向深度对话
第二阶段是整套框架最核心的创新所在。
研究团队在第一阶段训练好的提示词基础上,进一步引入了"跨视角融合令牌"(Cross-View Fusion Token)。这个"令牌"就是前文比喻中的"信使",是一个专门用来携带跨视角信息的独立向量。
具体工作流程如下:在模型处理图像的某个中间节点,CC图的当前特征序列会向MLO图的特征序列发出"关注查询"(这个过程在技术上叫做多头交叉注意力,Multi-Head Cross-Attention,可以理解为CC侦探系统性地翻阅MLO侦探的所有分析记录,找出对自己最有用的信息);反过来,MLO图也同样向CC图发起同样的查询。两次查询的结果都经过"均值池化"(即把所有查询结果取平均,提炼出一个综合摘要)压缩成一个紧凑的"融合令牌"。
这个融合令牌随后被插入到各自视角的特征序列中,与原有的特征一起被后续的模型层继续处理。这就相当于:CC侦探把从MLO侦探那里学到的关键线索写成一张便条,夹在自己的分析记录里,后续每次深入分析时都能参考这张便条;MLO侦探也同样如此。两人都带着对方的线索摘要继续工作,而不是把笔记混在一起搞混。
更重要的是,这种信息交换不只发生一次,而是在模型的多个不同深度节点重复进行。每次交换之后,新的融合令牌都会随着后续的处理层得到进一步精炼,形成一个多轮次、多层次的信息整合过程。这样,浅层提取的纹理细节信息和深层提取的语义概念信息都能得到充分的跨视角交融,就像两个侦探不只在案件调查初期交换线索,而是在每个关键节点都碰头讨论,随时更新彼此的认知。
在第二阶段的训练中,第一阶段学到的提示词被冻结(不再更新),只有新引入的融合模块、视觉编码器的输出处理头(Attention Pooling Head)以及最终分类层的参数被更新。这种分阶段、分层次的训练策略确保了新功能的引入不会破坏之前已经学到的知识。
五、两个真实数据集上的测试:数字背后的故事
研究团队在两个公开的钼靶数据集上验证了这套框架的效果。
第一个数据集是VinDr-Mammo,由越南的研究团队构建,包含5000个四视角检查案例(共20000张图像),每张图像都有BI-RADS分级标注。BI-RADS是乳腺影像报告和数据系统的分级标准,从1级(正常)到5级(高度怀疑恶性),是放射科医生评估乳腺异常的标准化工具。这个数据集存在明显的类别不平衡问题——BI-RADS 1级(正常)的训练样本多达4842个,而BI-RADS 5级(高度可疑恶性)只有78个,相差60多倍,对AI系统的公平性和鲁棒性是极大的考验。
第二个数据集是CMMD(中国乳腺癌数据库),包含来自1775名患者的5202张图像,每张图像都有经病理活检确认的良性或恶性标注,是一个二分类问题。研究团队按患者级别(而非图像级别)划分了训练集、验证集和测试集,确保同一患者的图像不会同时出现在训练集和测试集中,避免数据泄露。
所有图像在送入模型之前都经过了统一的预处理:首先用前景轮廓检测裁剪出乳腺区域,去除大量无关背景;然后用对比度受限的自适应直方图均衡化(CLAHE)增强组织细节的可见度;最后统一调整到448×448像素的分辨率,以匹配MedSigLIP的输入要求。
在评估指标上,团队使用了两个互补的标准:AUC(曲线下面积,衡量模型在不同判断阈值下的综合区分能力,满分为1.0)和宏观F1分数(对每个类别的F1分数取平均,确保少数类别和多数类别对最终评分贡献相同,不让多数类别"刷分")。
六、关键对比实验:层层递进的效果验证
研究团队设计了一系列对比实验,就像一个精心设计的"侦探推理链",逐步排除干扰因素,验证每个设计决策的价值。
最基础的基线是"线性探针"(Linear Probing):完全冻结MedSigLIP,只训练一个简单的线性分类层。CC图和MLO图被独立处理,通过概率平均或取最大值来合并两个视角的预测结果。这个方法代表了"不做任何特殊适配、不做任何视角交互"的最低起点。在VinDr-Mammo五分类任务上,平均融合的线性探针取得了F1分数38.95%、AUC 0.7548的成绩。
加入第一阶段的共享提示词学习之后(但不加入第二阶段的融合模块),F1分数提升到47.66%,AUC提升到0.7887。这说明仅仅通过少量可训练的提示词来引导预训练模型适应钼靶图像领域,就能带来相当显著的改善。
单独使用第二阶段的跨视角融合(但不使用第一阶段的提示词初始化,直接在原始预训练特征上做融合)的成绩是F1分数47.85%、AUC 0.7692,同样优于线性探针,但略低于完整框架。
将两个阶段合并的完整框架,在VinDr-Mammo五分类任务上达到了F1分数50.40%、AUC 0.8090,全面超越所有基线。在CMMD二分类任务上,完整框架同样展现出最高的AUC(0.7161),尽管F1分数(64.96%)略低于"仅使用融合模块"的65.20%,但综合来看性能最为均衡。
研究团队还将方法与DIVF(一种专门为双视角钼靶设计的特征级融合框架)进行了直接比较,测试平台是VinDr-Mammo二分类任务。DIVF的成绩是F1分数75.98%、AUC 0.7486。使用2个融合模块的新方法取得了F1分数77.88%、AUC 0.8593;使用4个融合模块时F1分数进一步提升至79.57%,但AUC略降至0.8313。整体来看,新方法在AUC指标上的优势尤为突出,意味着在区分良性和恶性病变的综合能力上有实质性的提升,AUC的提升幅度超过了0.10。
七、细节决定成败:多项消融实验揭示设计背后的逻辑
为了进一步验证每个设计决策的必要性,研究团队进行了多项"消融实验"——即逐一去掉某个组件,观察性能变化,以此评估该组件的真实贡献。
在融合策略的对比上,团队将"融合令牌"方案与更简单的"残差融合"方案(即将跨视角注意力的输出直接加回原始特征上,不引入独立令牌)进行对比。结果显示,融合令牌方案在VinDr-Mammo五分类任务上比残差融合高出5.22个百分点的F1分数和0.0521的AUC,在CMMD上也有一致的提升。这有力地证明了"让跨视角信息以独立令牌的形式存在、由后续层进一步精炼"这个设计思路的价值。
在融合令牌的聚合方式上,团队比较了最大池化、均值池化和基于注意力的池化三种方案。均值池化(取平均值)在VinDr-Mammo二分类任务上表现最佳,F1分数达到77.88%、AUC 0.8593;最大池化的AUC为0.8227,注意力池化的AUC为0.8475。均值池化简单而稳健,在这个应用场景下胜出。
在视觉编码器输出处理头的微调策略上,团队发现用学习率1e-5对其进行微调能带来最佳性能(AUC 0.8593),优于完全冻结(AUC 0.8338)和极小学习率1e-7(AUC 0.8468)的方案。值得注意的是,即便完全冻结该模块,新方法依然超越了所有对比基线,说明方法的核心优势来自提示词和融合令牌本身,而非依赖于输出处理头的微调。
在提示词深度的选择上,研究团队测试了在MedSigLIP变换器的不同层数插入提示词的效果。实验发现,在第12层时性能达到峰值(F1分数47.66%),在第8层和第16层也有相近的表现,而在第20层、第24层和第27层,性能出现明显下滑。这个结果表明,并非越深的提示词注入越好——在过深的层引入提示词反而可能干扰模型已经形成的高层语义表示,产生适得其反的效果。
在融合模块数量和位置的选择上,团队测试了三种配置:在第18层插入1个融合模块(AUC 0.8441)、在第12层和第23层各插入1个共2个融合模块(AUC 0.8593,最优)、在第12、18、23、26层各插入1个共4个融合模块(AUC 0.8313)。结果清晰地表明:适度间隔的少量融合模块效果最好,过于密集的融合反而可能带来信息冗余或干扰,就像两个侦探如果在每一步都停下来开会讨论,反而会降低整体效率。
八、让AI的判断"可见":用遮挡法理解模型关注什么
研究团队还通过"遮挡敏感性分析"(一种解释AI决策的可视化方法,通过逐区域遮挡图像并观察预测分数的变化,来找出哪些区域对判断最重要)对模型的决策逻辑进行了直观展示。
在论文中呈现的四个典型案例中,可以清晰地看到:对于CC图和MLO图,模型关注的热点区域通常集中在乳腺组织的异常区域,而非背景或正常组织。这种可视化结果为模型的临床可信度提供了一定支撑,说明模型的判断并不是"蒙猜",而是确实在关注医学上有意义的区域。
---
归根结底,这项研究所做的事情,是用一套更聪明的"信息传递机制",让AI在分析乳腺钼靶图像时能够真正模拟放射科医生的双眼联合阅片习惯。不同于过去那些要么完全忽略多视角信息、要么把两张图简单叠加的方法,这套框架让两个视角的信息通过专属的"信使令牌"持续交流,而且这种交流在分析过程的多个阶段反复发生,使得信息整合更加深入和全面。
对于普通读者来说,这意味着未来的AI辅助乳腺癌筛查系统可能会变得更加准确可靠。在资源有限的基层医疗机构中,一个能够像经验丰富的放射科医生一样综合利用多个视角信息的AI系统,有潜力弥补专业医生数量不足的缺口,帮助更多患者在疾病早期得到发现和治疗。
当然,这项研究目前还处于方法验证阶段。数据集的规模和多样性有限(尤其是CMMD数据集中恶性样本和测试集样本数量相对较少),如何在更大规模、更多样化的真实临床环境中保持性能稳定性,仍是后续需要深入探索的问题。此外,当前框架仅使用了双视角信息,如何进一步扩展到包含更多视角(如双侧乳腺的对比)或整合临床文本信息,也是未来值得探索的方向。
有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.06309查阅完整论文,研究团队也已将代码开源,可在GitHub搜索"CrossViewTokenFusion"找到相关资源。
---
Q&A
Q1:BI-RADS分级是什么?AI为什么要学会判断它?
A:BI-RADS是放射科医生用于描述钼靶图像中乳腺异常程度的标准化评分体系,从1级(正常)到5级(高度怀疑恶性),帮助医生统一沟通和制定后续检查方案。让AI学会判断BI-RADS分级,相当于让机器掌握放射科医生的评估语言,从而实现对乳腺异常程度的自动化分级,辅助或加速临床筛查流程。
Q2:跨视角融合令牌和直接把两张图特征加在一起有什么本质区别?
A:直接把两张图的特征加在一起,就像把两个人的笔记混写在同一张纸上——信息合并了,但两份信息互相交缠,之后很难分清哪部分来自哪个视角,也无法进一步单独精炼。融合令牌则是专门创建一个独立的"信使摘要",只携带跨视角的关键信息,插入原序列后由后续处理层继续打磨,两份原始信息保持各自的独立性,效果更加精准。
Q3:为什么不直接微调整个预训练模型,而要把它冻结起来?
A:大型预训练模型的参数数量通常高达数亿甚至数十亿,完全微调需要大量标注数据和极高的计算成本,而医学影像数据集往往规模有限。冻结预训练模型并只训练少量额外参数(提示词和融合模块),能在极低的计算和数据成本下充分利用模型的通用视觉理解能力,同时避免在小数据集上过拟合,是一种兼顾效率与效果的务实选择。
