会议:MICCAI
年份:2025
英文名字:CLIP-KOA: Enhancing Knee Osteoarthritis Diagnosis with Multi-Modal Learning and Symmetry-Aware Loss Functions
中文译为:CLIP-KOA:基于多模态学习与对称性感知损失的膝骨关节炎诊断增强方法
一、摘要
KL(Kellgren-Lawrence)分级是目前膝骨关节炎严重程度评价中最常用的影像学标准之一,将 OA 分为:KL0, KL1, KL2, KL3, KL4
但是传统 KL 分级高度依赖医生经验,存在明显的:
- 主观性;
- 医生间差异;
- 相邻等级难区分。
论文指出,特别是: KL1↔KL2,这种相邻等级,由于影像差异非常轻微,更容易产生误判。
现有深度学习方法通常采用: X-ray→CNN/Transformer→KL,也就是只利用图像。
作者认为,KL 0–4 不只是五个数字,每一级实际上还有相应的文字定义和疾病严重程度描述。
因此提出 CLIP-KOA,将:图像信息 + 文本分级描述进行联合建模。
同时,膝关节 X 光在左右翻转以后:
OA 的严重程度本身不应该发生改变。
所以作者进一步加入:
- Symmetry Loss;
- Consistency Loss;
让: I和水平翻转后的: IH得到一致的预测结果。
最终 CLIP-KOA 在五级 KOA 分类中达到: 71.86% Accuracy,相比标准 CLIP: 69.50%,提升:
2.36个百分点,并在 KL 2 等中间等级上表现出更明显的改善。
二、创新点
1 将 KL 分级从“数字标签”变成“图像-文本语义匹配”
传统方法通常:Image→0/1/2/3/4,也就是说 KL 只是一个数字类别。
作者认为这种方式没有真正利用:
每一个 KL 等级背后的医学含义。
因此使用 CLIP: Image Encoder和: Text Encoder
分别编码:
- X 光影像;
- KL 等级的文字描述。
例如不是简单使用: Class=2
而是让模型学习类似:
这一等级对应怎样的关节间隙、骨赘和 OA 严重程度描述。
于是模型做的实际上是: Image Embedding↔KL Text Embedding,哪个文本与影像最相似,就预测为哪个 KL 等级。
因此相较普通 CNN:
模型不仅学习“KL2 是类别 2”,还学习“KL2 具体代表怎样的 OA 状态”。
3.2 提出 Symmetry Loss
膝关节 X 光左右翻转以后: I→IH
虽然解剖方向发生变化,但: KL(I)=KL(IH)应该成立。
因此作者同时计算:原图S以及翻转图SH与文本标签之间的相似度。
然后分别计算交叉熵:
最终:
也就是说:
原图要分类正确,翻转后的图也必须分类正确。
3.3 提出 Consistency Loss
Symmetry Loss 只要求:
最终类别正确。
但可能出现原图: P=[0.1,0.1,0.7,0.08,0.02]
翻转图: Q=[0.01,0.20,0.45,0.30,0.04]
虽然两者可能最终都预测 KL2,但概率分布差异仍然很大。
因此作者进一步要求: P≈Q
使用Jensen-Shannon Divergence,计算: Lconsistency=JSD(P∣∣Q)
其中: P=Softmax(S) Q=Softmax(SH)
于是模型不仅要:
预测类别相同
还要:
预测置信度分布也尽可能相似。
因此完整思想是: Prediction Symmetry+Distribution Consistency
三、方法
1、 图像编码
输入一张膝关节 X 光,通过 CLIP 的 Image Encoder得到影像 embedding。
作者使用的是: ViT-B/16作为图像编码器。
2、文本编码
KL 一共有: K=5个等级。每一个等级对应一个文字描述: T={t0,t1,t2,t3,t4}
这些文本经过 CLIP Text Encoder 得到对应 embedding。
因此模型最终有: 5个 KL 文本语义原型。
4.3 Image-Text Similarity
然后计算图像 embedding:xi 与不同 KL 文本 embedding: tj
之间的 cosine similarity:
于是得到:
S∈RN×K
例如某个病例: S=[0.10,0.20,0.60,0.08,0.02]
则模型认为: KL2与该 X 光最匹配。
因此: KL Classification=Image-Text Matching
4、水平翻转
同时对图像Ii进行Horizontal Flip
得到:
然后也经过 Image Encoder:
计算翻转图与五个 KL 文本之间的相似度:
因此每一张训练图像都会产生: S和两套预测。
5、Symmetry Loss
对原图: CE(S,Y)
对翻转图:
两者加起来:
确保I与: IH都能预测成正确 KL。
6、Consistency Loss
将两个 similarity 转化为概率:
计算均值:
然后:
Lconsistency=21DKL(P∣∣M)+21DKL(Q∣∣M)
也就是:
JSD 越小: P≈Q,意味着:
左右翻转前后的模型预测越稳定。
7、最终损失
完整 Loss:
作者设定: λ=10
因此模型同时受到:
- 分类监督 正确识别KL
- 一致性监督 翻转前后保持一致
四、实验
4.1 数据集
作者采用公开的:Knee Osteoarthritis Severity Grading Dataset
包含来自: 4796 participants的膝关节 X 光。,最终处理后共有: 8260 images所有影像统一 resize 为: 224×224,共五个KL等级
论文并不是使用:
患者自己的医学报告。
而是使用:KL等级的标准文字描述
作者利用 Kaggle 中给出的 KL grading description,分别为 Grade 0–4 构造对应文本标签。
所以这里的多模态实际上是: 患者X光+类别级KL描述
而不是: 患者X光+患者临床报告
4.2 结果
五、结论
作者提出:CLIP-KOA,用于膝骨关节炎 X 光 KL 分级。
与传统: X-ray→CNN→KL不同,它采用: X-ray+KL文本描述建立图像-语言多模态表示。
同时利用膝关节 X 光左右翻转后疾病等级应该保持不变这一先验,设计: Symmetry Loss+Consistency Loss
保证: I与IH不仅预测类别相同,而且预测概率分布也保持一致。
最终达到: 71.86% Accuracy,相比 Standard CLIP 69.50%,提高: 2.36%,并且对于 KL2 等中间等级的分类能力明显改善。
作者同时指出,未来还可以继续:
- 使用更加丰富的 KOA 文本描述;
- 对不同 KL 等级进行自适应损失加权;
- 引入患者纵向数据;
- 引入真实临床文本报告;
进一步提高早期 KOA,特别是 KL1 的识别能力。