news 2026/8/3 22:53:28

ICLR 2026 | CARE:以证据扎根的Agent框架迈向多模态医学推理的临床问责

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
ICLR 2026 | CARE:以证据扎根的Agent框架迈向多模态医学推理的临床问责

一句话总结

CARE的真正贡献是把医学视觉证据变成可定位、可过滤、可回流、可复核的模块接口,并在四个公开视觉问答基准上取得稳定增益;但论文证明的是“基准准确率更高且轨迹更可检查”,还没有证明系统具备真实临床环境中的安全性、校准性或责任可追溯性。

创新点

  1. 把“看哪里—精确定位—基于证据回答”拆成可检查接口。论文没有要求同一个通用视觉语言模型同时完成定位和诊断,而是用实体提议、医学指代分割和证据扎根视觉问答三个专家模块连接成链。这样,像素级证据成为下游推理的显式输入,而不只是一个辅助输出。
  2. 把证据设计成三种互补视图。局部放大图提供细节,二值掩码提供位置与空间先验,全局指示图服务于不需要局部定位的问题;当分割置信度不足时,系统可退回全局图像路径。这比把掩码直接覆盖在医学图像上更保守,避免破坏具有物理意义的灰度和对比度。
  3. 针对上游实体集合设计可验证奖励。实体提议并非逐词精确匹配,而是用语义嵌入、全局集合匹配、数量约束、重复惩罚和格式约束共同训练,从而缓解医学同义表达与合成问题之间的域差异。
  4. 显式测量协调器的双向作用。CARE-Coord不只规划工具,还复核思维链与答案是否一致;论文同时报告“错误改对”和“正确改错”的比例,并给出协调器坚持幻觉答案的完整失败链。这一点比只汇报最终准确率更接近对智能体风险的诊断。
  5. 提供同数据微调对照、延迟和人工轨迹评估。论文补充了同一训练数据下的InternVL3对照、逐模块耗时以及推理轨迹人工通过率,使架构收益、工程成本和“问责”主张至少具备初步可检验性。

原文摘要翻译

大型视觉语言模型在多模态医学推理方面已表现出强大能力,但大多数模型仍以端到端黑箱方式运行,偏离临床医生基于证据、分阶段作出判断的工作流程,也妨碍了临床问责。作为补充,专家视觉定位模型能够准确定位感兴趣区域,提供显式且可靠的证据,从而同时改善推理准确性和可信度。本文提出CARE,即以证据扎根的智能体框架推进多模态医学推理中的临床问责。不同于把定位与推理耦合进单个通用模型的现有方法,CARE将任务分解为相互协调的子模块,以减少捷径学习和幻觉:紧凑型视觉语言模型提出相关医学实体;专家实体指代分割模型生成像素级感兴趣区域证据;证据扎根视觉语言模型在完整图像及感兴趣区域提示的共同支持下进行推理。视觉语言模型通过具有可验证奖励的强化学习进行优化,使答案与支撑证据对齐。此外,视觉语言模型协调器负责规划工具调用,并检查证据与答案的一致性,从而提供智能体控制和最终验证。在标准医学视觉问答基准上,无协调器的CARE-Flow相较同规模、参数量为10B的先进方法,平均准确率提高10.9%;加入动态规划与复核后,CARE-Coord进一步提升,并超过重训练先进方法5.2%。实验表明,模拟临床工作流、结合解耦专家与显式证据的智能体框架,可以产生更准确、也更具问责性的医学人工智能。

研究问题

现有医学视觉语言模型通常把图像和问题一次性映射为答案。这个设置有三个结构性缺陷:第一,模型不必指出支撑答案的局部影像证据,因此可能依赖数据偏差或全局捷径;第二,即使模型带有视觉定位头,定位结果也常被当作辅助输出,没有重新输入推理链;第三,把定位、图像操作和推理都塞进单一通用模型后,早期选错区域会沿多轮推理放大,形成带有貌似合理解释的自信幻觉(pp. 1–3)。

论文因此问的不是“能否再训练一个更大的医学视觉语言模型”,而是:能否用任务专用专家把证据产生与答案生成解耦,再由协调器决定何时调用、选择哪种证据、以及是否接受专家答案,从而同时提高准确率和可检查性?这是对旧问题的工作流重构,而不是一个全新视觉问答任务。

需要注意,作者把“临床问责”主要操作化为四件事:显式感兴趣区域、像素级掩码、可见推理轨迹、协调器复核。它们确实改善了审计入口,但与临床治理语境中的责任主体、风险校准、操作规程和患者结局并不是同一概念。

数据与任务定义

三类子任务与输入输出

子任务输入监督或目标输出下游用途
医学实体提议医学图像、用户问题与问题相关的实体集合1–5个器官、结构、病灶或器械名称作为分割文本提示
实体指代分割图像、实体名称医学图像—掩码对像素级掩码与置信度生成局部放大、掩码或全局证据视图
证据扎根视觉问答原图、问题、可选证据视图医学视觉问答答案与推理格式思维链和最终答案静态投票或协调器复核

实体提议任务的关键不是直接回答疾病,而是提出“应该看哪里”。分割任务也不是新病灶检测器,而是在给定实体文本后定位对应区域。最终问答模型仍负责诊断或回答,因此上游证据质量只能降低部分错误,不能替代医学知识与视觉推理。

数据构成与划分

  • • 实体提议:从SA-Med-20M的图像—掩码元数据中清洗出208个医学实体,用GPT-4o合成10,000个训练问题和1,000个测试问题。问题覆盖描述、异常查找、定位、计数、直接分割和裁剪等类型。
  • • 指代分割:使用SA-Med-20M170,000个图像—掩码对训练,在MeCo-G上评价平均 Dice。
  • • 医学视觉问答:把OmniMedVQAVQA-RADSLAKE合并为域内训练数据,总量约10,000。其中OmniMedVQA被作者随机划分为4,000/3,000的训练/测试子集。
  • • 分布外测试:VQA-Med-2019不进入本文问答训练,被作为唯一的分布外数据集。
  • • 模态与器官:四个问答基准覆盖十余种影像模态和多个器官,但每个基准仍是经过题目化和答案化的公开数据,并不等价于连续临床病例。

评测协议与训练暴露

闭合式题目按标准答案计算准确率;开放式题目由GPT-4o对照参考答案作语义判定。附录用三种其他裁判复算,三项开放式数据集的总体标准差为±0.66个百分点,说明主结果大于裁判波动,但不能消除自动裁判偏差。

外部基线的医学训练暴露差异很大:Lingshu使用超过12M条医学数据并接触过VQA-Med-2019等集合,HuatuoGPT-Vision使用超过1M条数据,而CARE的问答训练量约10k。因此跨论文主表适合说明系统定位,不足以单独识别架构因果效应;同数据微调的InternVL3才是更有解释力的对照。

方法主线

机制流程

    1. 输入与候选证据生成。输入:医学图像和用户问题。操作:实体提议视觉语言模型编码二者并生成相关医学实体集合。输出:实体名称被送入指代分割器。
    1. 像素级定位与证据筛选。输入:原图和实体名称。操作:分割器融合图像与文本编码,解码掩码并按置信阈值筛选。输出:局部放大、二值掩码或全局指示被送入证据扎根视觉问答模型。
    1. 证据条件化回答。输入:原图、问题和选定证据。操作:问答模型拼接多图输入并生成推理与答案;静态版本分别处理三类证据后投票。输出:候选答案及推理轨迹被送到协调器或直接汇总。
    1. 规划与复核闭环。输入:工具调用日志、证据和候选答案。操作:动态协调器检查推理—答案对齐,必要时更换实体、重新调用或修正。输出:带有证据与调用轨迹的最终答案。

Figure 2

论文原图编号:Figure 2。CARE的总体架构,展示实体提议、指代分割、证据扎根视觉问答与协调器复核之间的数据流。

实体提议与集合奖励

预测实体集合与真实实体集合分别记为:

作者先计算语义嵌入余弦相似度矩阵,再用 Kuhn–Munkres 算法寻找总相似度最大的全局匹配 :

工程上,这相当于先解决“预测实体如何与真实实体一一配对”,再对配对相似度求均值;它比贪心匹配更难被“只猜中一个实体”投机。总奖励还包含输出数量、重复和标签格式约束:

R_count只允许非空且不超过5个实体,重复项则受到惩罚。这个设计缓解了合成问题与真实提问之间的同义表达差异,但其实体准确率仍是在合成测试集上测得。

论文原图编号:Figure 8。实体提议模型的系统提示;模型同时生成尺寸和位置作为自提示,但下游只使用实体名称,以避免空间幻觉直接进入分割。

指代分割与证据置信度

分割器以SA-Med-2D为骨架,把图像令牌和冻结的BioClinicalBERT文本令牌拼接后送入编码器,再以文本投影作为掩码解码查询。作者只更新图像投影、图像编码相关层和文本投影,模型总规模约600M

掩码概率图 的置信度被定义为:

概率越接近0/1,熵越低,置信度越高。推理时采用 ;低置信掩码不进入证据链,系统退回无局部掩码的行为。这是一个重要的失败隔离接口,但“低熵”只代表分割器自信,不保证解剖学正确。

证据扎根视觉问答

问答模型始终保留完整原图,同时追加一种证据视图:局部放大强调纹理细节,二值掩码强调位置,全局全一掩码告诉模型不要过度局部化。作者没有把彩色掩码直接覆盖原图,因为医学影像灰度和对比度可能具有物理含义。

模型先做监督微调,再用DAPO进行强化微调。奖励由答案正确性、格式与推理长度构成:

长度项鼓励模型展开足够的证据使用过程,但它并不验证推理内容是否忠实;这正是后续协调器还要检查思维链—答案一致性的原因。

论文原图编号:Figure 9。证据扎根视觉问答模型的提示,明确区分局部放大、二值掩码和全局指示三类线索。

静态流程与动态协调

CARE-Flow对三类线索各调用一次问答模型,以多数票产生最终答案;开放式答案分歧时退回表现最好的局部放大视图。CARE-Coord则使用协调器动态决定是否调用实体提议与分割、选择哪种证据,并在最后复核思维链与答案。

作者默认使用GPT-5协调器,并强调协调器只负责规划和一致性复核,至少调用一次本地问答专家,而不是直接凭自身知识回答。不过,协调器仍能改写答案,因此其内部医学知识和偏好无法被实验完全隔离。作者也训练了InternVL3-8B本地协调器,它能选择证据但不能完成同等强度的迭代复核。

下列案例说明协调器如何根据问题性质选择证据:脑叶定位偏向掩码,肺实变偏向局部放大,全局正常性问题可以跳过分割,皮肤病灶偏向局部纹理,而弥漫性肺部模式可利用整体肺掩码。

论文原图编号:Figure 14。脑部病灶定位案例;低于阈值的掩码被丢弃,保留高置信病灶证据用于脑叶判断。

论文原图编号:Figure 15。胸片局部实变案例;协调器把过于泛化的实体改为左肺,并选择局部放大视图。

论文原图编号:Figure 16。全局异常判断案例;协调器直接使用全局证据,跳过不必要的实体提议和分割。

论文原图编号:Figure 17。皮肤病灶案例;分割与局部放大用于突出色泽、边界和纹理细节。

论文原图编号:Figure 18。胸片疾病分类案例;肺掩码提供双肺位置先验,再由问答模型判断影像模式。

关键训练设置

  • • 实体提议模型:InternVL3-2B,视觉编码器与投影层冻结,语言模型使用秩为32的低秩适配;4×A100-80G训练1,200步,约10小时。
  • • 分割模型:600M参数,1×A100-80G训练30轮,约18小时。
  • • 问答模型:InternVL3-2B/8B。监督微调约1–2小时;强化微调在4×A100-80G上约1.5天。最大序列长度为16,384,推理长度奖励上限为200
  • • 所有实验随机种子设为42。不过,当前版本缺少OmniMedVQA随机划分索引和所有自动裁判提示的可下载快照,完全复现仍依赖后续资源发布。

关键结果

主结果与强基线

系统OMVQA-3kVQA-RADSLAKEVQA-Med-2019总体准确率
GPT-574.7363.1967.7562.2066.97
InternVL3-8B-Finetuned91.1361.8676.5353.8070.83
Lingshu-32B83.9764.7582.2558.2072.29
CARE-Flow-B96.1763.6483.2156.6074.91
CARE-Coord-B97.9768.2983.1160.8077.54

最可信的架构对照是同训练数据、同底座微调的InternVL3-8B-FinetunedCARE-Flow-B4.08个百分点,支持“分解式证据管线有独立价值”。相对Lingshu-32B,静态10B系统高2.62个百分点;加入协调器后再增2.63个百分点。不过CARE-Coord-B的总系统还调用专有GPT-5,不能再把它简单描述为纯10B系统。

论文原表编号:Table 13。四个医学视觉问答数据集上的完整主结果,可用于核对所有模型与各数据集准确率。

视觉证据与训练消融

设置域内平均分布外总体
无视觉线索77.956.072.4
三类线索、静态流程81.056.674.9
三类线索、仅协调规划80.853.474.8
三类线索、协调规划与复核83.160.877.5

显式线索使静态流程相对无证据基线提高2.5个百分点,支持“证据回流到问答”这一核心机制。仅有协调规划并未超过静态投票,真正的大幅增益来自规划与复核同时存在;因此不能把主结果简单归因于“智能体多想了几步”。

论文原表编号:Table 2。三类训练线索、协调规划和答案复核的组合消融。

训练策略方面,基础模型为65.3%;单独监督微调为72.5%,单独DAPO71.3%,监督微调加DAPO73.5%,再加长度奖励达到74.9%。长度奖励带来约1.4个百分点,但它可能鼓励更长而非更忠实的推理,必须结合协调器伤害率一起看。

掩码阈值的影响相对温和:8B模型从不加掩码时的74.16%提升到阈值70%时的74.92%,但把阈值设为100%、即几乎完全拒绝局部掩码后下降到72.48%。这说明证据筛选有效,但精确的70%并不是一个跨模型已证实的稳定常数。

论文原表编号:Table 11。分割置信阈值消融;

70%在本文设置中最佳。

上游证据质量

实体提议设置实体准确率掩码 Dice总体问答准确率
GPT-5直接提议40.550.572.7
贪心匹配、二元奖励72.841.075.1
全局匹配、二元奖励74.153.975.7
全局匹配、语义奖励85.273.477.5

这一结果把上游机制与下游表现连接起来:专用实体提议的收益不是只停留在合成实体准确率,而是伴随分割与最终问答同步提高。直接用GPT-5提议实体反而较差,说明通用知识不能替代任务专用接口训练。

论文原表编号:Table 6。实体集合匹配和奖励策略对实体准确率、分割与最终问答的级联影响。

纯强化微调的实体提议模型达到85.28实体准确率与74.91总体问答准确率;监督微调只有76.7074.26。作者据此认为合成问题上的监督微调可能导致域偏差,而直接强化模型已有能力更合适。

论文原表编号:Table 17。实体提议模型的监督微调、监督加强化和纯强化训练对照。

协调器收益、伤害与成本

数据集错误改对正确改错净变化总覆盖率
OMVQA-3k1.90%0.57%+1.33%2.47%
VQA-RAD7.09%4.87%+2.22%11.96%
SLAKE2.77%3.15%-0.38%5.92%
VQA-Med-20197.60%3.60%+4.20%11.20%
总体4.84%3.05%+1.79%7.89%

协调器不是单向安全阀:总体上它净修正1.79个百分点,但3.05%的样本被从正确答案改错,而且在SLAKE上净作用为负。GPT-4oInternVL3-38B协调器分别只有73.3%74.0%,低于74.9%的静态多数投票;协调质量本身是系统瓶颈。

专有协调器的收益伴随显著延迟。CARE-Flow平均调用5.00个工具、耗时7.22秒;GPT-5协调器把调用次数降到2.50,但总耗时增至43.51秒,其中协调器本身占39.32秒。本地8B协调器为6.24秒、准确率75.1%,形成更现实的速度—性能折中。

论文原表编号:Table 12。逐模块推理时间与工具调用次数,显示专有协调器是主要延迟来源。

保守策略要求高置信本地问答答案不被协调器覆盖,但阈值25/50/75的总体结果分别为75.79/76.15/76.45,仍低于完整复核的77.54。这说明模型自报置信度不足以替代对整段推理的检查,也暴露出论文没有建立外部校准器。

论文原表编号:Table 15。基于本地模型自报置信度的保守协调策略未超过完整协调复核。

Table 9 额外基线比较

建议位置:关键结果 / 主结果与强基线
放置原因:该表显示 CARE 在协议不同的 VQA-RAD 额外基线上并非最优。
当前状态:人工视觉复核发现候选主体来自Table 7Table 8Table 9仅保留标题和局部表头,无法安全插入。

人工评估与裁判稳定性

作者从四个测试集只抽取35个已正确回答的案例,由9名医学或影像相关博士/医学背景参与者对推理轨迹作二元判断。CARE-Coord-B通过率为82.14%,高于GPT-4o协调基线的73.94%。它支持“在答案已正确时,轨迹更常被认为符合图像事实”,但不能估计错误答案的危险解释率,评者间一致性也缺少量化结果。

Table 18 推理轨迹人工评估

建议位置:关键结果 / 人工评估与裁判稳定性
放置原因:这是论文对“问责性”最直接的人类证据。
当前状态:人工视觉复核发现候选包含Table 17主体,Table 18只有标题而缺少自己的表格主体;核心通过率已在正文给出。

自动裁判方面,GPT-4oGPT-4o-miniInternVL3-38BInternVL3-78B给出的三数据集总体分数标准差为±0.66个百分点,低于本文主要系统差异。这个实验说明结果对所试裁判相对稳定,但不能证明裁判与临床专家意见一致。

论文原表编号:Table 16。不同自动裁判对开放式问答的评分均值和标准差。

深度分析

真正贡献:证据成为系统接口

这篇论文最值得保留的并不是“又一个医学多智能体框架”,而是它把证据从解释文本提升为模块接口:实体可单独评价,掩码可单独评价,低置信证据可被丢弃,问答模型可比较不同证据视图,协调器编辑也可分解为收益和伤害。相比只要求模型“给出理由”,这些接口更适合工程监控和故障定位。

同数据微调对照提供了最清晰的证据链:底座与数据相近时,单体InternVL3-8B-Finetuned70.83%,静态证据管线为74.91%;无证据消融为72.4%,完整静态线索为74.9%。两组结果共同支持“显式局部证据和任务分解有效”,比与训练暴露不透明的外部模型比较更可信。

为什么结果成立

第一,医学视觉问答的失败常来自观察范围错误,而不是语言知识不足。实体提议先把问题转为解剖或病灶目标,分割再把目标落实为像素区域,等于在问答前加入一个结构化检索阶段。第二,三类视图对应不同题型:局部纹理、空间位置和全局语境不能由单一裁剪统一覆盖。第三,低置信掩码回退机制减少了错误证据强制进入模型的概率。第四,协调器能够修正不适合分割的实体名称,并把问答答案与其推理过程重新对齐。

但这些机制的收益不是无条件的:掩码与局部放大同时输入会从74.9%降到74.4%,较长序列可能稀释有效证据;弱协调器选择错误视图后甚至不如静态投票。换言之,更多证据、更多工具和更多复核都不自动等于更可靠,关键是接口质量和拒绝机制。

“问责”不等于临床安全

论文把准确率、显式掩码、可见思维链和人工轨迹通过率组合成“临床问责”证据。这一操作化有价值,但仍有四层缺口:

    1. 推理轨迹可能是答案后的合理化文本,长度奖励甚至会鼓励模型写得更长;论文没有用因果干预证明轨迹忠实反映决策过程。
    1. 人工评估只看已答对的35个样本,排除了最需要安全审查的错误答案;82.14%不能被解释为全系统临床可接受率。
    1. 参与者具有医学或影像相关博士/医学背景,但论文明确说尚未与有临床经验的专家开展更完整合作,评者间一致性也缺少量化结果。
    1. 视觉问答准确率没有覆盖校准、敏感度、特异度、危急征象漏诊率、分诊后果或患者结局。

因此,标题中的“towards”非常重要:本文是朝可审计医学推理迈出方法学一步,而不是完成临床问责验证。

协调器既是纠错器,也是新的单点风险

附录失败案例最能限定主张。证据扎根问答模型在局部和全局两次调用中都给出“胰腺肿块”,与真实答案胰腺腺癌方向一致;协调器却执意把注意力转向肾脏,最终改写成错误的肾结石。这里不是上游分割错误自然传播,而是复核器否定了较好的专家证据,主动制造新的错误。

论文原图编号:Figure 20。协调器失败链:正确的胰腺肿块判断被复核器反复覆盖为错误肾结石答案。

这个案例与总体3.05%的正确改错率一致,说明系统需要的不只是“更强协调器”,还应有权限边界,例如:协调器只能选择工具和接受/拒绝专家结论,若要改写诊断必须给出可验证的新证据;或者对专家与协调器冲突触发人工复核,而不是默认让语言能力最强的模型拥有最终裁决权。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/3 22:51:01

dealsea有哪些功能?五大维度拆解美国deal站使用攻略

经常有跨境卖家问我:"美国那些deal站到底有哪些值得用?"说实话,如果你只在亚马逊站内做广告,你可能永远体会不到deal站流量的爆发力。我见过一个做小家电的卖家,一款新品在亚马逊上蹲了一个月只出了二十单&a…

作者头像 李华
网站建设 2026/8/3 22:48:13

Rapid-XAML-Toolkit核心功能揭秘:XAML分析与智能生成技术详解

Rapid-XAML-Toolkit核心功能揭秘:XAML分析与智能生成技术详解 【免费下载链接】Rapid-XAML-Toolkit A collection of tools to accelerate XAML development within Visual Studio. These include XAML analysis, XAML generations, plus templates and helpers. …

作者头像 李华
网站建设 2026/8/3 22:47:55

从噪音到宁静:3步打造Windows风扇智能调校方案

从噪音到宁静:3步打造Windows风扇智能调校方案 【免费下载链接】FanControl.Releases This is the release repository for Fan Control, a highly customizable fan controlling software for Windows. 项目地址: https://gitcode.com/GitHub_Trending/fa/FanCon…

作者头像 李华