当前位置: 首页 > news >正文

【论文学习】MICCAI 2025 || Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准

Gut-VLM

Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models

MICCAI 2025

Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准

构建一个同时保留“模型错误报告、错误位置标签和专家修正报告”的胃肠镜图文数据集,并让视觉语言模型学习发现和纠正自己的幻觉。

幻觉是指:模型生成的描述看起来合理,但与图像中的真实医学内容不一致。

例如,一张正常幽门图像,模型可能生成:图像中央存在红色异常。但医学专家查看图像后认为没有这种异常,这句话就是幻觉。

医学场景下这种错误尤其危险,因为模型可能:声称存在实际上不存在的息肉;把正常组织描述为炎症;错误描述病灶颜色或位置;错误判断是否出血、感染;错误描述异物或医疗器械。

Gut-VLM数据集怎么构建:论文使用 Kvasir-v2 胃肠镜数据集中的图像,共标注了1816张

  1. 第一阶段:GPT-4o生成报告

    先让 GPT-4 Omni 根据每张胃肠镜图像生成诊断性描述。

    提示词要求报告覆盖12个医学问题,包括:解剖部位;解剖标志物的颜色和位置;异常区域的颜色和位置;息肉数量;是否存在炎症;是否出血;是否存在异物;是否感染;是否存在医疗器械。

    得到的是未经审核的模型报告,其中可能同时包含正确句子和错误句子

  2. 第二阶段:专家识别和纠正幻觉

    4名胃肠科专家逐句审查GPT-4o报告。

    每个句子被标记为:Non-hallucinated:与图像一致;Hallucinated:包含与图像不一致的信息

    对于错误句子,专家还需要提供正确版本。

    最终,每张图像可能包含:

    胃肠镜图像 ├── GPT-4o原始报告 ├── 每句话的幻觉标签 ├── 专家修正后的句子 └── 完整的专家修正报告

论文发现GPT-4o生成的报告中:

  1. 只有30.39%的报告完全正确;

  2. 1.70%的报告所有句子都包含幻觉;

  3. 67.84%的报告同时包含正确句子和错误句子。

也就是说,接近70%的报告属于这种情况:一部分内容正确 + 一部分内容错误

这比整段报告完全错误更符合真实风险。因为混合型错误看起来更可信,也更难检测。

幻觉感知微调方法:论文比较了两种训练方式

  1. 普通微调

    普通方法只给模型看:

    输入:医学图像 目标:专家修正后的正确报告

    模型只学习“正确答案是什么”,不知道原模型曾经犯了什么错误。

  2. 幻觉感知微调

    作者提出的方法输入:医学图像 + GPT生成的错误报告

    要求模型分两步输出:

    第一步:找出哪些句子存在幻觉; 第二步:把错误报告修正为正确报告。

    模型不仅要学习正确答案,还要学习错误模式以及如何纠正错误

测试了4个开源视觉语言模型:

  1. LLaVA-1.6-7B;

  2. Qwen2-7B;

  3. DeepSeek-7B-VL;

  4. mPLUG-Owl-2B。

训练设置:

  1. Rank-8 LoRA;

  2. 训练5轮;

  3. batch size 8;

  4. 学习率 (1x10^{-4});

  5. A100 GPU。

比较三种模型:

  1. Pretrained:未经微调

  2. Finetuned:普通正确报告微调

  3. Finetuned-H:幻觉感知微调

摘要

视觉语言模型(Vision-Language Models,VLMs)在医学领域正变得越来越普及,它们能够弥合医学图像与临床语言之间的差距。现有VLM在理解医学图像和文本查询,并生成详细的描述性医学诊断报告方面展现出了出色的能力。

然而,幻觉问题仍然是VLM面临的一项重要挑战。这里的“幻觉”是指模型生成与图像视觉内容不一致的描述。这一问题在医学领域可能造成尤为严重的后果。

为了促进胃肠道(Gastrointestinal,GI)图像分析领域的VLM研究,并深入研究模型幻觉问题,我们构建了一个胃肠道图像—文本多模态数据集——Gut-VLM。

该数据集通过一个两阶段流程构建。首先,使用ChatGPT为Kvasir-v2数据集中的图像生成描述性医学报告。在这一过程中,ChatGPT会产生一些带有幻觉或错误内容的文本。随后,在第二阶段,由医学专家对这些报告进行系统审查,识别并纠正其中可能存在的不准确信息,从而保证数据标注具有较高的质量和临床可靠性。

与仅包含描述性文本的传统数据集不同,Gut-VLM还提供了用于标识幻觉句子的标签,以及这些错误句子所对应的修正内容。

减少VLM幻觉的一种常见方法,是在小规模、特定任务的数据集上对模型进行微调。然而,我们利用所构建的数据集采取了一种不同的策略。我们并非仅仅对VLM进行微调,使其生成医学文本报告,而是训练模型检测并纠正幻觉。我们将这种方法称为“幻觉感知微调”(hallucination-aware finetuning)。

实验结果表明,与仅针对描述性报告生成进行微调相比,幻觉感知微调能够取得更好的效果。此外,我们还使用多种评价指标,对多个当前先进的视觉语言模型进行了全面评估,从而建立了一个相应的评测基准。

GitHub代码仓库:bhattarailab/Hallucination-Aware-VLM

图一

图1:上图:数据标注流程概览;下图:[左]来自Gut- VLM 的数据样本,根据提示中提出的问题描述了底层条件,展示了幻觉文本(红色)与修正后的文本(绿色);[右]该数据集中ChatGPT-4 Omni生成响应的统计结果。

上半部分:数据标注流程

Kvasir-v2胃肠镜图像 + 医学提示词 ↓ GPT-4o生成报告 ↓ 得到可能含幻觉的描述 ↓ 胃肠科专家逐句检查 ↓ 修正后的报告 ↓ AI提取结构化诊断问答 ↓ 人工再次检查 ↓ 最终诊断问答标注

左下部分:一个具体错误案例

图像是一张正常盲肠胃肠镜图像 提示词是:请用一段文字描述该图像,并回答下面列出的所有问题 GPT-4o原始输出:这是一张正常盲肠的图像。图像中央存在一个小息肉,颜色偏黄。解剖标志物为结肠内壁,主要呈粉红色。没有观察到炎症、出血、感染、异物或医疗器械。

其中红色文字是幻觉:图像中央存在一个黄色的小息肉 但图像中实际上没有息肉。GPT-4o把正常的阑尾开口错误识别成了息肉。

另一个错误是:解剖标志物是结肠内壁,主要呈粉红色 专家认为这里的解剖标志物描述不准确

专家修正后的报告:这是一张正常盲肠的图像。图像中央可见颜色偏黄的阑尾开口。该图像的解剖标志物是盲肠。未观察到炎症、出血、感染或异物,也未发现医疗器械。图像中不存在息肉。

中下部分:12个诊断问题

GPT-4o生成报告时,需要覆盖12个问题,主要包括:

  1. 图像属于哪一种解剖结构?

  2. 图像中是否存在解剖标志物?

  3. 解剖标志物是什么颜色?

  4. 图像中是否存在异常?

  5. 如果存在异常,异常是什么颜色?

  6. 异常位于图像中的什么位置?

  7. 是否存在息肉?如果有,有多少个?

  8. 是否存在医疗器械?如果有,在哪里、有多少个?

  9. 是否存在炎症?

  10. 是否存在出血?

  11. 是否存在异物?

  12. 是否存在感染?

因此,它不是让GPT-4o自由描述,而是用固定问题约束报告内容。

右上部分:报告级统计

数据集中共有1816份GPT-4o报告。

报告类型数量比例含义
All correct55230.39%所有句子均正确
Hallucinated32约1.76%所有句子都包含幻觉
Mixed Responses123267.84%同时包含正确和错误句子

重要的发现:只有约30%的报告完全正确,约68%的报告是“正确信息与错误信息混合”。

混合型错误最危险,因为整篇报告不是明显胡说,而是:大部分内容正确 + 少数医学事实错误

右下部分:不同医学属性的准确率

柱状图表示GPT-4o在不同类型问题上的准确率,大致为:

  1. 解剖类别:约50%,最低;

  2. 异常或解剖标志物的颜色:约85%;

  3. 位置:约90%;

  4. 医学表现,如炎症、出血、感染:约90%;

  5. 息肉数量:约80%。

这说明错误不是均匀分布的:GPT-4o对颜色、位置和部分医学表现判断较好,但对具体解剖类别的识别明显较差。

http://www.jsqmd.com/news/1301690/

相关文章:

  • 第【95】期--时变信道与射频损伤情况下OFDM系统误码率性能分析--MATLAB完整代码
  • 文心一言长文写作实战突围:24小时极速交付SOP(含金融/法律/教育三大垂直领域定制框架)
  • 南孚传应的充电宝可以上高铁吗?符合铁路携带要求
  • 北京婚纱照:这 10 家口碑机构备婚新人都在选 - 江湖评测
  • 厂房瓦频繁生锈漏水?这款国产防腐隔热瓦,能用二三十年! - 林州鸿途网络
  • 数据驱动与鲁棒优化在电热综合能源系统中的应用
  • C++日期类(Date)实现:从需求分析到运算符重载的完整指南
  • 桂林电子科技大学自考本科报名材料 环境设计专业报考须知 - 湖北找学校
  • 魔兽争霸3终极优化:5分钟让你的经典游戏焕然一新
  • 想自考本科选哪一家好?全新深度测评榜单推荐十勤教育 - 滚动商讯
  • 2026特权安全治理升级:从堡垒机事后追溯到全栈PAM主动防控 - 互联网科技品牌测评
  • 3大STM32温度控制实用方案:从PID算法到工业级完整实现
  • ArkTS 进阶之道(27):状态管理装饰器全景边界——V1/V2 双轨根因 @Component vs @ComponentV2
  • STM32开发环境搭建:Keil与CubeMX实战指南
  • 浏览器端MP4处理终极方案:如何用MP4Box.js实现专业级媒体文件解析与流媒体处理
  • 科技金融热点下的开发者指南:从贵金属到自研芯片的技术关联
  • Matlab高效读取CSV与Excel文件:从基础函数到高级参数与性能优化
  • 如何彻底掌控你的数字记忆:WeChatMsg聊天记录管理终极指南
  • PoeCharm中文版:流放之路角色构建终极指南
  • 企业诚信认证哪里办?线上办理攻略 - 跑政通
  • 七月 AI 工具复盘:留下、卸载与八月尝试计划
  • G-Helper完全指南:华硕笔记本性能调校的轻量级解决方案
  • 为什么 Claude Code 写得快,上线却总翻车?
  • BiliDownloader终极指南:三步搞定B站视频下载,免费且高速
  • 宁波鄞州管道疏通避坑指南 2026年7月本地师傅推荐 - 余生黄金回收
  • 7天构建数据治理自动化系统:OpenMetadata策略引擎完全指南
  • 持续净化贵金属回收市场,21026禹竞名奢汇以全流程溯源模式助力南京市民安心售金 - 资讯洞察员
  • 【单片机毕业设计推荐】基于 STM32/51 单片机的四路温度采集与智能报警系统设计 基于 STM32/51 单片机的多路 DS18B20 温度监测预警装置设计(022804)
  • AutoCAD2013完整安装教程:从下载到激活的详细步骤与常见问题解决
  • 3分钟上手:零成本离线OCR神器,让你彻底告别文字录入烦恼