NeurlPS 2025 | CHOICE:大型视觉-语言模型的遥感能力评估
文章目录
- 1.论文信息
- 2.论文主要贡献
- 3.论文创新点
- 4.研究方法
- 4.1 总体概览
- 4.2 层次能力分类法
- 4.2.1 感知
- 4.2.2 推理
- 4.3 构建CHOICE
- 5.实验验证
- 5.1 主要结果
- 5.2 细粒度分析
- 5.3 结论
- 6.个人声明
1.论文信息
- 论文题目:CHOICE: Benchmarking the Remote Sensing
Capabilities of Large Vision-Language Models - 论文作者:Xiao An, Jiaxing Sun, Zihan Gui, Wei He
- 发表单位:武汉大学测绘遥感信息工程国家重点实验室
- 发表会议:NeurlPS 2025
- 代码链接:https://github.com/ShawnAn-WHU/CHOICE
2.论文主要贡献
- 构建了系统性的遥感VLM能力评测体系
- 构建大规模、高质量的遥感VLM Benchmark数据集
- 建立了更加标准客观的评价体系-Multiple Choice Questions,而不是让模型自由生成答案(开放式VQA)
- 提出了QAcc+SAcc的双层评价指标
- 系统评测了大量视觉语言模型
3.论文创新点
- 提出层次化的遥感VLM能力体系
- 提出大规模、独立构建的遥感VLM评测数据
- 提出客观统一的MCQ评价范式
4.研究方法
4.1 总体概览
表1:CHOICE与现有数据集及基准的比较。“All-new”表示该数据集或基准是否排除了公开可用的数据集,并未参与视觉语言模型(VLMs)的训练。“Dimension”指细粒度评估能力的数量。缩写说明:O表示光学图像;MI表示多图像;V表示视频;BT表示双时序;MT表示多时序;MCQ表示多选题;FF表示自由形式;BBox表示边界框;Seg表示分割掩码。
首先指出了当前遥感领域视觉语言模型评估的局限性:
- 范围分离,每个数据集仅针对一项特定能力
- 评估体系碎片化,任务维度分类粗略
- 数据泄露导致的非客观性
CHOICE:
- 首个提出遥感能力层次化和客观评估的基准
一级能力:感知、推理–>6个二级维度–>23个三级叶任务 - 涵盖大多数关键的下游问题
9407道多选题(MCQs)、23个任务、600个视觉定位问题 - 有一排除了任何公开可用的数据集
采用三种方法构建问题:标签驱动、模型驱动、人机协同
图1:(左)CHOICE的层次能力分类法,重点聚焦于感知与推理能力,分为6个二级维度和23个三级任务。 (右)主流VLMs在6个二级能力维度上的评估结果。每个圆圈由三条灰色线分割,按面积从大到小依次对应通用领域开源VLMs、RSVLMs和专有VLMs。
4.2 层次能力分类法
4.2.1 感知
遥感的三个感知层级:
- 图像级理解:粗略、全面的解读
场景分类SC、地图识别MR、图像描述IC、图像质量IQ、图像模态IM - 单实例识别:精确识别和定位
地表识别LR、对象存在OP、对象定位OL、对象计数OC、属性识别AR、视觉定位VG、幻觉检测HD - 跨实例辨别:多个对象之间进行比较或变化的分析
属性比较AC、空间关系SR、变化检测CD、指称表达分割RES
4.2.2 推理
标签:B图2:来自6个L-2能力的CHOICE示例。
4.3 构建CHOICE
多源遥感数据采集 → 全球范围数据覆盖 → 三种问题构建方式 → 形成不同类型的视觉理解问题 → 人工质量控制 → 得到最终 CHOICE Benchmark → 用于 VLM 能力评测
5.实验验证
5.1 主要结果
表2:L-2维度的评估结果。ILC表示图像级理解;SII表示单实例识别;CID表示跨实例辨别;AttR表示属性推理;AssR表示评估推理;CSR表示常识推理。最佳(次佳)结果以粗体(下划线)标出。
表3:推理的细粒度评估结果。TP 表示时间属性;PP 表示物理属性;EA 表示环境评估;RA 表示资源评估;DD 表示灾害判别;GD 表示地理空间确定;SI 表示情境推断。最佳(次佳)结果用粗体(下划线)表示。
大多数通用VLMs的准确率低于70%,而大多数RSVLMs的准确率低于50%,更复杂的遥感场景和局部目标的感知能力弱。
5.2 细粒度分析
表4:感知任务的细粒度评估结果。采用的缩写:IM 表示图像模态;IQ 表示图像质量;MR 表示地图识别;SC 表示场景分类;IC 表示图像描述;LR 表示地标识别;OC 表示物体计数;OL 表示物体定位;OP 表示物体存在;AR 表示属性识别;VG 表示视觉接地;HD 表示幻觉检测;AC 表示属性比较;SR 表示空间关系;CD 表示变化检测。
专有视觉语言模型在遥感任务中无明显优势
5.3 结论
- VLM在细粒度感知方面存在困难
- 推理能力是VLM的瓶颈
- 通用领域VLM更倾向于避免模型幻觉
6.个人声明
本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。
