当前位置: 首页 > news >正文

NeurlPS 2025 | CHOICE:大型视觉-语言模型的遥感能力评估

文章目录

  • 1.论文信息
  • 2.论文主要贡献
  • 3.论文创新点
  • 4.研究方法
    • 4.1 总体概览
    • 4.2 层次能力分类法
      • 4.2.1 感知
      • 4.2.2 推理
    • 4.3 构建CHOICE
  • 5.实验验证
    • 5.1 主要结果
    • 5.2 细粒度分析
    • 5.3 结论
  • 6.个人声明

1.论文信息

  1. 论文题目:CHOICE: Benchmarking the Remote Sensing
    Capabilities of Large Vision-Language Models
  2. 论文作者:Xiao An, Jiaxing Sun, Zihan Gui, Wei He
  3. 发表单位:武汉大学测绘遥感信息工程国家重点实验室
  4. 发表会议:NeurlPS 2025
  5. 代码链接:https://github.com/ShawnAn-WHU/CHOICE

2.论文主要贡献

  1. 构建了系统性的遥感VLM能力评测体系
  2. 构建大规模、高质量的遥感VLM Benchmark数据集
  3. 建立了更加标准客观的评价体系-Multiple Choice Questions,而不是让模型自由生成答案(开放式VQA)
  4. 提出了QAcc+SAcc的双层评价指标
  5. 系统评测了大量视觉语言模型

3.论文创新点

  1. 提出层次化的遥感VLM能力体系
  2. 提出大规模、独立构建的遥感VLM评测数据
  3. 提出客观统一的MCQ评价范式

4.研究方法

4.1 总体概览


表1:CHOICE与现有数据集及基准的比较。“All-new”表示该数据集或基准是否排除了公开可用的数据集,并未参与视觉语言模型(VLMs)的训练。“Dimension”指细粒度评估能力的数量。缩写说明:O表示光学图像;MI表示多图像;V表示视频;BT表示双时序;MT表示多时序;MCQ表示多选题;FF表示自由形式;BBox表示边界框;Seg表示分割掩码。

首先指出了当前遥感领域视觉语言模型评估的局限性:

  1. 范围分离,每个数据集仅针对一项特定能力
  2. 评估体系碎片化,任务维度分类粗略
  3. 数据泄露导致的非客观性

CHOICE:

  • 首个提出遥感能力层次化和客观评估的基准
    一级能力:感知、推理–>6个二级维度–>23个三级叶任务
  • 涵盖大多数关键的下游问题
    9407道多选题(MCQs)、23个任务、600个视觉定位问题
  • 有一排除了任何公开可用的数据集
    采用三种方法构建问题:标签驱动、模型驱动、人机协同


图1:(左)CHOICE的层次能力分类法,重点聚焦于感知与推理能力,分为6个二级维度和23个三级任务。 (右)主流VLMs在6个二级能力维度上的评估结果。每个圆圈由三条灰色线分割,按面积从大到小依次对应通用领域开源VLMs、RSVLMs和专有VLMs。

4.2 层次能力分类法

4.2.1 感知

遥感的三个感知层级:

  • 图像级理解:粗略、全面的解读
    场景分类SC、地图识别MR、图像描述IC、图像质量IQ、图像模态IM
  • 单实例识别:精确识别和定位
    地表识别LR、对象存在OP、对象定位OL、对象计数OC、属性识别AR、视觉定位VG、幻觉检测HD
  • 跨实例辨别:多个对象之间进行比较或变化的分析
    属性比较AC、空间关系SR、变化检测CD、指称表达分割RES

4.2.2 推理


标签:B图2:来自6个L-2能力的CHOICE示例。

4.3 构建CHOICE


多源遥感数据采集 → 全球范围数据覆盖 → 三种问题构建方式 → 形成不同类型的视觉理解问题 → 人工质量控制 → 得到最终 CHOICE Benchmark → 用于 VLM 能力评测

5.实验验证

5.1 主要结果


表2:L-2维度的评估结果。ILC表示图像级理解;SII表示单实例识别;CID表示跨实例辨别;AttR表示属性推理;AssR表示评估推理;CSR表示常识推理。最佳(次佳)结果以粗体(下划线)标出。
表3:推理的细粒度评估结果。TP 表示时间属性;PP 表示物理属性;EA 表示环境评估;RA 表示资源评估;DD 表示灾害判别;GD 表示地理空间确定;SI 表示情境推断。最佳(次佳)结果用粗体(下划线)表示。

大多数通用VLMs的准确率低于70%,而大多数RSVLMs的准确率低于50%,更复杂的遥感场景和局部目标的感知能力弱。

5.2 细粒度分析


表4:感知任务的细粒度评估结果。采用的缩写:IM 表示图像模态;IQ 表示图像质量;MR 表示地图识别;SC 表示场景分类;IC 表示图像描述;LR 表示地标识别;OC 表示物体计数;OL 表示物体定位;OP 表示物体存在;AR 表示属性识别;VG 表示视觉接地;HD 表示幻觉检测;AC 表示属性比较;SR 表示空间关系;CD 表示变化检测。

专有视觉语言模型在遥感任务中无明显优势

5.3 结论

  1. VLM在细粒度感知方面存在困难
  2. 推理能力是VLM的瓶颈
  3. 通用领域VLM更倾向于避免模型幻觉

6.个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。

http://www.jsqmd.com/news/1392277/

相关文章:

  • 【Perplexity手机版生成的表格怎么复制下来】?这个“世纪难题”终于被 AI 导出鸭 终结了
  • OpCore-Simplify 上手实测:把 OpenCore EFI 一键生成从 8 小时压到 40 分钟
  • 2026 年青岛楼宇对讲 梯控 门禁道闸弱电工程施工问答 - LYL仔仔
  • 在Windows电脑上直接安装安卓应用:APK-Installer零基础实战指南
  • 注塑机数据采集联网分析作用
  • 恋活!HF Patch上手指南:一次安装,解决汉化、去码与模组缺失
  • Kubernetes Service 与 Deployment 关联与访问完整演示【20260812】
  • 建站小白必看:到底网站建设用什么程序才能既省钱又专业?揭秘底层逻辑与避坑指南
  • linux权限维持
  • PhotoRec数据恢复完整指南:免费开源工具从误删到分区损坏的全流程自救
  • 免搭建数据库!用几行 Python 代码打造轻量级自选股实时监控系统
  • Windows上3步搞定APK安装:不装模拟器、不敲命令,用开源工具APK Installer直接跑安卓应用
  • 基于微信小程序的在线维修服务平台系统毕业设计项目源码
  • 零基础实现 Windows 全局标题栏毛玻璃特效:DWMBlurGlass 安装与调优完整指南
  • IINA播放器快速上手指南:从安装到进阶,让Mac彻底告别播放难题
  • 2026 少儿线上外教一对一选课观察:跳出国籍执念,学习连续性远比噱头重要
  • 相机缓冲数据三种数据格式(数组、指针new、vector)
  • 多学科优化软件:工程设计的智能加速器
  • 第3篇:企业级CAS单点登录实战-技术架构设计方案
  • 一个关键结果节点怎样完成:AI、专业能力与人机协同的生产结构
  • 3分钟上手BiliTools:B站资源下载的免费跨平台工具箱
  • 远程操作手机的软件 远程app下载
  • Linux初学记第四章--有关库同学的那些事
  • TVA-具身智能最新进展(2):创造力引擎与开放式创新
  • 视频平台有 200 多种识别算法,实际项目到底应该怎么选?
  • C# 析构函数全详解:原理+实战+避坑
  • 2026肇庆自动门、旋转门五金配件去哪采购靠谱? - LYL仔仔
  • [基于AgentEvals的自动化评估-03]全面优化面向LangGraph的轨迹评估
  • Pixelle-Video 全自动短视频引擎指南:零基础 5 分钟生成第一条 AI 视频
  • 从英文劝退到全中文丝滑:Burp Suite 汉化启动器部署手记