当前位置: 首页 > news >正文

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Lang...

CrossVid论文核心总结与翻译

一、主要内容

  1. 研究背景:现有视频理解基准多聚焦于单视频分析,无法评估多模态大语言模型(MLLMs)的跨视频推理(CVR)能力——即同时理解多个视频、聚合对比跨视频信息的能力。部分多视角基准仅局限于同一场景的不同视角,难以覆盖真实世界中多样复杂的CVR场景。
  2. CrossVid基准构建
    • 数据集规模:包含5331个视频和9015个高质量问答对,涵盖单选、多选、开放式三种题型,平均每个查询需模型理解约770秒的视频内容。
    • 任务体系:采用分层设计,包含4个高级维度(比较分析、时间理解、多视角推理、自由形式问答)和10个具体任务,覆盖32种视频类型,来源包括Animal Kingdom、YouCook2等6个公开数据集。
    • 标注流程:通过半自动化 pipeline 构建,结合Qwen2.5-VL-72B生成帧描述、DeepSeek-R1生成问答对,经10名专家标注者的过滤、优化和质量控制,确保数据可靠性。
  3. 实验与发现
    • 评估了22个开源和闭源MLLMs(参数规模7B-78B),Gemini-2.5-Pro表现最佳,平均准确率仅50.4%,远低于人类的89.2%。
    • 关键结论:闭源模型显著优于开源模型;具备“思考”机制的模型推理性能更优;输入帧数、思维链(CoT)提示对性能有正向影响,但过量无关帧会引入噪声;现有模型的核心缺
http://www.jsqmd.com/news/1277032/

相关文章:

  • AI模型评测失效:高分低能的根源与解决方案
  • 模拟开关超全入门指南:分类、用途、选型参数(附 SPDT/2X/4X 结构详解)
  • 2026年视频提取音频全攻略:从手机到电脑,7种方法手把手教你
  • 日本麻将助手mahjong-helper:终极智能分析工具,快速提升雀魂和天凤胜率
  • 2026年紫外光固化原位修复/拉入式内衬/非开挖CIPP软管供应商:不用挖路修下水管,市政污水管道耐酸碱内衬修复厂家实力榜 - 品牌发掘
  • LlamaIndex与RAG技术实践:高效构建文档问答系统
  • Sunshine游戏串流:打造跨设备无缝游戏体验的终极方案
  • TMS320VC5501/5502 DSP EMIF时序配置详解:从原理到实战
  • OpenCV C++基于CNN模型识别单个字符(OCR)
  • 【保姆级教程】RTX 4090 部署 DeepSeek-V4-Flash 全攻略(INT4 量化 + 128K 上下文)
  • 瑞德克斯平台:更谨慎的使用者更在意的市场覆盖,这里做个路径归纳
  • 电销机器人软件合法吗?全流程法律边界、必备合规条件逐条解读
  • DM8 物理备份还原完整入门教程(disql+DMRMAN 实操)
  • 戴森球计划工厂蓝图完全指南:从新手到专家的捷径
  • Windows WalletService 本地提权漏洞曝光:普通用户秒变 SYSTEM,PoC 已公开
  • 2026年免费录音转文字在线工具实战攻略:5种方法从入门到精通
  • 教育平台视频保护体系深度解析:从HLS分片加密到DRM版权防护
  • 抖音下载器终极指南:如何免费批量下载无水印视频的完整教程
  • Claude Code到Python的记忆模块与上下文工程改造实践
  • 持续学习与情景记忆融合:解决AI灾难性遗忘的新方法
  • 龙芯3B6000安装Docker 29.5.1:二进制部署指南与云原生实践
  • 2026指南:车间降温设备安装公司及环保节能通风解决方案选购框架 - 品牌发掘
  • 体内CAR-T疗法中包装细胞共表达CAR蛋白的难题何解?
  • 从海外留学生求职变化,看蒸汽教育的业务发展路径
  • 【学习笔记】Harness到底是什么
  • 理解 Prefill Decode:AI 回答慢,慢在输入还是输出?
  • RF-DETR + OC-SORT 多目标跟踪实战:遮挡场景下的轨迹稳定性优化
  • 2026年录音转文字免费工具推荐:电脑手机无时长限制的软件盘点
  • 智能体构建实战:从LLM选型到部署优化
  • AI 导出鸭一站式处理:豆包复制到 word 格式问题快速根治方案