当前位置: 首页 > news >正文

AA-Omniscience: Evaluating Cross-Domain Knowledge Reliability in Large Language Models

一、文章主要内容总结

本文针对现有大语言模型(LLM)评估多侧重通用能力、忽视跨领域事实准确性与知识校准的问题,提出了AA-Omniscience基准,用于衡量模型的事实召回能力和知识校准水平。

  1. 基准设计核心

    • 涵盖6个经济相关领域(商业、人文社科、健康、法律、软件工程、科学工程与数学)、42个细分主题,共6000道问题,源自权威学术和行业来源。
    • 采用全知指数(Omniscience Index)作为核心指标(范围-100至100),奖励正确答案、惩罚幻觉输出、鼓励不确定时弃权,0分代表正确与错误答案数量持平。
    • 辅助指标包括准确率、幻觉率(尝试回答但错误的比例)和运行成本,全面评估模型实用性。
  2. 关键研究发现

    • 仅3个前沿模型的全知指数得分高于0,Claude 4.1 Opus以4.8分位列第一,多数模型存在事实准确性和知识校准缺陷。
    • 模型性能具有显著领域差异性:Claude 4.1 Opus在法律、软件工程等领域领先,GPT-5.1擅长商业领域,Grok 4在健康和科学工程领域表现最佳。
    • 模型整体智能与事实可靠性无强相关性,大模型规模与幻觉率无必然联系,部分小模型(如NVIDIA Nemotron Nano 9B V2)展现出更优的知识校准能力。
    • 现有评估奖励“猜测”而非“弃权”的机制,是导致模型幻
http://www.jsqmd.com/news/1258118/

相关文章:

  • Rust嵌入式开发实战:M5StickC Wi-Fi空调遥控器完整指南
  • 7天精通:Unlock Music Electron音乐解密工具从入门到实战的完整路径
  • 企业微信回调配置避坑:为何先验证URL再设可信IP是关键?
  • 机械设计进阶:从图纸到卓越产品的系统性思考与实践框架
  • 大模型时代:小白也能掌握的AI应用秘籍,收藏这份进阶指南!
  • 23. CPPM和SCMP哪个对涨薪帮助大 - 众智商学院cppm官方
  • 2026年连云区实惠海鲜馆精选:口碑老店与渔家本味之选 - 装修教育财税推荐2026
  • 如何快速掌握WarcraftHelper:魔兽争霸3终极兼容性解决方案
  • MAA自动公招终极指南:如何实现高效智能的干员招募自动化
  • C++三角形校验和算法:从原理到极致优化的工程实践
  • 基于YOLOv5的焊接缺陷检测系统设计与实现
  • 计算机毕业设计之基于用户体验的潮流玩具交易网站的设计与实现
  • 3个步骤在Windows上实现AirPods完美体验:AirPodsDesktop完整指南
  • 基于Spring Boot的冷链监控平台温控系统毕业设计实战指南
  • 基于YOLO的个人防具检测系统开发与实践
  • Transformer长文本处理:显存与算力优化实战指南
  • TPFanCtrl2:彻底解决ThinkPad风扇噪音的智能温控方案
  • Grok游戏开发工具:从环境配置到项目构建的完整实践指南
  • AI陪伴应用技术架构解析:从Fable 5看多模态交互与商业化挑战
  • 智能体开发平台选型的3个核心维度:不是功能,不是价格,而是这些
  • 2026衢州漏水检测维修本地口碑榜TOP5权威推荐-专业仪器精准测漏-正规防水补漏公司推荐:卫生间/厨房/屋顶/阳台/外墙渗漏水检测师傅上门 - 安佳防水
  • 机械设计实战:从绘图到设计的核心原则与经验细节
  • 小红书内容管理革命:XHS-Downloader让你的创作效率翻倍
  • IDC报告:阿里云稳居中国混合云软件及服务市场第一
  • C++线程安全队列实现与生产者-消费者模型实战
  • 物流数据中台的架构设计:从多源接入到统一指标的数据治理实践
  • CTF杂项入门:从ZIP伪加密破解看二进制文件分析与修复
  • AI重构实战:基于Spec Coding与Codex的前端全栈开发提效
  • LLM项目部署实践:从模型推理到Agent自动化的完整指南
  • AI Agent与终端AI助手:在Xcode中集成Gemini CLI提升开发效率