AutoSchemaKG评估体系详解:知识图谱质量、事实一致性与通用任务性能
AutoSchemaKG评估体系详解:知识图谱质量、事实一致性与通用任务性能
【免费下载链接】AutoSchemaKGThis repository contains the implementation of AutoSchemaKG, a novel framework for automatic knowledge graph construction that combines schema generation via conceptualization.项目地址: https://gitcode.com/gh_mirrors/au/AutoSchemaKG
AutoSchemaKG是一个创新的知识图谱自动构建框架,它结合了通过概念化生成模式的方法。本文将详细解析AutoSchemaKG的评估体系,包括知识图谱质量评估、事实一致性验证以及通用任务性能测试,帮助用户全面了解该框架的可靠性和实用性。
AutoSchemaKG评估体系概述 📊
AutoSchemaKG的评估体系是确保知识图谱构建质量的关键部分,主要包含三个核心模块:知识图谱质量评估(EvaluateKGC)、事实一致性评估(EvaluateFactuality)和通用任务性能评估(EvaluateGeneralTask)。这些模块共同构成了一个全面的评估框架,为用户提供了从多个维度衡量知识图谱质量的工具。
图1:AutoSchemaKG评估体系架构示意图,展示了三个核心评估模块的关系
知识图谱质量评估(EvaluateKGC)
知识图谱质量评估模块(EvaluateKGC)主要关注知识图谱的结构完整性、概念准确性和关系合理性。该模块位于项目的EvaluateKGC/目录下,包含多个子模块,针对知识图谱的不同方面进行评估。
1. 模式质量评估(SchemaQuality)
模式质量评估是知识图谱构建的基础,位于EvaluateKGC/SchemaQuality/目录。该模块通过对比预定义的标准数据集(如FB15kET、FB15kRT、YAGO43kET等)来评估自动生成的模式的准确性。评估指标包括概念覆盖率、关系完整性和层次结构合理性等。
相关代码实现:EvaluateKGC/SchemaQuality/eval.py
2. 三元组准确性评估(TripleAccuracy)
三元组是知识图谱的基本组成单元,其准确性直接影响知识图谱的质量。三元组准确性评估模块(TripleAccuracy)位于EvaluateKGC/TripleAccuracy/目录,通过与人工标注的三元组进行对比,计算准确率、召回率和F1值等指标。
相关代码实现:EvaluateKGC/TripleAccuracy/triple_acc.py
3. 信息保留评估(InfoPreservation)
信息保留评估模块(InfoPreservation)位于EvaluateKGC/InfoPreservation/目录,主要评估知识图谱在构建过程中对原始数据信息的保留程度。该模块通过生成问题和答案的方式,测试知识图谱对原始文本中关键信息的记忆和检索能力。
相关代码实现:
- EvaluateKGC/InfoPreservation/question_generation.py
- EvaluateKGC/InfoPreservation/answer_generation.py
事实一致性评估(EvaluateFactuality)
事实一致性是知识图谱的核心属性,确保知识图谱中的信息真实可靠。AutoSchemaKG的事实一致性评估模块(EvaluateFactuality)基于FELM基准,通过与权威知识库对比,评估知识图谱中事实的准确性。
相关文档:EvaluateFactuality/README.md
该模块的评估流程包括:
- 从知识图谱中提取事实陈述
- 与FELM数据集中的事实进行比对
- 计算事实一致性得分
通用任务性能评估(EvaluateGeneralTask)
为了验证AutoSchemaKG构建的知识图谱在实际应用中的表现,通用任务性能评估模块(EvaluateGeneralTask)使用lm-evaluation-harness框架,在MMLU等基准测试上评估知识图谱增强的模型性能。
图2:Few-shot学习示例,展示了AutoSchemaKG在通用任务评估中的提示设计
1. MMLU评估
MMLU(Massive Multitask Language Understanding)是一个综合性的语言理解基准,包含多个学科领域的问题。AutoSchemaKG通过修改提示和响应过滤方法,提高了MMLU评估的准确性。相关配置文件位于EvaluateGeneralTask/lm-evaluation-harness/lm_eval/tasks/mmlu/generative/_default_template_yaml。
2. 评估结果分析
评估完成后,用户可以使用EvaluateGeneralTask/lm-evaluation-harness/results/subject_score.py脚本计算各学科的得分,全面了解知识图谱在不同领域的表现。
相关文档:EvaluateGeneralTask/README.md
如何使用AutoSchemaKG评估体系 🚀
使用AutoSchemaKG的评估体系非常简单,只需按照以下步骤操作:
1. 克隆仓库
首先,克隆AutoSchemaKG仓库到本地:
git clone https://gitcode.com/gh_mirrors/au/AutoSchemaKG cd AutoSchemaKG2. 知识图谱质量评估
运行知识图谱质量评估脚本:
cd EvaluateKGC python eval.py --data_path <your_data_path> --kg_path <your_kg_path>3. 事实一致性评估
按照FELM基准的要求准备数据集,然后运行事实一致性评估:
cd EvaluateFactuality python eval.py --kg_path <your_kg_path> --felm_data_path <felm_data_path>4. 通用任务性能评估
使用lm-evaluation-harness评估MMLU性能:
cd EvaluateGeneralTask/lm-evaluation-harness python main.py --model hf --model_args pretrained=<your_model> --tasks mmlu总结
AutoSchemaKG的评估体系为知识图谱的构建提供了全面的质量保障,通过知识图谱质量、事实一致性和通用任务性能三个维度的评估,确保了构建的知识图谱既准确又实用。无论是学术研究还是工业应用,AutoSchemaKG都能为用户提供可靠的知识图谱构建和评估工具。
通过本文的介绍,相信您已经对AutoSchemaKG的评估体系有了深入的了解。如果您想进一步探索,可以参考项目中的详细文档和代码实现,开始您的知识图谱构建之旅!
【免费下载链接】AutoSchemaKGThis repository contains the implementation of AutoSchemaKG, a novel framework for automatic knowledge graph construction that combines schema generation via conceptualization.项目地址: https://gitcode.com/gh_mirrors/au/AutoSchemaKG
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
