AWED-FiNER框架详解:SampurNER_Bengali_MuRIL作为专家检测器的应用
AWED-FiNER框架详解:SampurNER_Bengali_MuRIL作为专家检测器的应用
【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL
SampurNER_Bengali_MuRIL是基于Google MuRIL模型在孟加拉语SampurNER数据集上微调的细粒度命名实体识别(NER)模型,作为AWED-FiNER框架中的专家检测器,专为解决低资源语言的细粒度实体识别挑战而设计。该模型通过EaMaTa框架构建,利用Few-NERD数据集的标签体系,实现对孟加拉语文本中复杂实体类型的精准识别。
什么是AWED-FiNER框架?
AWED-FiNER(Agents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition)是一个创新的多语言细粒度命名实体识别框架,旨在为全球66亿 speakers 提供跨36种语言的实体识别能力。框架的核心组件包括:
- 智能代理(Agents):协调不同语言专家模型的任务分配与结果整合
- 网络应用(Web applications):提供用户友好的交互界面与API服务
- 专家检测器(Expert Detectors):针对特定语言优化的细粒度NER模型,如SampurNER_Bengali_MuRIL
该框架的技术细节在论文《AWED-FiNER: Agents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition across 36 Languages for 6.6 Billion Speakers》中有详细阐述,为多语言NLP任务提供了全新的解决方案。
SampurNER_Bengali_MuRIL模型核心特性
细粒度实体标签体系
基于Few-NERD数据集构建的标签系统,将实体分为8个大类和数十个子类,实现前所未有的识别精度:
- Location:GPE(国家/城市)、水体、岛屿、山脉等
- Person:演员、艺术家/作家、运动员、政治家等职业细分
- ORG:公司、教育机构、政府组织、媒体等
- Building:机场、医院、酒店、体育设施等
- Art:音乐、电影、文学作品、绘画等
- Product:飞机、汽车、食品、软件等
- Event:攻击、选举、自然灾害、体育赛事等
- Misc:天文、奖项、生物、疾病等特殊类别
模型配置文件[config.json]中定义了133种实体标签(包括B/I/O标记),完整覆盖了复杂场景下的实体识别需求。
性能表现
在孟加拉语SampurNER数据集上的评估结果显示:
- Precision: 66.54
- Recall: 70.08
- F1 Score: 68.26
这一性能在低资源语言的细粒度NER任务中处于领先水平,证明了模型在处理孟加拉语复杂实体时的有效性。
技术架构
模型基于[google/muril-large-cased]预训练模型构建,采用BertForTokenClassification架构,关键参数包括:
- 隐藏层大小:1024
- 注意力头数量:16
- 隐藏层数量:24
- 词汇表大小:197285
训练过程使用AdamW优化器,学习率5e-5,权重衰减0.01,在64 batch size下训练6个epochs,确保模型充分收敛。
快速开始使用指南
环境准备
首先安装必要的依赖库:
pip install smolagents gradio_client基本使用示例
通过AWED-FiNER工具类加载并使用模型:
from tool import AWEDFiNERTool # 初始化工具,指定模型空间ID tool = AWEDFiNERTool( space_id="prachuryyaIITG/AWED-FiNER" ) # 处理文本并获取实体识别结果 result = tool.forward( text="জুড বেলিংহাম 2023 সালে রিয়াল ম্যাড্রিডে যোগ দিয়েছেন।", language="Bengali" ) print(result)完整项目获取
要获取完整的模型和代码,请克隆仓库:
git clone https://gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL应用场景与价值
SampurNER_Bengali_MuRIL作为AWED-FiNER框架的关键组件,在多个领域具有重要应用价值:
- 多语言内容分析:为跨语言信息检索提供实体级理解
- 社交媒体监控:精准识别孟加拉语社交内容中的人物、组织和事件
- 新闻自动化处理:自动提取新闻文章中的关键实体,支持内容分类与推荐
- 低资源NLP研究:为其他低资源语言的NER模型开发提供参考范式
引用与贡献
如果您在研究中使用了SampurNER_Bengali_MuRIL,请引用以下论文:
@inproceedings{kaushik2026sampurner, title={SampurNER: Fine-Grained Named Entity Recognition Dataset for 22 Indian Languages}, volume={40}, url={https://ojs.aaai.org/index.php/AAAI/article/view/40405}, DOI={10.1609/aaai.v40i37.40405}, number={37}, journal={Proceedings of the AAAI Conference on Artificial Intelligence}, author={Kaushik, Prachuryya and Anand, Ashish}, year={2026}, month={Mar.}, pages={31410-31418} } @misc{kaushik2026awedfineragentswebapplications, title={AWED-FiNER: Agents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition across 36 Languages for 6.6 Billion Speakers}, author={Prachuryya Kaushik and Ashish Anand}, year={2026}, eprint={2601.10161}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2601.10161}, }该项目由Prachuryya Kaushik和Ashish Anand教授共同开发,是SampurNER系列研究的重要组成部分,也是AWED-FiNER多语言实体识别生态的关键一环。更多信息可访问项目的交互式演示空间和GitHub仓库获取。
【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
