从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手
从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手
【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner
bert-portuguese-ner是一个基于BERT架构的葡萄牙语命名实体识别(NER)模型,专为处理葡萄牙语档案文献设计。它能够精准识别文本中的日期、职业、人物、地点和组织等关键实体,为葡萄牙语文本分析提供强大支持。
🌟 模型核心优势
高准确率的实体识别能力
该模型在评估集上达到了97.00%的准确率和93.12%的F1分数,能够有效识别以下5类实体:
- B-Data(日期)和I-Data(日期内部)
- B-Local(地点)和I-Local(地点内部)
- B-Organizacao(组织)和I-Organizacao(组织内部)
- B-Pessoa(人物)和I-Pessoa(人物内部)
- B-Profissao(职业)和I-Profissao(职业内部)
专为葡萄牙语优化
基于neuralmind/bert-base-portuguese-cased预训练模型微调,针对葡萄牙语语法特点和档案文献领域进行了专项优化,词汇表规模达29794个,支持葡萄牙语特有词汇和拼写。
🚀 快速安装指南
1. 克隆项目仓库
git clone https://gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner cd bert-portuguese-ner2. 安装依赖环境
确保已安装Python 3.7+,然后安装必要依赖:
pip install transformers==4.10.0.dev0 torch==1.9.0+cu111 datasets==1.10.2 tokenizers==0.10.3💡 模型使用教程
加载模型和分词器
from transformers import BertTokenizer, BertForTokenClassification tokenizer = BertTokenizer.from_pretrained("./") model = BertForTokenClassification.from_pretrained("./")实体识别示例
text = "João Silva trabalhou na Universidade de Lisboa em 2020." inputs = tokenizer(text, return_tensors="pt") outputs = model(**inputs) predictions = outputs.logits.argmax(dim=2) # 将预测结果转换为实体标签 id2label = model.config.id2label tokens = tokenizer.convert_ids_to_tokens(inputs["input_ids"][0]) for token, prediction in zip(tokens, predictions[0]): if token not in ["[CLS]", "[SEP]", "[PAD]"]: print(f"{token}: {id2label[prediction.item()]}")📊 模型性能表现
关键评估指标
- 准确率(Accuracy):97.00%
- 精确率(Precision):91.47%
- 召回率(Recall):94.83%
- F1分数:93.12%
训练过程表现
| 训练轮次 | 训练损失 | 验证损失 | F1分数 |
|---|---|---|---|
| 1 | - | 0.1438 | 0.9148 |
| 2 | 0.2454 | 0.1222 | 0.9196 |
| 3 | 0.0526 | 0.1098 | 0.9312 |
| 4 | 0.0372 | 0.1140 | 0.9312 |
⚙️ 模型配置详解
核心参数
- 隐藏层大小:768
- 注意力头数:12
- 隐藏层层数:12
- 最大序列长度:512
- 优化器:Adam(学习率2e-05)
实体标签映射
完整的实体标签定义可在config.json中查看,包含11种标签类型,其中以B-开头的表示实体开始,I-开头的表示实体内部,O表示非实体。
📚 数据集来源
模型训练数据来自葡萄牙档案文献标注语料库,可通过http://ner.epl.di.uminho.pt/获取完整数据集。该语料库包含大量历史档案文献,标注精细,适合葡萄牙语NER任务训练。
📄 引用与致谢
如果使用本模型,请引用以下论文:
@Article{make4010003, AUTHOR = {Cunha, Luís Filipe and Ramalho, José Carlos}, TITLE = {NER in Archival Finding Aids: Extended}, JOURNAL = {Machine Learning and Knowledge Extraction}, VOLUME = {4}, YEAR = {2022}, NUMBER = {1}, PAGES = {42--65}, DOI = {10.3390/make4010003} }模型基于neuralmind/bert-base-portuguese-cased预训练模型开发,感谢原作者团队的贡献。
🎯 应用场景
- 葡萄牙语历史文献数字化处理
- 档案管理系统实体提取
- 葡萄牙语新闻自动摘要
- 学术论文实体标注辅助工具
- 多语言NER系统构建组件
【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
