当前位置: 首页 > news >正文

从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手

从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手

【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner

bert-portuguese-ner是一个基于BERT架构的葡萄牙语命名实体识别(NER)模型,专为处理葡萄牙语档案文献设计。它能够精准识别文本中的日期、职业、人物、地点和组织等关键实体,为葡萄牙语文本分析提供强大支持。

🌟 模型核心优势

高准确率的实体识别能力

该模型在评估集上达到了97.00%的准确率93.12%的F1分数,能够有效识别以下5类实体:

  • B-Data(日期)和I-Data(日期内部)
  • B-Local(地点)和I-Local(地点内部)
  • B-Organizacao(组织)和I-Organizacao(组织内部)
  • B-Pessoa(人物)和I-Pessoa(人物内部)
  • B-Profissao(职业)和I-Profissao(职业内部)

专为葡萄牙语优化

基于neuralmind/bert-base-portuguese-cased预训练模型微调,针对葡萄牙语语法特点和档案文献领域进行了专项优化,词汇表规模达29794个,支持葡萄牙语特有词汇和拼写。

🚀 快速安装指南

1. 克隆项目仓库

git clone https://gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner cd bert-portuguese-ner

2. 安装依赖环境

确保已安装Python 3.7+,然后安装必要依赖:

pip install transformers==4.10.0.dev0 torch==1.9.0+cu111 datasets==1.10.2 tokenizers==0.10.3

💡 模型使用教程

加载模型和分词器

from transformers import BertTokenizer, BertForTokenClassification tokenizer = BertTokenizer.from_pretrained("./") model = BertForTokenClassification.from_pretrained("./")

实体识别示例

text = "João Silva trabalhou na Universidade de Lisboa em 2020." inputs = tokenizer(text, return_tensors="pt") outputs = model(**inputs) predictions = outputs.logits.argmax(dim=2) # 将预测结果转换为实体标签 id2label = model.config.id2label tokens = tokenizer.convert_ids_to_tokens(inputs["input_ids"][0]) for token, prediction in zip(tokens, predictions[0]): if token not in ["[CLS]", "[SEP]", "[PAD]"]: print(f"{token}: {id2label[prediction.item()]}")

📊 模型性能表现

关键评估指标

  • 准确率(Accuracy):97.00%
  • 精确率(Precision):91.47%
  • 召回率(Recall):94.83%
  • F1分数:93.12%

训练过程表现

训练轮次训练损失验证损失F1分数
1-0.14380.9148
20.24540.12220.9196
30.05260.10980.9312
40.03720.11400.9312

⚙️ 模型配置详解

核心参数

  • 隐藏层大小:768
  • 注意力头数:12
  • 隐藏层层数:12
  • 最大序列长度:512
  • 优化器:Adam(学习率2e-05)

实体标签映射

完整的实体标签定义可在config.json中查看,包含11种标签类型,其中以B-开头的表示实体开始,I-开头的表示实体内部,O表示非实体。

📚 数据集来源

模型训练数据来自葡萄牙档案文献标注语料库,可通过http://ner.epl.di.uminho.pt/获取完整数据集。该语料库包含大量历史档案文献,标注精细,适合葡萄牙语NER任务训练。

📄 引用与致谢

如果使用本模型,请引用以下论文:

@Article{make4010003, AUTHOR = {Cunha, Luís Filipe and Ramalho, José Carlos}, TITLE = {NER in Archival Finding Aids: Extended}, JOURNAL = {Machine Learning and Knowledge Extraction}, VOLUME = {4}, YEAR = {2022}, NUMBER = {1}, PAGES = {42--65}, DOI = {10.3390/make4010003} }

模型基于neuralmind/bert-base-portuguese-cased预训练模型开发,感谢原作者团队的贡献。

🎯 应用场景

  • 葡萄牙语历史文献数字化处理
  • 档案管理系统实体提取
  • 葡萄牙语新闻自动摘要
  • 学术论文实体标注辅助工具
  • 多语言NER系统构建组件

【免费下载链接】bert-portuguese-ner项目地址: https://ai.gitcode.com/hf_mirrors/lfcc/bert-portuguese-ner

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

http://www.jsqmd.com/news/1390179/

相关文章:

  • 解锁Pixelarticons全部4400+图标:许可证激活与升级教程
  • 2026东莞高速服务区充电桩回收哪家好?这份优选指南请收好。 - geo交流
  • WinDynamicDesktop自定义动态桌面主题:从原理到实战制作全指南
  • SpringBoot餐厅食材溯源系统设计与实现:技术栈、背景意义与核心代码
  • 局域网内Windows 10远程连接Windows 7:RDP协议原理与实战设置详解
  • 2026年白银整厂拆除回收优选指南:如何甄选靠谱合作方? - geo交流
  • 为什么开发者都在玩gti?5个让Git更有趣的理由
  • RL即服务:解锁新一轮自主浪潮
  • 计算机组成原理核心考点精讲:从冯诺依曼到流水线实战
  • 虚拟电厂入网前,先回答一个残酷问题:你的数据能撑过一次断网吗?
  • 从零到一上手 scrcpy:把安卓手机屏幕投到电脑的免费神器
  • 5分钟快速上手:XUnity自动翻译器终极指南
  • springboot懂得网小程序的设计与实现
  • 深入解析中国建设银行门户网站的功能升级与用户体验优化
  • 服装网站建设目标解析:从流量转化到品牌塑造的实战指南
  • springboot东财投资咨询管理系统设计实现
  • 用两行 JSON 替换你的 ILM 策略:数据流生命周期新增冻结层支持
  • 2026年潜山超市拆除回收优选指南:从询价到清场一步到位 - geo交流
  • 厦门橄榄网站建设:在流量为王的时代,如何为企业打造一套真正能落地的数字门面
  • 深度学习GPU显存优化:从CUDA OOM错误诊断到混合精度训练实战
  • 大端与小端:字节序原理、检测与跨平台数据交换实战
  • AI编码工程化实践:Skill工作流解决TypeScript项目四大痛点
  • 别等断网才后悔:用 npx skills 生成离线帮助文档,命令手册随手可得
  • 编程命名规则详解:驼峰、帕斯卡、蛇形与烤串命名法
  • 机器学习速查手册:斯坦福CS 229整套知识点,7份PDF帮你从“学过“到“会用“
  • 从源码到部署:Qwen3-VL-8B-Instruct-w4a16-llmcompressor-v0.12.0完整技术手册
  • M5 MacBook Air 32GB本地运行ddtree-mlx决策树模型实测与MLX框架解析
  • 揭秘福建漳州网站建设费用:从几百到几万到底差在哪?老板们必看避坑指南
  • 红外干涉法测量碳化硅外延层厚度:从物理建模到Python反演求解
  • RQShineLabel:复刻Secret App丝滑文字动画的终极iOS组件