当前位置: 首页 > news >正文

LLM权重各个文件作用分析(safetensors分片格式)

文章目录

  • 1. 模型架构与核心配置
    • **config.json**
    • **configuration.json (部分模型存在)**
  • 2. 文本生成策略配置
    • **generation_config.json**
  • 3. 分词器(Tokenizer)配置
    • **tokenizer_config.json**
    • **tokenizer.json**
    • **vocab.json / merges.txt**
    • **special_tokens_map.json**
  • 4. 权重索引与元数据
    • **model.safetensors.index.json (或 pytorch_model.bin.index.json)**
    • **adapter_config.json (LoRA/微调场景)**
  • 总结对照表

1. 模型架构与核心配置

config.json

作用:定义模型的核心架构参数,是加载权重时最关键的配置文件。
关键内容:包含隐藏层大小 (hidden_size)、注意力头数 (num_attention_heads)、层数 (num_hidden_layers)、词汇表大小 (vocab_size)、激活函数 (hidden_act) 等。对于 MoE 模型,还包含专家数量 (n_routed_experts)、路由策略等参数。
注意:在昇腾适配或量化场景中,该文件可能需要修改以支持特定硬件特性(如添加 quantize 字段或移除不支持的 flash_attn 相关配置) 。

configuration.json (部分模型存在)

作用:通常作为 config.json 的补充或别名,包含额外的模型配置信息,具体取决于模型实现 。

2. 文本生成策略配置

generation_config.json

作用:定义模型在推理生成文本时的默认超参数。
关键内容:包括温度 (temperature)、Top-K/Top-P 采样策略 (top_k, top_p)、最大生成长度 (max_length)、结束符 ID (eos_token_id)、起始符 ID (bos_token_id) 等。
注意:在 MindIE 等推理框架中,该文件会被读取以决定默认生成行为。若需通过 API 动态控制生成参数,有时需清理此文件中的硬编码参数以避免冲突。

3. 分词器(Tokenizer)配置

tokenizer_config.json

作用:定义分词器的全局配置选项。
关键内容:包含分词器类型、特殊标记映射(如 pad_token, unk_token)、聊天模板 (chat_template) 等。在昇腾适配中,若 config.json 未指定 prompt 模板,常需从此文件拷贝 chat_template 使用 。

tokenizer.json

作用:包含分词器的完整词汇表及合并规则(Merges),通常由 Rust 库 tokenizers 生成,用于快速分词。
关键内容:词汇表映射、BPE 合并规则等。

vocab.json / merges.txt

作用:部分模型(如 GPT-2 系列或旧版 LLaMA)使用这两个文件分别存储词汇表 ID 映射和 BPE 合并规则,而非单一的 tokenizer.json。

special_tokens_map.json

作用:明确映射特殊标记(如 [PAD], [EOS], [CLS])到其对应的 Token ID。

4. 权重索引与元数据

model.safetensors.index.json (或 pytorch_model.bin.index.json)

作用:当模型权重被拆分为多个分片文件(如 model-00001-of-00004.safetensors)时,此 JSON 文件作为索引,记录每个权重参数(Key)位于哪个分片文件(Value)中。
关键内容:weight_map 字典,映射参数名到文件名;metadata 记录总大小等信息。

adapter_config.json (LoRA/微调场景)

作用:在 LoRA 微调后,记录适配器的配置参数,如秩 (rank)、缩放系数 (alpha)、目标模块 (target_modules) 等,用于推理时正确加载 LoRA 权重。

总结对照表

文件名核心作用典型关键字段
config.json模型架构定义hidden_size, num_layers, vocab_size, architectures
generation_config.json推理生成策略temperature, top_p, max_length, eos_token_id
tokenizer_config.json分词器全局配置chat_template, model_max_length, pad_token
tokenizer.json分词器核心数据词汇表、BPE 合并规则
model.safetensors.index.json权重分片索引weight_map (参数名 -> 文件名)
adapter_config.jsonLoRA 适配器配置rank, alpha, target_modules

提示:在昇腾 MindIE 或 ModelArts 部署时,务必确保 config.json 中的架构参数与权重文件一致,且 generation_config.json 中的参数符合业务预期,否则可能导致推理结果异常或服务启动失败。

http://www.jsqmd.com/news/1299577/

相关文章:

  • 千人同时投票不卡顿,大型活动放心用 | 云众评选稳定性实测 - 微信投票小程序
  • DHCP协议解析:设备如何零配置自动获取IP地址
  • Java构建前端可视化维度指标列表的最佳实践
  • Claude Opus 4.6与GPT-5.3-Codex技术对比与应用指南
  • LLM非验证领域能力进化:从RAG优化到应用架构重构
  • 工业耐磨TPU生产专家宏裕塑胶,引领耐用材料制造工艺
  • 2026 年直线模组导轨品牌排行,含 3 大关键排名因素盘点
  • 在保证线性一致性的情况下如何写Kv
  • 留学生的双线论文季:国内小论文和国外 essay 一起写是什么体验
  • AI大模型实战指南:从RAG到Agent的完整技术栈解析
  • 好衣库的现金奖励是真的吗?把发放规则和达成条件核实一遍 - 滚动商讯
  • Ouster激光雷达ROS驱动从零部署:网络配置、参数解析与数据验证全攻略
  • Linux设备与存储精读 · L02-04 | `stat` / `ls` 常用选项精读:读懂一个路径
  • unitree_rl_gym_新手教程_第3章_动手实践
  • 字节面试官问:Claude Code 接几十个 MCP 工具,为什么不撑爆?
  • C语言学习指南:从指针内存管理到项目实战的完整路径
  • AI如何变革学术写作:工具、效率与伦理探讨
  • 让产品自己“开口说话”:xiaomu-meeting + Hermes,打造新一代实时互动智能演示机器人
  • SSM+Vue健康监控App开发实战与优化指南
  • 泳池听歌新选择,园世 Beta Pro 骨传导耳机,32G 内存畅游无束缚 - 滚动商讯
  • 基于STM32的智能加湿器DIY:从硬件设计到物联网控制全流程解析
  • 微服务架构下的数据库治理——从“一个库所有人用“到“独立自治“
  • 西门子PLC硬件安装与接线实战指南:从电源接地到信号抗干扰
  • ComfyUI-VideoHelperSuite终极指南:高效AI视频处理与合成完整方案
  • Android自动化测试进阶:使用ADB与Intent实现精准页面跳转与快捷方式调用
  • MyBatis-Plus面试核心:架构原理、实战避坑与性能优化全解析
  • AGI商业化与开源模型的竞争格局分析
  • Matplotlib多子图数据看板实战:从基础布局到复杂仪表盘构建
  • Windows Cleaner:免费开源工具,3步告别C盘爆红,让Windows系统重获新生
  • 导师说「把 AI 味改掉」但没说怎么改:三个能落地的步骤