当前位置: 首页 > news >正文

昇腾平台VeRL测试方法概述

作者​:昇腾实战派
知识地图​:https://blog.csdn.net/Lumos_Lovegood/article/details/161601003

背景简介

VeRL原生支持GPU,昇腾作为VeRL开源社区贡献方,对VeRL进行适配,使其能在NPU上运行。因此,需要对社区原生特性在NPU上的支持情况以及一些NPU上的新增特性进行测试。

简单说,强化学习包含训练和推理两部分,是一种边推边训的框架。区别于预训练和微调,强化学习是后训练,基于推理的结果对训练进行指导。

下面介绍VeRL的测试方法:

环境部署

安装HDK、CANN、PTA
准备VeRL、vllm、vllm-ascend、Megatron(可选)、MindSpeed(可选)等源码,安装相关依赖verl/blob/main/docs/ascend_tutorial/get_start/quick_start.rst

以release的版本(v0.8.0)为例,基本配套如下:

verlvllmvllm-ascendtorchtorch_npucann
v0.8.00.18.00.18.02.9.02.9.0.post29.0.0

详细配套请参考verl/docs/ascend_tutorial/get_start/install_guidance.rst at main · verl-project/verl · GitHub

模型训练

数据预处理、权重转换、参数配置、启动训练

性能

  • throughput:端到端吞吐
  • perf/time_per_step:单步总时长

精度

  1. 参考指标:
  • critic/rewards/mean

    类似LLM的loss,但是越高越好,一般要求训练过程中rewards是上升趋势

  1. 测试验收方式:
    如果是有标杆的情况,需要使用训练后保存的权重进行评测,参考下面模型推理的精度测试方法

模型推理(评测)

服务端

使用模型训练的环境拉起服务端

# NPU服务端python-mvllm.entrypoints.openai.api_server\--model="/home/zbz/Qwen3-32B/"\--served-model-name auto\--gpu-memory-utilization0.9\--max-num-seqs24\--max-model-len22528\--max-num-batched-tokens22528\--enforce-eager\--trust-remote-code\--distributed_executor_backend=mp\--tensor-parallel-size4\--data-parallel-size1\--generation-config vllm\--port6380
  • model:训练后的权重路径,需要是hf格式,保存后的若是mg格式,需要转回hf
  • tensor-parallel-size:TP建议和训练时infer的配置保持一致
  • data-parallel-size:DP建议和训练时infe的配置保持一致
  • port:可任意设置空闲端口
  • max-model-len:输入序列长度+输出序列长度
  • max-num-batched-tokens: 和max-model-len一致即可
客户端

另起一个会话,并且需要新建一个conda或者venv环境安装ais-benchmark(避免环境依赖冲突)

gitclone https://gitee.com/aisbench/benchmark.gitcdbenchmark/ pip3install-e./ --use-pep517

按需下载aime、MATH等数据集,放到benchmark/ais_bench/datasets目录下

然后修改评测脚本
vim benchmark/ais_bench/benchmark/configs/models/vllm_api/vllm_api_stream_chat.py

fromais_bench.benchmark.utils.model_postprocessorsimportextract_non_reasoning_contentfromais_bench.benchmark.modelsimportVLLMCustomAPIChatStream models=[dict(attr="service",# local or servicetype=VLLMCustomAPI,abbr='vllm-api-general',path="",model="",max_seq_len=2048,# 输入长度request_rate=0,rpm_verbose=False,retry=2,host_ip="localhost",# 推理服务的IPhost_port=6380,# 推理服务的端口enable_ssl=False,max_out_len=20480,# 最大输出tokens长度batch_size=48,# 推理的最大并发数generation_kwargs=dict(temperature=0,seed=1234,))]

评测命令如下:

ais_bench --models vllm_api_chat --datasets aime2024_gen

其中datasets的值需要和benchmark/ais_bench/benchmark/configs/datasets/下各数据集的py文件名称对应一致

下面提供循环评测的代码以便验证:

# 启动命令#!/bin/bashfor((i=1;i<=4;i++))doecho"==================aime2024_gen times:$i"ais_bench--modelsvllm_api_stream_chat--datasetsaime2024_gendonefor((i=1;i<=4;i++))doecho"==================math_prm800k_500_0shot_cot_gen times:$i"ais_bench--modelsvllm_api_stream_chat--datasetsmath_prm800k_500_0shot_cot_gendone

故障排查

  1. 执行训练脚本后,ray从一开始就连不通
    确保各节点python版本、ray的版本一致,且各节点没有开启防火墙,确保ray通信不会被拦截。可以使用以下代码进行测试:

    • 关闭防火墙systemctl stop firewalld
    • 主节点ray start --head --port 6366
    • 备节点ray start --address='主节点ip:6366

    若无法联通,需要检查环境的集群配置是否正常。

  1. 执行训练脚本后,一开始ray能联通,后续ray自行断联
    这种情况一般是备节点能够联通主节点,但主节点无法联通备节点。可以互换主备节点,使用1的方式进行测试。
  1. 评测报错ValueError: This model’s maximum context length is 0 tokens. However, your request has 195 input tokens. Please reduce the length of the input messages.
    benchmark/ais_bench/benchmark/configs/models/vllm_api/vllm_api_general.py脚本中的输入输出长度和服务端脚本max_model_len不对应,max_model_len = 输入+输出。
http://www.jsqmd.com/news/1302725/

相关文章:

  • 安全高效的Linux云存储方案:onedrived-dev与Keyring凭证管理实践
  • 2026培根品牌排行终极测评|家用商用双赛道实测,EUROFOO有硬实力 - 甄选测评馆
  • 如何5分钟快速获取网易云与QQ音乐歌词:163MusicLyrics完整指南
  • 2026 年现阶段山东有实力的膜结构电动车棚供货商联系方式,小区楼下悄悄多了这玩意儿,雨天充电居然不用再扛伞跑? - 领域鉴赏官
  • 闲鱼寄快递省钱方法:价格表与实操经验 - 快递物流实时资讯
  • 西安本地沙发换芯:恒越家具海绵维修服务评价
  • 适合非商科背景EMBA推荐,民营创始人择校指南
  • 053-攻克技术面试的底层逻辑
  • 终极指南:TrguiNG汉化版 - 免费开源的现代化Transmission远程管理方案
  • 福州漏水检测正规公司推荐-卫生间-厨房-屋顶-阳台-地下室-暗管漏水精准定位-防水补漏维修指南2026 - 知途管道科技
  • 让模型理解中国文化:七月的探索与八月的方向
  • 东莞工业区商铺管道清理|餐饮隔油池疏通 主管道高压清洗 排污故障检测维修 - 甄选测评馆
  • 2026年7月亚马逊卖家遭遇TRO冻结,72小时内该做什么不该做什么——肖革文律师解答 - 有趣的小土豆
  • 老Mac焕新秘籍:用OpenCore Legacy Patcher轻松升级macOS新系统
  • leetcode 628. 三个数的最大乘积 简单
  • 27届秋招避坑:简历信息频繁泄露?浅谈求职工具隐私防护设计
  • 深圳 26 年 8 月成人小自考本科本地靠谱教育机构 - 博学的慎思
  • 闲鱼快递怎么寄便宜?省钱方法与推荐汇总 - 快递物流实时资讯
  • 终极免费AI视频增强神器:3步将低清视频无损升级到4K超高清
  • 092、LLC谐振变换器的PCB布局要点
  • 汕尾漏水检测公司推荐-暗管测漏精准定位-卫生间-厨房-屋顶-阳台-地下室防水补漏维修指南 - 知途管道科技
  • 哪里可以回收购物卡?线上回收靠谱吗 - 甄选测评馆
  • 10分钟完成Extrapolate本地部署:Vercel CLI与环境变量配置技巧
  • 飞书文档批量导出工具:25分钟搞定700+文档的终极解决方案
  • 告别『一次登录,全程信任』:基于身份的持续动态鉴权架构实践
  • AI写作越写越废?5款封神知识库工具,搞定AI素材沉淀与高效出稿! - 品牌测评鉴赏家
  • GPT-SoVITS语音合成技术深度解析:从零样本克隆到多语言实时推理的架构设计
  • 2026年GPU云服务器租用指南:价格、显卡选择与避坑建议
  • 终极指南:如何在macOS上运行Windows软件和游戏
  • 按键不会消失,AI会让它重新变得重要