当前位置: 首页 > news >正文

Qwen2.5-1.5B模型的LoRA微调-SmoothW8A6量化-vLLM推理部署-Http服务API-并发测试流程

Qwen2.5-1.5B模型的LoRA微调-SmoothW8A6量化-vLLM推理部署-Http服务API-并发测试流程

Posted on 2026-08-01 20:43  白氏可乐可乐  阅读(0)  评论(0)    收藏  举报

本文主要展示大模型微调量化的过程,不涉及调优

数据集构建

1、本文大模型微调目标是训练出一个能够高度抽取文本信息的大模型
2、本研究选取新闻简讯作为语料信息
3、样本的构造风格采用shareGPT,格式如下:
{"meesage":
[
{"role":system,"content":text},#系统提示词
{"role":user,"content":text},#文本输出
{"role":assistant,"content":text}#固定新闻摘要抽取(时间地点主要人物故事类型故事组织),输出固定为json格式
]
}
4、样本量是300,训练集:验证集:测试集=8:1:1
5、数据集质量未作评估

模型选择

1、本机硬件信息:
显卡:NVIDIA5060,8GB显存
2、2B参数量(精度为FP16)的内存占用为
20e8X2Byte/1024**3 = 4GB
采用LORA微调
LoRA配置为:rank=8,alpha=16,参数量为215368 = 24576
245762/20e8=

Linux的vLLM启动和后台挂载

1、启动vLLM
python -m vllm.entrypoints.openai.api_server
--model /mnt/d/NaturalLanguage-P/LoRAQwen3/Q_model
--host 0.0.0.0 --port 8000
--max-model-len 1024
--gpu-memory-utilization 0.85
--enforce-eager
--max-num-seqs 8
后台启动
nohup env
VLLM_USE_V1=0
VLLM_WSL2_ENABLE_PIN_MEMORY=1
VLLM_USE_FLASHINFER_SAMPLER=0
VLLM_ENABLE_V1_MULTIPROCESSING=0
VLLM_USE_DEEP_GEMM=0
VLLM_DEEP_GEMM_WARMUP=skip
VLLM_WORKER_MULTIPROC_METHOD=spawn
python -m vllm.entrypoints.openai.api_server
--model /mnt/d/NaturalLanguage-P/LoRAQwen3/Q_model
--host 0.0.0.0 --port 8000
--max-model-len 1024
--gpu-memory-utilization 0.85
--enforce-eager
--max-num-seqs 8
> /mnt/d/NaturalLanguage-P/LoRAQwen3/vllm_server.log 2>&1 &

3、curl测试
curl http://localhost:8000/v1/chat/completions
-H "Content-Type: application/json"
-d '{
"model": "Q_model",
"messages": [
{"role": "system", "content": "你是一个人民日报新闻事件要素抽取器。只输出合法JSON。"},
{"role": "user", "content": "日期:1946-10-15\n标题:英保守党举行年会\n正文:英保守党于本月三日在布拉克浦尔举行年会,邱吉尔发表演说抨击工党。\n请抽取故事情节要素。"}
],
"max_tokens": 100,
"temperature": 0.2
}' | python -c "import sys,json; print(json.load(sys.stdin)['choices'][0]['message']['content'])"

2、查看进程和杀死进程:
ps -au
kill -9 pid
3、脚本文件.sh相当于是将交互终端改为多命令执行终端