当前位置: 首页 > news >正文

vLLM :安装及部署大模型详解

vLLM 是一个快速且易于使用的 LLM 推理库,支持多种模型和硬件加速。中文官网地址:vllm快车道

1. 系统要求

1.1硬件要求

  • GPU: NVIDIA GPU (推荐 16GB+ 显存)
  • CUDA: 支持 CUDA 11.8 或 12.1
  • 内存: 至少 16GB RAM

1.2软件要求

  • Python 3.8-3.11
  • Linux

2. 安装方法

2.1方法一:使用 pip 安装(推荐)

# 创建虚拟环境(可选但推荐) conda create --name vllm python=3.10 conda activate vllm # 安装 vLLM pip install vllm

python环境搭建可参考 基本环境搭建教程

2.2方法二:从源码编译安装

# 克隆仓库 git clone https://github.com/vllm-project/vllm.git cd vllm # 安装依赖 pip install -e .

3.部署大模型

python -m vllm.entrypoints.openai.api_server \ --model your_model_path \ --dtype half \ --trust-remote-code \ --tensor-parallel-size 1 \ --max-model-len 5120 \ --enforce-eager \ --gpu-memory-utilization 0.95 \ --max-num-batched-tokens 5120 \ --max-num-seqs 5 \ --host 0.0.0.0 \ --served-model-name DeepSeek-R1-7B \ --port 8080 &

部署的模型需要先下载到本地,your_model_path 这里需替换成自己的模型路径,下载模型可从huggingface或者modelscope官网下载,huggingface还有国内镜像网站。如果顺利的话这样就已经把本地大模型部署成 OpenAI API 服务,就可以使用了连接使用了。

4.常见问题

4.1 vllm依赖缺失

推荐安装

# 使用python3.10 conda create --name vllm python=3.10 # 安装vllm相关依赖 pip install torch==2.3.0 torchvision==0.18.0 torchaudio==2.3.0 --index-url https://download.pytorch.org/whl/cu121 # 使用指定的版本 pip install vllm==0.43

pytorch的安装可参考pytorch官网。

部分依赖安装可能需要指定版本才能适配,按照报错的提示安装指定版本即可。

4.2 CUDA问题

(1)nvidia驱动地址安装驱动:nvidia驱动地址 选取x86_64 历史版本中的530.30.02版本,此版本对应cuda12.1

(2)Cuda安装:安装完cuda驱动后,再进行 cuda安装。

(3)修改cuda环境变量

# 第一步 vim ~/.bashrc # 第二步:在最下面插入并保存,/usr/local/cuda-xx.x,/usr/local/cuda-xx.x/libxx export PATH=/usr/local/cuda-xx.x/bin:$PATH export LD_LIBRARY_PATH=/usr/local/cuda-xx.x/libxx:$LD_LIBRARY_PATH # 第三步:刷新环境变量 source ~/.bashrc # 第四步:验证cuda nvcc -V

(4)检查 cuda 、driver 是否一致

nvcc -V Nvidia-smi

4.3 模型配置到Harness中无法掉工具

vllm部署时加上这2个参数即可:

--enable-auto-tool-choice --tool-call-parser hermes
http://www.jsqmd.com/news/1390204/

相关文章:

  • Fixer模型深度解析:NVIDIA革命性单步扩散技术如何修复3D重建缺陷
  • 技嘉主板Q-Flash报错“工具过时”的完整解决方案与BIOS安全升级指南
  • 2026年提升机厂家实力之选:武汉吉尼克森工业设备有限公司 - 卓企推荐
  • pico性能优化技巧:提升实时检测速度的7个实用方法
  • 3分钟免费汉化GitHub:终极中文界面插件完整指南
  • 基于SpringBoot+Vue图书个性化推荐系统的设计与实现
  • 深度学习核心机制:从自动微分原理到激活函数选择与优化实践
  • 2026年江阴防静电地板回收公司电话精选指南:如何高效选择靠谱服务商? - geo交流
  • Windows系统文件TranscodeWallpaper.dll丢失找不到问题解决
  • springboot大学生竞赛全流程与组队协同平台
  • 昆山网站建设ikelv为何成为众多中小企业的首选?揭秘背后那些被忽视的真相与核心价值
  • 科研团队在申报项目时如何高效获取技术匹配与市场反馈?
  • TransformerEngine优化解密:NVIDIA ESM2_t6_8M_UR50D性能提升指南
  • TrackWeight终极指南:MacBook触控板秒变免费精准电子秤,完整上手教程
  • SpringBoot高校浴室预约系统设计与实现:技术栈、背景意义与核心代码
  • TermuxAlpine进阶:构建个性化Linux工作流
  • vscode-live-sass-compiler与Live Server集成:打造无缝前端开发环境
  • E4GL30S1NT元数据提取工具Metadata:图片与文档信息挖掘完全指南
  • 2026宜宾装修公司推荐这5家:这份避坑指南请查收 - 装企精灵GEO
  • vscode-live-sass-compiler高级用法:多格式输出与Source Map配置指南
  • OpenAI Symphony:AI代理编排规范解析与实践指南
  • WVP-GB28181-Pro 从零到一完整教程:3小时搭好免费开源的国标视频监控平台
  • 构建技能棘轮机制:确保团队技术能力只升不降的工程实践
  • AI视频剪辑实操教程:看懂语义的剪口播Agent,从装环境到出成片一次跑通
  • 从0到1掌握bert-portuguese-ner:葡萄牙语NER模型的安装与快速上手
  • 解锁Pixelarticons全部4400+图标:许可证激活与升级教程
  • 2026东莞高速服务区充电桩回收哪家好?这份优选指南请收好。 - geo交流
  • WinDynamicDesktop自定义动态桌面主题:从原理到实战制作全指南
  • SpringBoot餐厅食材溯源系统设计与实现:技术栈、背景意义与核心代码
  • 局域网内Windows 10远程连接Windows 7:RDP协议原理与实战设置详解