一、什么是 vLLM?
vLLM 是一个高性能大语言模型推理框架,专门用于在 GPU 上高效运行和部署大模型。
相比传统推理方式,它的优势非常明显:
- 更高吞吐量(支持连续批处理)
- 更低延迟
- 更节省显存
- 兼容 OpenAI API 接口
- 适合生产级部署
二、适用场景
vLLM 常用于以下场景:
- 本地运行 LLM(如 Qwen、Llama)
- 搭建 AI API 服务
- 私有化模型部署
- 多用户并发推理服务
- AI 产品后端服务
三、环境要求
🖥️ 硬件要求
- NVIDIA GPU(推荐 16GB 显存以上)
- CUDA 11.8 / 12.x
- Linux 系统(Ubuntu 推荐)
📦 软件依赖
- Python 3.9+
- PyTorch
- CUDA Driver
- pip / conda
四、安装 CUDA(如果已安装可跳过)
检查 GPU:
nvidia-smi
如果没有驱动,请安装:
sudo apt update
sudo apt install -y nvidia-driver-535
五、创建 Python 环境
推荐使用 conda:
conda create -n vllm python=3.10 -y
conda activate vllm
六、安装 vLLM
直接 pip 安装:
pip install vllm
如果需要 CUDA 版本匹配,可以使用:
pip install vllm --extra-index-url https://download.pytorch.org/whl/cu118
七、启动本地模型服务
方式 1:直接启动 OpenAI API 服务
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct \
--host 0.0.0.0 \
--port 8000
参数说明:
--model:模型名称或本地路径--host:监听地址--port:服务端口
八、测试 API 接口
启动后可以用 curl 测试:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen2.5-7B-Instruct",
"messages": [
{"role": "user", "content": "你好,介绍一下你自己"}
]
}'
九、使用 Python 调用
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="dummy"
)
response = client.chat.completions.create(
model="Qwen/Qwen2.5-7B-Instruct",
messages=[
{"role": "user", "content": "写一段Python代码"}
]
)
print(response.choices[0].message.content)
十、提升性能优化(重点🔥)
1️⃣ 启用多 GPU
--tensor-parallel-size 2
2️⃣ 控制显存占用
--gpu-memory-utilization 0.9
3️⃣ 开启长上下文优化
--max-model-len 8192
十一、Docker 部署(推荐🔥)
Docker 启动方式:
docker run --gpus all -p 8000:8000 \
vllm/vllm-openai:latest \
--model Qwen/Qwen2.5-7B-Instruct
十二、常见问题(FAQ)
❌ GPU 不识别
解决:
nvidia-smi
确认驱动是否安装正确
❌ 显存不足
解决:
- 使用量化模型(4bit / 8bit)
- 降低 max-model-len
- 使用更小模型
❌ 访问 8000 端口失败
检查:
ufw allow 8000
十三、总结
vLLM 是目前最适合本地大模型部署与 API 服务化的推理框架之一。
它的优势在于:
- 高性能
- OpenAI 兼容
- 易部署
- 适合生产环境
如果你在做 AI 应用开发或本地模型服务,vLLM 是非常推荐的选择。
📅 更新日期
2026年6月