🚀 vLLM 本地部署完整教程(2026最新版)


一、什么是 vLLM?

vLLM 是一个高性能大语言模型推理框架,专门用于在 GPU 上高效运行和部署大模型。

相比传统推理方式,它的优势非常明显:

  • 更高吞吐量(支持连续批处理)
  • 更低延迟
  • 更节省显存
  • 兼容 OpenAI API 接口
  • 适合生产级部署

二、适用场景

vLLM 常用于以下场景:

  • 本地运行 LLM(如 Qwen、Llama)
  • 搭建 AI API 服务
  • 私有化模型部署
  • 多用户并发推理服务
  • AI 产品后端服务

三、环境要求

🖥️ 硬件要求

  • NVIDIA GPU(推荐 16GB 显存以上)
  • CUDA 11.8 / 12.x
  • Linux 系统(Ubuntu 推荐)

📦 软件依赖

  • Python 3.9+
  • PyTorch
  • CUDA Driver
  • pip / conda

四、安装 CUDA(如果已安装可跳过)

检查 GPU:

nvidia-smi

如果没有驱动,请安装:

sudo apt update
sudo apt install -y nvidia-driver-535

五、创建 Python 环境

推荐使用 conda:

conda create -n vllm python=3.10 -y
conda activate vllm

六、安装 vLLM

直接 pip 安装:

pip install vllm

如果需要 CUDA 版本匹配,可以使用:

pip install vllm --extra-index-url https://download.pytorch.org/whl/cu118

七、启动本地模型服务

方式 1:直接启动 OpenAI API 服务

python -m vllm.entrypoints.openai.api_server \
  --model Qwen/Qwen2.5-7B-Instruct \
  --host 0.0.0.0 \
  --port 8000

参数说明:

  • --model:模型名称或本地路径
  • --host:监听地址
  • --port:服务端口

八、测试 API 接口

启动后可以用 curl 测试:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2.5-7B-Instruct",
    "messages": [
      {"role": "user", "content": "你好,介绍一下你自己"}
    ]
  }'

九、使用 Python 调用

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="dummy"
)

response = client.chat.completions.create(
    model="Qwen/Qwen2.5-7B-Instruct",
    messages=[
        {"role": "user", "content": "写一段Python代码"}
    ]
)

print(response.choices[0].message.content)

十、提升性能优化(重点🔥)

1️⃣ 启用多 GPU

--tensor-parallel-size 2

2️⃣ 控制显存占用

--gpu-memory-utilization 0.9

3️⃣ 开启长上下文优化

--max-model-len 8192

十一、Docker 部署(推荐🔥)

Docker 启动方式:

docker run --gpus all -p 8000:8000 \
  vllm/vllm-openai:latest \
  --model Qwen/Qwen2.5-7B-Instruct

十二、常见问题(FAQ)

❌ GPU 不识别

解决:

nvidia-smi

确认驱动是否安装正确


❌ 显存不足

解决:

  • 使用量化模型(4bit / 8bit)
  • 降低 max-model-len
  • 使用更小模型

❌ 访问 8000 端口失败

检查:

ufw allow 8000

十三、总结

vLLM 是目前最适合本地大模型部署与 API 服务化的推理框架之一。

它的优势在于:

  • 高性能
  • OpenAI 兼容
  • 易部署
  • 适合生产环境

如果你在做 AI 应用开发或本地模型服务,vLLM 是非常推荐的选择。


📅 更新日期

2026年6月


发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部