vllm-project/vllm

vLLM

高吞吐 LLM 推理与服务引擎

★ 25k 3.6k forks Python Apache-2.0
llminferenceservinggpupaged-attention
4.5综合评分
功能
4.5
文档
4.0
活跃度
5.0
易用
3.5

亮点

  • PagedAttention 显存管理
  • 连续批处理吞吐领先
  • 兼容 OpenAI server

适用场景

  • 生产级 LLM API 服务
  • 私有化高并发推理
  • 模型服务化网关

评测正文

vLLM 是当前开源 LLM 推理服务的事实性能标杆,凭借 PagedAttention 把 KV cache 当虚拟内存管理,把长上下文与并发请求下的显存碎片问题解决得相当彻底。它直接对标 TGI、TensorRT-LLM,在多数公开基准上吞吐领先。

核心能力包括 PagedAttention、连续批处理(continuous batching)、Tensor 并行与流水并行、量化推理(AWQ、GPTQ、FP8)、兼容 OpenAI 的 HTTP server,以及对主流开源模型(Llama、Qwen、Mistral、DeepSeek 等)的广泛适配。最近版本加入了多模态推理与 LoRA 热加载。

亮点是吞吐与显存利用率在开源圈几乎无对手,部署形态接近「起个 server 就能用」;不足是硬件门槛较高(推荐 A100/H100 级别显卡),小显存卡上优势不明显,部分小众模型适配滞后于官方权重发布。

适用场景:生产级 LLM API 服务、私有化高并发推理、模型服务化代理网关。消费级显卡本地玩玩更推荐 llama.cpp / Ollama。