vLLM
高吞吐 LLM 推理与服务引擎
亮点
- PagedAttention 显存管理
- 连续批处理吞吐领先
- 兼容 OpenAI server
适用场景
- 生产级 LLM API 服务
- 私有化高并发推理
- 模型服务化网关
评测正文
vLLM 是当前开源 LLM 推理服务的事实性能标杆,凭借 PagedAttention 把 KV cache 当虚拟内存管理,把长上下文与并发请求下的显存碎片问题解决得相当彻底。它直接对标 TGI、TensorRT-LLM,在多数公开基准上吞吐领先。
核心能力包括 PagedAttention、连续批处理(continuous batching)、Tensor 并行与流水并行、量化推理(AWQ、GPTQ、FP8)、兼容 OpenAI 的 HTTP server,以及对主流开源模型(Llama、Qwen、Mistral、DeepSeek 等)的广泛适配。最近版本加入了多模态推理与 LoRA 热加载。
亮点是吞吐与显存利用率在开源圈几乎无对手,部署形态接近「起个 server 就能用」;不足是硬件门槛较高(推荐 A100/H100 级别显卡),小显存卡上优势不明显,部分小众模型适配滞后于官方权重发布。
适用场景:生产级 LLM API 服务、私有化高并发推理、模型服务化代理网关。消费级显卡本地玩玩更推荐 llama.cpp / Ollama。