

Vllm · seit Juni 2023 (offizieller Launch-Blogpost); zugehöriges Paper September 2023 · 59× · zuletzt 13. Aug. 2026
vLLM ist eine quelloffene Inference- und Serving-Engine für Large Language Models, ursprünglich am Sky Computing Lab der UC Berkeley entwickelt. Kern der Software ist PagedAttention, ein Speicherverwaltungsverfahren für den KV-Cache, kombiniert mit kontinuierlichem Batching, das hohen Durchsatz und geringen Speicherverbrauch beim Modell-Serving ermöglicht. Das Projekt unterstützt über 200 Modellarchitekturen von HuggingFace, zahlreiche Quantisierungsformate sowie diverse Hardware-Backends (NVIDIA, AMD, Intel, TPU, Trainium). vLLM wird als kostenloses Open-Source-Projekt unter Apache-2.0-Lizenz vertrieben und lässt sich selbst hosten oder über einen OpenAI-kompatiblen HTTP-Server betreiben.
Features
| Deployment (Self-host/Cloud) | Self-hosted via pip/uv-Installation oder Docker-Image (vllm/vllm-openai); K8s-natives Deployment über production-stack |
| Durchsatz/Latenz | Bis zu 24x höherer Durchsatz als HuggingFace Transformers (offizieller Launch-Benchmark 2023) |
| Lizenz | Apache License 2.0 |
| Plattform | Python-Bibliothek/Server; unterstützt NVIDIA-, AMD-GPUs, Intel-CPUs, TPU, AWS Trainium/Inferentia, Apple Silicon (via vLLM-Metal); Python 3.10–3.13 |
| Preis | Kostenlos, Open Source (keine Lizenzgebühren; Kosten entstehen nur durch selbst betriebene Infrastruktur) |
| Protokoll-Kompatibilität | OpenAI-kompatibler HTTP-Server (Chat Completions, Responses API, SageMaker-kompatibler Endpunkt) |
| Release-Datum | Juni 2023 (Launch-Blogpost 'Easy, Fast, and Cheap LLM Serving with PagedAttention') |
| Unterstützte Modelle/Provider | 200+ Modellarchitekturen auf HuggingFace (u.a. Llama, DeepSeek, Qwen); Quantisierung: FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF |