

Vllm Project · 2× · zuletzt 25. Aug. 2026
vLLM ist eine quelloffene Bibliothek für die effiziente Inferenz und das Serving von Large Language Models, ursprünglich am Sky Computing Lab der UC Berkeley entwickelt. Kernstück ist der PagedAttention-Algorithmus, der den KV-Cache-Speicher analog zu virtueller Speicherverwaltung in Blöcken organisiert und so Speicherverschwendung drastisch reduziert. vLLM unterstützt hunderte Modellarchitekturen von Hugging Face, bietet einen zu OpenAI kompatiblen HTTP-Server und läuft auf verschiedenster Hardware (NVIDIA-, AMD-, Intel-GPUs, TPUs, AWS Trainium/Inferentia u.a.). Das Projekt steht unter Apache-2.0-Lizenz und wird von einer breiten Community aus Wissenschaft und Industrie weiterentwickelt.
Features
| Deployment (Self-host/Cloud) | Self-Hosting via Docker/Kubernetes (Helm-Charts, „Production Stack“); auf Cloud-Plattformen wie Google Cloud (GKE, Compute Engine, Vertex AI) einsetzbar |
| Durchsatz/Latenz | Bis zu 24x höherer Durchsatz als HuggingFace Transformers und 2,2x–3,5x höher als HuggingFace TGI (je nach Szenario) |
| Lizenz | Apache License 2.0 |
| Plattform | Python-Bibliothek/Server; läuft auf NVIDIA-, AMD-, Intel-GPUs/CPUs, TPU, PowerPC, AWS Trainium/Inferentia |
| Preis | Kostenlos, Open Source (Selbsthosting); Kosten entstehen nur für eigene Infrastruktur/Cloud-Compute |
| Protokoll-Kompatibilität | HTTP-Server kompatibel zu OpenAI Completions-, Chat- und Embeddings-API; Endpunkte u.a. /v1/chat/completions, /v1/completions, /v1/embeddings |
| Release-Datum | Erstveröffentlichung Juni 2023; aktuell laufende Weiterentwicklung mit häufigen Versions-Releases (z.B. v0.14.1) |
| Unterstützte Modelle/Provider | 200+ Modellarchitekturen über Hugging Face, u.a. Llama, Qwen, GPT-OSS, LLaVA (multimodal) |