Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts
vllm-project

Vllm Project · 2× · zuletzt 25. Aug. 2026

35
Momentum

vLLM ist eine quelloffene Bibliothek für die effiziente Inferenz und das Serving von Large Language Models, ursprünglich am Sky Computing Lab der UC Berkeley entwickelt. Kernstück ist der PagedAttention-Algorithmus, der den KV-Cache-Speicher analog zu virtueller Speicherverwaltung in Blöcken organisiert und so Speicherverschwendung drastisch reduziert. vLLM unterstützt hunderte Modellarchitekturen von Hugging Face, bietet einen zu OpenAI kompatiblen HTTP-Server und läuft auf verschiedenster Hardware (NVIDIA-, AMD-, Intel-GPUs, TPUs, AWS Trainium/Inferentia u.a.). Das Projekt steht unter Apache-2.0-Lizenz und wird von einer breiten Community aus Wissenschaft und Industrie weiterentwickelt.

Momentum-Verlauf
27.05.25.08.

Features

Deployment (Self-host/Cloud)Self-Hosting via Docker/Kubernetes (Helm-Charts, „Production Stack“); auf Cloud-Plattformen wie Google Cloud (GKE, Compute Engine, Vertex AI) einsetzbar
Durchsatz/LatenzBis zu 24x höherer Durchsatz als HuggingFace Transformers und 2,2x–3,5x höher als HuggingFace TGI (je nach Szenario)
LizenzApache License 2.0
PlattformPython-Bibliothek/Server; läuft auf NVIDIA-, AMD-, Intel-GPUs/CPUs, TPU, PowerPC, AWS Trainium/Inferentia
PreisKostenlos, Open Source (Selbsthosting); Kosten entstehen nur für eigene Infrastruktur/Cloud-Compute
Protokoll-KompatibilitätHTTP-Server kompatibel zu OpenAI Completions-, Chat- und Embeddings-API; Endpunkte u.a. /v1/chat/completions, /v1/completions, /v1/embeddings
Release-DatumErstveröffentlichung Juni 2023; aktuell laufende Weiterentwicklung mit häufigen Versions-Releases (z.B. v0.14.1)
Unterstützte Modelle/Provider200+ Modellarchitekturen über Hugging Face, u.a. Llama, Qwen, GPT-OSS, LLaVA (multimodal)

Weitere Produkte in dieser Kategorie: LLM-Inferenz & Serving

Belege (2)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.