

vLLM-Omni
#2 in LLM-Inferenz & ServingVllm · 3× · zuletzt 03. Sept. 2026
vLLM-Omni ist eine Open-Source-Erweiterung des vLLM-Serving-Frameworks, die neben klassischer Text-LLM-Inferenz auch omni-modale und nicht-autoregressive Modelle (Bild, Audio, Video, Robotik-Aktionen) unterstützt. Es erweitert die aus vLLM bekannten Effizienz-Techniken (z. B. KV-Cache-Management) um pipelineartige Multi-Stage-Ausführung für Diffusion Transformers und TTS-Architekturen. Die Software steht als quelloffenes Projekt unter der Apache-2.0-Lizenz zur Verfügung und wird primär selbst gehostet betrieben, wird aber auch von Drittanbietern wie Baseten produktiv eingesetzt. Initial im November 2025 veröffentlicht, folgt es seither einem fortlaufenden Release-Zyklus parallel zu den vLLM-Hauptversionen.
Features
| Deployment (Self-host/Cloud) | Primär Self-Hosting auf eigener GPU-Infrastruktur; Managed-Deployment auch via Drittanbieter wie Baseten möglich |
| Durchsatz/Latenz | TTS-Benchmarks messen RTF (Realtime Factor), TTFP (Time To First Packet) und Tput (generierte Audiosekunden pro Wall-Clock-Sekunde); Werte modellabhängig |
| Lizenz | Apache License 2.0 |
| Plattform | Unterstützt CUDA (NVIDIA), ROCm (AMD), MUSA, NPU und XPU als Hardware-Backends |
| Preis | Kostenlos, quelloffen (Apache 2.0); Kosten entstehen nur durch eigene GPU-Infrastruktur oder Managed-Hosting bei Drittanbietern (z. B. Baseten, RunPod, Modal) |
| Protokoll-Kompatibilität | OpenAI-kompatible API, u. a. für Text-to-Speech (TTS)-Endpunkte |
| Release-Datum | Erstes offizielles Release am 30. November 2025 (v0.11.0rc, basierend auf vLLM v0.11.0) |
| Unterstützte Modelle/Provider | Omni-Modelle (Qwen3-Omni, MiniCPM-o 4.5, Cosmos3, HunyuanImage, BAGEL), TTS (Qwen3-TTS, IndexTTS 2.5, CosyVoice3), Diffusion (MiniMax H3, Wan2.2, LTX), Robotik (π0, GR00T-N1.7) |