

SIE (Superlinked Inference Engine)
#4 in LLM-Inferenz & ServingSuperlinked · 2× · zuletzt 10. Sept. 2026
SIE (Superlinked Inference Engine) ist ein quelloffener Inference-Server von Superlinked, der über eine einheitliche API mehr als 100 kleine KI-Modelle (Embeddings, Reranking, Sparse-Retrieval, Extraktion, OCR und Textgenerierung) auf gemeinsam genutzten GPU-Ressourcen bereitstellt. Statt für jeden Modelltyp einen eigenen Server zu betreiben, lädt SIE Modelle bedarfsgesteuert (on-demand) und verwaltet sie über LRU-Eviction in einem einzigen Cluster. Das Kernprodukt ist unter Apache-2.0-Lizenz für Self-Hosting freigegeben (von Laptop bis Kubernetes), zusätzlich bietet Superlinked eine verwaltete Cloud-Version derselben Engine an. Die API ist teilweise OpenAI-kompatibel, was eine einfache Migration ermöglicht.
Features
| Durchsatz/Latenz | Selbst-gehostetes Embedding liefert Ergebnisse 3–7x schneller als gehostete Frontier-APIs; p99-Latenz nah an p50; Batch-then-Route erreicht ~89% GPU-Effizienz vs. ~51% bei Route-then-Batch (ca. 1,8x Durchsatz pro GPU) |
| Lizenz | Open Source, Apache 2.0 |
| Plattform | Läuft auf eigener Hardware: macOS (Apple Silicon), Linux (CPU/NVIDIA-GPU), Kubernetes (AWS EKS, GCP GKE, Azure AKS) |
| Preis | Kernengine kostenlos (Open Source, Self-Hosting); verwaltete SIE Cloud auf Anfrage/Kontakt; kostenlose Hosted-Kapazität für ausgewählte Projekte via Inference Grant |
| Protokoll-Kompatibilität | OpenAI-kompatible API-Endpunkte: /v1/embeddings, /v1/chat/completions, /v1/completions, /v1/responses |
| Release-Datum | Launch-Blogpost datiert Februar 2026 |
| Unterstützte Modelle/Provider | 100+ vorkonfigurierte Modelle (u.a. Stella, SPLADE, Qwen3, GLiNER, SigLIP, BGE-M3, ColQwen2.5, BGE-reranker, Florence-2) für Embeddings, Reranking, Extraktion, OCR und Generation |