

Unknown · 2× · zuletzt 16. Aug. 2026
Exo (auch "EXO" oder früher "exo labs") ist eine quelloffene Software zur verteilten LLM-Inferenz, die mehrere Apple-Silicon-Geräte (und zunehmend Linux-Rechner) automatisch zu einem gemeinsamen Inferenz-Cluster verbindet. Modelle werden dabei schichtweise über die verfügbaren Geräte im Netzwerk verteilt, sodass auch sehr große Modelle laufen können, die auf einem einzelnen Gerät nicht in den Speicher passen würden. Das Projekt wird von der Firma Exo Technologies Ltd (exo labs) entwickelt und ist über GitHub als Apache-2.0-lizenzierter Code verfügbar. Es bietet kompatible APIs zu OpenAI, Claude, Ollama sowie ein integriertes Dashboard zur Cluster-Verwaltung.
Features
| Durchsatz/Latenz | Beispiel: DeepSeek R1 (8-bit) mit ~20 Tok/s auf 2x M2 Ultra 512GB via Thunderbolt 5 |
| Lizenz | Apache License 2.0 (Copyright 2025 Exo Technologies Ltd) |
| Plattform | macOS (Apple Silicon, primäre Plattform via MLX), Linux (aktuell nur CPU, GPU-Support in Entwicklung) |
| Preis | Kostenlos, Open Source (kein kommerzielles Preismodell auf offizieller Seite genannt) |
| Protokoll-Kompatibilität | OpenAI Chat Completions API, Claude Messages API, OpenAI Responses API, Ollama API |
| Release-Datum | Erstveröffentlichung Juni 2024; EXO 1.0 (Apache-2.0) am 19. Dezember 2025 |
| Unterstützte Modelle/Provider | LLaMA, Mistral, LlaVA, Qwen, DeepSeek u.a.; Custom-Modelle von HuggingFace Hub ladbar |