

Inception Labs · v2 · seit 24. Februar 2026 · 2× · zuletzt 29. Juni 2026
Mercury 2 ist das aktuelle Flaggschiff-Sprachmodell von Inception Labs, das auf einer Diffusions-Architektur (dLLM) statt klassischer autoregressiver Token-für-Token-Generierung basiert. Es generiert Text durch parallele Verfeinerung mehrerer Tokens gleichzeitig und erreicht dadurch laut Hersteller über 1.000 Tokens pro Sekunde auf NVIDIA-Blackwell-GPUs bei einem 128K-Kontextfenster. Das Modell ist auf latenzkritische Produktionsanwendungen wie Agenten-Loops, Coding-Assistenten, Sprachschnittstellen und Suchsysteme ausgerichtet und ist OpenAI-API-kompatibel für einen einfachen Drop-in-Ersatz bestehender Modelle. Mercury 2 wurde am 24. Februar 2026 vorgestellt und ist seither über die Inception-API sowie Partner wie AWS Bedrock, Azure Foundry und Baseten verfügbar.
Features
| Deployment-Modell | Managed API, Cloud-Marktplätze (AWS Bedrock, Azure Foundry) sowie private Deployments/Fine-Tuning auf Anfrage |
| Einsatzbereich | Agentenschleifen, Coding-Assistenten, Sprachschnittstellen, Suche/Retrieval, Echtzeit-Automatisierung |
| Integrationen | OpenAI-API-kompatibel; Bibliotheken wie AISuite, LiteLLM, LangChain; AWS Bedrock, Azure Foundry |
| Lizenz | Proprietär, Modellgewichte nicht öffentlich verfügbar |
| Plattform | Inception API, AWS Bedrock, Azure Foundry, Baseten, OpenRouter |
| Preis | 0,25 $ / 1 Mio. Input-Tokens; 0,75 $ / 1 Mio. Output-Tokens (gecachter Input: 0,025 $) |
| Release-Datum | 24. Februar 2026 (Ankündigung) |