

MiMo-V2.5
#24 in Multimodale ModelleUnknown · v2.5 · seit 22. April 2026 · 2× · zuletzt 31. Aug. 2026
22
Momentum
MiMo-V2.5 ist ein von Xiaomi entwickeltes, offen quelloffenes multimodales Mixture-of-Experts-Modell mit 310 Milliarden Gesamtparametern (15 Milliarden aktiv), das nativ Text, Bild, Video und Audio in einer einheitlichen Architektur verarbeitet. Es basiert auf dem MiMo-V2-Flash-Backbone mit hybrider Sliding-Window-Attention und wurde um dedizierte Vision- und Audio-Encoder erweitert. Das Modell unterstützt ein Kontextfenster von bis zu 1 Million Token und wurde auf rund 48 Billionen Token trainiert. Es wurde am 22. April 2026 vorgestellt und später unter MIT-Lizenz vollständig quelloffen veröffentlicht.
Momentum-Verlauf
02.06.31.08.
Features
| Key-Benchmark (%) | 62,3 Punkte auf Claw-Eval (Agentic-Benchmark, General-Subset) |
| Kontextfenster (Token) | 1.048.576 Token (1M, natives Kontextfenster) |
| Lizenz | MIT (vollständig quelloffen, kommerzielle Nutzung erlaubt) |
| Multimodalität | Nativ omnimodal: Text, Bild, Video und Audio in einheitlicher Architektur (Verständnis) |
| Plattform | Xiaomi MiMo API-Plattform, Hugging Face, OpenRouter, vLLM/SGLang-kompatibel |
| Preis pro 1M Token | $0,14 Input / $0,28 Output (Xiaomi First-Party API, Stand Artificial Analysis) |
| Release-Datum | 22. April 2026 |