

Zamba2-VL
#51 in Multimodale ModelleZyphra · v2 · vl · 3× · zuletzt 29. Juni 2026
Zamba2-VL ist eine von Zyphra veröffentlichte Familie offener Vision-Language-Modelle (1,2B, 2,7B und 7B Parameter), die auf dem hybriden SSM-Transformer-Backbone Zamba2 basiert und den Vision-Encoder von Qwen2.5-VL nutzt. Die Modelle liefern bei vergleichbarer Genauigkeit zu führenden Transformer-basierten offenen VLMs eine rund zehnfach niedrigere Time-to-First-Token, was auf das lineare Prefill und den konstant großen rekurrenten Zustand des Mamba2-Anteils zurückgeht. Besonders stark schneidet Zamba2-VL bei visuellem Zählen sowie Dokument-/Diagrammverständnis ab, während es bei wissensintensivem Reasoning (z.B. MMMU, MathVista) hinter größeren Modellen zurückbleibt. Alle drei Größen wurden unter Apache-2.0-Lizenz als Gewichte auf Hugging Face sowie mit begleitendem Technical Report verö
Features
| Key-Benchmark (%) | PixMoCount: 62,5 (1,2B-Modell); DocVQA: 90,9 (2,7B-Modell) |
| Lizenz | Apache 2.0 |
| Multimodalität | Vision-Language: Einzel- und Mehrbild-Verständnis, visuelles Grounding, OCR, Dokument-/Diagrammverständnis, visuelles Zählen |
| Plattform | Offene Gewichte auf Hugging Face (Zyphra/Zamba2-VL-1.2B/2.7B/7B), Inferenzcode auf GitHub |
| Release-Datum | 10. Juni 2026 (Ankündigung), Preprint 29. Mai 2026 |