

DeepSeek V4-Flash-Vision
#8 in Multimodale ModelleDeepSeek · v4 · flash vision · 8× · zuletzt 03. Sept. 2026
DeepSeek-V4-Flash-Vision-Exp ist ein experimentelles multimodales KI-Modell von DeepSeek, das auf der Architektur von DeepSeek-V4-Flash aufbaut und um visuelle Module erweitert wurde. Es wurde am 21. August 2026 zunächst als API-Modell veröffentlicht und am 31. August 2026 zusätzlich als offene Gewichte unter MIT-Lizenz auf Hugging Face bereitgestellt. Das Modell erreicht bei Textaufgaben (Agenten, Reasoning, Weltwissen) ein Niveau vergleichbar mit DeepSeek-V4-Flash und zeigt bei multimodalen Agenten-Benchmarks einen deutlichen Fortschritt, der laut Hersteller nahe an Anthropics Claude Opus-4.8 heranreicht. Es basiert auf einer Mixture-of-Experts-Architektur mit 284 Milliarden Gesamt- und rund 13 Milliarden aktiven Parametern sowie einem 1-Million-Token-Kontextfenster.
Features
| Key-Benchmark (%) | ApexBench (Pass@1): 36,5 % (vs. 26,2 % bei textbasiertem V4-Flash) |
| Kontextfenster (Token) | 1.048.576 Token (1M), max. 384.000 Token Output |
| Lizenz | MIT-Lizenz (Modellgewichte auf Hugging Face) |
| Multimodalität | Text und Bild (JPEG, PNG, GIF, WebP) als Input, Text als Output; native visuelle Verarbeitung integriert in V4-Flash-Architektur |
| Plattform | DeepSeek API (OpenAI- und Anthropic-kompatibel), Hugging Face (offene Gewichte), Inferenz via vLLM/SGLang |
| Preis pro 1M Token | Wie V4-Flash: $0,22 Input (Cache-Miss) / $0,66 Output, off-peak; Bilder max. 384 Token je Bild |
| Release-Datum | API-Launch: 21. August 2026; offene Gewichte: 31. August 2026 |