

DeepSeek multimodal model
#20 in Multimodale ModelleDeepSeek · 2× · zuletzt 15. Sept. 2026
DeepSeek-V4-Flash-Vision-Exp war ein experimentelles multimodales Modell von DeepSeek, das am 21. August 2026 auf der DeepSeek-API-Plattform veröffentlicht wurde. Es basiert auf der DeepSeek-V4-Flash-Architektur (Mixture-of-Experts, 284 Mrd. Gesamtparameter, 13 Mrd. aktive Parameter) und erweitert das textbasierte V4-Flash um Bild- und Screenshot-Verständnis bei gleichbleibenden Text-, Reasoning- und Agenten-Fähigkeiten. Das Modell wurde inzwischen von DeepSeek-V4.1-Flash abgelöst, das native multimodale Fähigkeiten in der offiziellen Hauptlinie integriert; die alte Modell-ID wird aktuell automatisch auf V4.1-Flash umgeleitet. Eine "unzensierte" FP8-Variante mit entfernten Sicherheitsfiltern existiert, stammt jedoch nicht von DeepSeek selbst, sondern von einem unabhängigen Drittanbieter (d
Features
| Key-Benchmark (%) | ApexBench: 36,5% (vs. 26,2% bei V4-Flash); Agents' Last Exam: 27,3% (vs. 25,2%) |
| Kontextfenster (Token) | 1.048.576 Token (1M) |
| Lizenz | Keine eigene offene Lizenz für Vision-Exp bekannt; Basis-V4-Modelle (Pro/Flash) unter MIT-Lizenz auf Hugging Face verfügbar |
| Multimodalität | Text + Bild-Input (Screenshots, Diagramme, Dokumente), Text-Output; kein Bild-Output |
| Plattform | DeepSeek API Platform (Modellname: deepseek-v4-flash-vision-exp, inzwischen zu deepseek-flash migriert) |
| Preis pro 1M Token | $0,2156 Input / $0,6468 Output (gleicher Tarif wie V4-Flash) |
| Release-Datum | 21. August 2026 (V4-Flash-Vision-Exp); Nachfolger V4.1-Flash am 10. September 2026 |