

DeepSeek-V2
#127 in Open-Source-SprachmodelleDeepSeek · v2 · seit 2024-05-06 · 2× · zuletzt 30. Juni 2026
1
Momentum
DeepSeek-V2 ist ein Mixture-of-Experts (MoE) Sprachmodell von DeepSeek, veröffentlicht im Mai 2024. Es verfügt über 236 Milliarden Parameter gesamt, von denen pro Token nur 21 Milliarden aktiviert werden, und unterstützt ein Kontextfenster von 128.000 Tokens. Das Modell nutzt zwei zentrale Architekturinnovationen: Multi-head Latent Attention (MLA) zur KV-Cache-Kompression und DeepSeekMoE für effiziente Sparse-Berechnung. Im Vergleich zum Vorgänger DeepSeek 67B reduziert es den KV-Cache um 93,3 % und erzielt einen bis zu 5,76-fachen Generierungsdurchsatz.
Momentum-Verlauf
20.05.18.08.
Features
| Benchmark-Score (MMLU/ähnlich) | MMLU (5-shot): 78,5 % (DeepSeek-V2 Base); Chat-Variante: 78,1 % MMLU laut DeepSeek-Coder-V2-Paper |
| Inferenz-Geschwindigkeit | Generierungs-Throughput >50.000 Tokens/s (auf 1 Node mit 8× H800 GPUs, FP8-Präzision); Prompt-Input-Throughput >100.000 Tokens/s; entspricht 5,76× dem Durchsatz von DeepSeek 67B |
| Kontextfenster | 128.000 Tokens |
| Modellgröße (Parameter) | 236B Gesamt-Parameter (MoE); 21B aktivierte Parameter pro Token |
| Preis-Tier | API (zum Zeitpunkt des Releases): ca. $0,14/M Input-Tokens und $0,28/M Output-Tokens; Open-Weights-Modell kostenlos verfügbar (DeepSeek License Agreement, kommerzielle Nutzung erlaubt) |
| Speicher-Anforderung | Vollmodell (BF16): mind. 8× 80 GB GPUs empfohlen (z. B. 8× H800/H100); mit 4-Bit-Quantisierung ca. 136 GB VRAM (Multi-GPU erforderlich) |