

GLM-5.3-Flash
#1 in Multimodale ModelleZ Ai · v5.3 · flash · 32× · zuletzt 29. Aug. 2026
GLM-5.3-Flash ist ein von Z.ai (Zhipu AI) am 26. August 2026 veröffentlichtes natively multimodales Mixture-of-Experts-Modell aus der GLM-5-Serie mit 320 Milliarden Gesamtparametern und 18 Milliarden aktiven Parametern pro Token. Es nutzt eine hybride Sparse- und Linear-Attention-Architektur, unterstützt ein Kontextfenster von bis zu 1.048.576 Token und verarbeitet Text, Bilder und Video als Eingabe. Die Modellgewichte sind unter MIT-Lizenz auf Hugging Face verfügbar; laut Z.ai übertrifft das Modell seinen Vorgänger GLM-5.2 bei etwa einem Zehntel des Preises und nähert sich der Leistung von Claude Opus 4.8 bei Coding- und Agenten-Benchmarks an.
Features
| Key-Benchmark (%) | Artificial Analysis Intelligence Index: 57 Punkte; Terminal-Bench 2.1: 84,3; DeepSWE v1.1: 63,4 |
| Kontextfenster (Token) | 1.048.576 Token (max. Output: 131.072 Token) |
| Lizenz | MIT-Lizenz (offene Gewichte) |
| Multimodalität | Natively multimodal: Text-, Bild- und Video-Eingabe, Text-Ausgabe |
| Plattform | Z.ai API-Plattform, Hugging Face, OpenRouter; Self-Hosting via SGLang, vLLM, TokenSpeed, KTransformers |
| Preis pro 1M Token | 0,15 $ Input / 0,50 $ Output (Listenpreis Z.ai); Launch-Rabatt bis 9. Sept. 2026: 0,075 $ / 0,25 $ |
| Release-Datum | 26. August 2026 |