

DFlash 2
#4 in KI-Inferenz-HardwareUnknown · v2 · 4× · zuletzt 20. Aug. 2026
DFlash 2 ist ein von Inco AI (in Weiterentwicklung der ursprünglich an Z Lab entstandenen DFlash-Technik) veröffentlichter "Drafter" für spekulatives Decoding von großen Sprachmodellen. Es handelt sich nicht um physische Hardware, sondern um ein Open-Source-Modell/Software-Verfahren, das die Ausgabe eines Ziel-LLM (z.B. Qwen3.8-27B, Meta Muse Glimmer) parallel in Blöcken vorhersagt und dadurch die Inferenzgeschwindigkeit erhöht, ohne die Ausgabequalität zu verändern. Die Modelle sind quelloffen unter Apache-2.0-Lizenz auf Hugging Face verfügbar und laufen in gängigen Inferenz-Engines wie SGLang, vLLM, llama.cpp und oMLX/MLX auf Apple Silicon.
Features
| Lizenz | Apache 2.0 |
| Plattform | Läuft in SGLang, vLLM, llama.cpp und oMLX/MLX (Apple Silicon) ab Tag 1 |
| Preis | Kostenlos (Open-Source-Modell, kein Kaufpreis) |
| Release-Datum | 18. August 2026 |
| Speicher | Modellgröße 2B Parameter (BF16 ~3,86 GB; Q4_K_M ~1,14 GB; Q8_0 ~2,06 GB) |
| Verfügbarkeit | Öffentlich verfügbar auf Hugging Face (incoai/z-lab Collections) und GitHub (z-lab/dflash) |