

DeepSeek · 6× · zuletzt 01. Juli 2026
DFlash 2 ist ein von Inco AI (in Weiterentwicklung der ursprünglich an Z Lab entstandenen DFlash-Technik) veröffentlichter "Drafter" für spekulatives Decoding von großen Sprachmodellen. Es handelt sich nicht um physische Hardware, sondern um ein Open-Source-Modell/Software-Verfahren, das die Ausgabe eines Ziel-LLM (z.B. Qwen3.8-27B, Meta Muse Glimmer) parallel in Blöcken vorhersagt und dadurch die Inferenzgeschwindigkeit erhöht, ohne die Ausgabequalität zu verändern. Die Modelle sind quelloffen unter Apache-2.0-Lizenz auf Hugging Face verfügbar und laufen in gängigen Inferenz-Engines wie SGLang, vLLM, llama.cpp und oMLX/MLX auf Apple Silicon.