

Prismml · seit 31. März 2026 (1-bit Bonsai, LLM-Familie); Ternary Bonsai am 16. April 2026 nachgereicht · 8× · zuletzt 30. Juni 2026
Bonsai ist eine Familie kleiner Sprachmodelle von PrismML (Caltech-Spin-off) in den Größen 8B, 4B und 1,7B Parametern, die durchgängig mit 1-Bit-Gewichten (Einbettungen, Attention, MLP, LM-Head) arbeiten. Das Flaggschiff Bonsai 8B benötigt nur rund 1,15 GB Speicher statt 16,38 GB im FP16-Format und erreicht dabei laut PrismML einen vergleichbaren Durchschnitts-Benchmark-Score wie Standard-8B-Modelle. Die Modelle sind quelloffen unter Apache-2.0-Lizenz verfügbar und für lokale Inferenz auf CPU, GPU (CUDA), Apple Silicon (Metal/MLX) sowie iPhone/iPad konzipiert; ein kostenpflichtiges API-Angebot besteht bislang nicht. Zusätzlich existiert eine "Ternary Bonsai"-Variante mit 1,58-Bit-Gewichten sowie ein multimodales Bildgenerierungsmodell "Bonsai Image 4B" als separates Produkt.
Features
| Key-Benchmark (%) | 70,5 Durchschnittspunkte über 6 Benchmark-Kategorien (IFEval, GSM8K, HumanEval+, BFCL, MuSR, MMLU-Redux), Bonsai 8B |
| Kontextfenster (Token) | 65.536 Token (Bonsai 8B, maximal unterstützt) |
| Lizenz | Apache 2.0 (offene Gewichte, kommerzielle Nutzung erlaubt) |
| Multimodalität | Nein, reines Text-LLM (kein Vision/Audio); separates Bildmodell 'Bonsai Image 4B' existiert eigenständig |
| Plattform | GGUF (llama.cpp: CUDA, Metal, CPU) und MLX (Apple Silicon); läuft auf Mac, iPhone, iPad, Android, Windows/Linux |
| Preis pro 1M Token | Kein API-Preismodell; kostenloser Download der Gewichte, lokale Inferenz ohne nutzungsabhängige Kosten |
| Release-Datum | 31. März 2026 (1-bit Bonsai 8B/4B/1.7B) |