

Ideogram 4
#34 in Text-zu-BildIdeogram · v4 · seit 3. Juni 2026 · 6× · zuletzt 29. Juni 2026
Ideogram 4.0 ist ein von Ideogram AI entwickeltes Text-zu-Bild-Modell, das am 3. Juni 2026 als erstes offen gewichtetes ("open-weight") Modell des Unternehmens veröffentlicht wurde. Es handelt sich um einen 9,3 Milliarden Parameter großen Single-Stream Diffusion Transformer mit 34 Schichten, der von Grund auf trainiert wurde und mit einem eingefrorenen Qwen3-VL-8B-Vision-Language-Modell als Text-Encoder kombiniert ist. Das Modell zeichnet sich durch besonders präzise Textwiedergabe in Bildern, strukturierte JSON-Prompts mit Bounding-Box-Layout-Steuerung und native Auflösungen bis 2048 Pixel aus. Die Gewichte sind über Hugging Face und GitHub verfügbar, wobei der Inferenzcode unter Apache-2.0-Lizenz steht, die Modellgewichte selbst aber einer nicht-kommerziellen Lizenz unterliegen.
Features
| Bildauflösung (Max.) | Nativ 256–2048 px pro Seite (Vielfaches von 16), maximales Seitenverhältnis 6:1; Standard: 2048×2048 px (native 2K) |
| Fine-tuning | Fine-Tuning/LoRAs für nicht-kommerzielle Nutzung erlaubt; kommerzielles Fine-Tuning und Custom-Modell-Training über Enterprise/Self-Serve |
| Lizenz | Inferenzcode: Apache 2.0; Modellgewichte: Ideogram Non-Commercial Model Agreement (kommerzielle Nutzung erfordert separate bezahlte Lizenz) |
| Max-Auflösung | Native Auflösung von 256 bis 2048 Pixel pro Seite, flexible Seitenverhältnisse |
| Plattform | Web-App (ideogram.ai), API, MCP, Hugging Face, GitHub, self-hosting auf eigener Hardware |
| Preis | Abo ab $7/Monat (Basic); API ab $0,03 bis $0,10 pro Bild je nach Qualitätsstufe |
| Release-Datum | 3. Juni 2026 |
| Speicherbedarf (GB) | ~20–22 GB VRAM (FP16 Backbone); nf4-Checkpoint (quantisiert) läuft auf einer einzelnen 24-GB-GPU (z. B. RTX 4090); fp8-Checkpoint empfiehlt 40–80 GB GPU für Produktions-Batch-Inferenz |