

Groq Llama
#14 in LLM-Inferenz & ServingGroq · 2× · zuletzt 30. Juni 2026
1
Momentum
Groq Llama bezeichnet die Bereitstellung von Metas Llama-Modellen (u.a. Llama 3.1, 3.3, 4 Scout/Maverick) auf GroqCloud, der Cloud-Inferenzplattform von Groq. Die Modelle laufen auf Groqs eigens entwickelten LPU-Chips (Language Processing Unit) statt auf GPUs, was laut Anbieter deutlich höheren Durchsatz und geringere, vorhersagbare Latenz ermöglicht. Der Zugriff erfolgt per Token-basierter API mit OpenAI-kompatiblem Format, wahlweise über GroqCloud (Cloud) oder GroqRack (On-Premise, auf Anfrage). Preise variieren je nach Modellgröße stark, von sehr günstigen Kleinmodellen bis zu teureren 70B-Klasse-Modellen.
Momentum-Verlauf
19.05.17.08.