

Ollama Cloud
#2 in Lokale LLM-RuntimesOllama · 7× · zuletzt 29. Juli 2026
82
Momentum
Ollama Cloud ist ein gehosteter Inferenzdienst des Ollama-Teams, mit dem große Open-Weight-Modelle (z.B. gpt-oss:120b, Kimi K3, DeepSeek, Qwen3-Coder) auf Ollamas eigenen Rechenzentrums-GPUs ausgeführt werden, ohne dass lokale Hardware benötigt wird. Der Dienst wurde im September 2025 (mit Ollama v0.12) als "Cloud models" in der Preview eingeführt und nutzt dieselbe lokale CLI, REST-API sowie eine OpenAI-kompatible API wie die lokale Ollama-Runtime. Abrechnung erfolgt nicht nach Token, sondern nach GPU-Zeit über gestaffelte Abo-Stufen (Free, Pro, Max); die lokale Ollama-Software selbst bleibt MIT-lizenziert und unbegrenzt kostenlos nutzbar.
Momentum-Verlauf
01.05.30.07.