

NEAR AI Cloud
#19 in LLM-Inferenz & ServingNear Ai · 7× · zuletzt 30. Juni 2026
0
Momentum
NEAR AI Cloud ist eine Inferenz-Plattform von NEAR AI, die LLMs (u.a. GLM, Qwen, GPT-OSS, Llama, DeepSeek, Mixtral) innerhalb hardware-basierter Trusted Execution Environments (Intel TDX + NVIDIA Confidential Computing) ausführt. Die API ist OpenAI-kompatibel, jede Anfrage erhält eine kryptografische Attestierung als Nachweis, dass Code und Daten in der gesicherten Enklave unverändert liefen. Die Plattform befindet sich aktuell in der Beta-Phase, Abrechnung erfolgt nutzungsbasiert pro Token; Enterprise-Pläne bieten reservierte Kapazität und private Modelle. Offizieller Launch war Anfang Dezember 2025 zusammen mit NEAR Private Chat.
Momentum-Verlauf
19.05.17.08.
Features
| Durchsatz/Latenz | Unterstützt Streaming, Fine-Tuning und hohen Durchsatz mit minimaler Latenz (typischerweise 5–10% Overhead durch TEE) |
| Lizenz | Cloud-API-Repository unter PolyForm Strict License 1.0.0; Enklaven-Runtime, Verifier und Modell-Images sind offen und reproduzierbar |
| Plattform | Cloud-API mit hardware-gesicherten Enklaven (Intel TDX + NVIDIA Confidential Computing); aktuell in Beta |
| Preis | Pay-per-Token, live Preise pro Modell (z.B. GLM-4.6 FP8: $0,75/Mio. Input-Tokens, $2/Mio. Output-Tokens); Enterprise mit reservierter Kapazität |
| Protokoll-Kompatibilität | OpenAI-kompatible API; bestehender OpenAI-SDK-Code funktioniert durch bloße Änderung der Base-URL |
| Release-Datum | 3. Dezember 2025 (offizieller Launch von NEAR AI Cloud und NEAR Private Chat) |
| Unterstützte Modelle/Provider | Katalog offener Modelle wie Llama, Qwen, DeepSeek, Mixtral, GLM, GPT-OSS (TEE-gehostet); zusätzlich proxied Drittanbieter wie OpenAI, Anthropic, Gemini |