

DeepEval
#3 in Observability & EvalsDeepeval · seit Erste PyPI-Veröffentlichung: 15. August 2023 (als "deepeval") · 3× · zuletzt 05. Okt. 2026
DeepEval ist ein Open-Source-Framework von Confident AI zur Evaluierung und zum Testen von LLM-Anwendungen (RAG, Chatbots, AI-Agenten, Voice). Es bietet über 50 vorgefertigte, forschungsbasierte Metriken (u.a. Halluzination, Faithfulness, Answer Relevancy, G-Eval) und lässt sich Pytest-artig in CI/CD-Pipelines integrieren. DeepEval läuft lokal/self-hosted und kann optional mit der kommerziellen Cloud-Plattform Confident AI für Dashboards, Tracing und Team-Kollaboration verbunden werden. Als LLM-Judge unterstützt es praktisch beliebige Modell-Provider wie OpenAI, Anthropic, Gemini, Azure OpenAI, Ollama und über LiteLLM mehr als 100 weitere Modelle.
Features
| Lizenz | Open Source, Apache License 2.0 |
| Plattform | Python-Bibliothek (pip install deepeval); TypeScript-SDK seit Kurzem in Beta |
| Preis | DeepEval (Open Source): kostenlos. Confident AI Cloud: Free-Tier, Starter ab $9,99–$19,99/Nutzer/Monat |
| Protokoll-Kompatibilität | Native OpenTelemetry/OTLP-Unterstützung für Tracing; Metriken für MCP-Interaktionen von AI-Agenten |
| Release-Datum | Erste Version am 15. August 2023 auf PyPI veröffentlicht |
| Unterstützte Modelle/Provider | Beliebiger LLM-Judge: OpenAI (Standard), Anthropic, Gemini, Azure OpenAI, Ollama, Amazon Bedrock, Vertex AI, Grok, sowie 100+ Modelle via LiteLLM |