DeepSeek

DeepSeek

DeepSeek ist ein chinesisches KI-Unternehmen, das Sprachmodelle entwickelt und veröffentlicht, die mit deutlich geringerem Rechenaufwand ähnlich leistungsfähig sind wie die besten Modelle aus den USA. Die Veröffentlichung des Modells DeepSeek-R1 Anfang 2025 löste weltweit eine Debatte über technologische Führung und Kosten in der KI-Entwicklung aus.

DeepSeek ist ein chinesisches Unternehmen, das Computerprogramme entwickelt, die Texte verstehen und erzeugen können — sogenannte Sprachmodelle. Es wurde 2023 von Liang Wenfeng gegründet, dem Mitgründer des Hedgefonds High-Flyer. Anders als die bekanntesten Konkurrenten aus den USA, etwa OpenAI oder Google, veröffentlicht DeepSeek seine Modelle als Open Source: Jeder kann den Programmcode herunterladen und selbst betreiben. Bekannt wurde das Unternehmen vor allem durch sein Modell DeepSeek-R1, das Anfang 2025 in Benchmarks — also standardisierten Leistungstests — mit den damals besten Modellen der Welt gleichzog. Das Aufsehen war groß, weil DeepSeek behauptete, dieses Ergebnis mit einem Bruchteil der üblichen Entwicklungskosten erreicht zu haben.

DeepSeeks Bedeutung für den KI-Wettbewerb

Bis 2025 galt als selbstverständlich, dass bessere KI-Modelle automatisch mehr Geld und mehr Rechenleistung erfordern. Große Unternehmen wie Microsoft oder Google investierten Milliarden in spezielle Chips, sogenannte GPUs, die das Training dieser Modelle ermöglichen. DeepSeek erschütterte diese Annahme.

Das Unternehmen gab an, DeepSeek-V3 für rund sechs Millionen Dollar trainiert zu haben — GPT-4 von OpenAI soll das Hundertfache gekostet haben. Ob diese Zahl den vollen Aufwand abbildet, ist unter Experten umstritten. Dennoch zeigte DeepSeek, dass clevere Algorithmen einen Teil des Kostenvorteils durch schiere Rechenpower ausgleichen können. Das hat politische Folgen: Die USA hatten China den Export modernster KI-Chips verboten, um den technologischen Rückstand Chinas zu vergrößern. DeepSeek deutete an, dass diese Strategie möglicherweise nicht so wirksam ist wie erhofft.

Als DeepSeek-R1 veröffentlicht wurde, fiel der Aktienkurs des Chip-Herstellers Nvidia an einem einzigen Tag um fast 17 Prozent — einer der größten Tagesverluste in der Geschichte des Unternehmens. Investoren fragten sich, ob die Welt wirklich so viele teure Chips braucht, wenn günstigere Alternativen ähnliche Ergebnisse liefern.

Technische Kniffe hinter dem Effizienzsprung

DeepSeek setzt auf eine Kombination aus Ansätzen, die einzeln schon bekannt waren, aber selten so konsequent zusammengebracht wurden. Ein zentrales Element ist die Mixture-of-Experts-Architektur: Das Modell aktiviert pro Anfrage nur einen kleinen Teil seiner internen Bausteine, statt immer das gesamte System zu belasten. Das spart Rechenzeit, ohne die Gesamtfähigkeit zu verringern.

Beim Training von DeepSeek-R1 wurde verstärkt auf eine Methode namens Reinforcement Learning gesetzt — auf Deutsch: bestärkendes Lernen. Das Modell bekommt dabei kein fertiges Lösungsschema vorgegeben, sondern erhält Rückmeldung, ob seine Antwort richtig oder falsch ist, und lernt schrittweise, bessere Lösungswege zu finden. Dieser Ansatz kostet weniger Rechenleistung als das klassische Training auf riesigen Textmengen, weil das Modell gezielt für spezifische Aufgaben — etwa Mathematik oder Programmieren — optimiert wird.

Hinzu kommt, dass DeepSeek seine Gewichte — also die gelernten Zahlenwerte im Modell — veröffentlicht hat. Das erlaubt es der Forschungsgemeinde, die Architektur genau zu studieren und eigene Varianten zu entwickeln. Viele der technischen Berichte von DeepSeek gelten als ungewöhnlich detailliert und transparent für ein kommerzielles Unternehmen.

DeepSeek in Produkten und Schlagzeilen

DeepSeek betreibt eine eigene Chat-Anwendung unter chat.deepseek.com, die nach dem Start von R1 kurzzeitig die meistgeladene App im US-amerikanischen App Store war — vor ChatGPT. Wer keine eigene Infrastruktur betreiben will, kann die Modelle auch über DeepSeeks Programmierschnittstelle (API) in eigene Anwendungen einbinden, ähnlich wie bei OpenAI.

Weil die Modelle als Open Source verfügbar sind, tauchen sie schnell in anderen Produkten auf. Mehrere Cloud-Anbieter, darunter Microsoft Azure und Amazon Web Services, begannen kurz nach der Veröffentlichung, DeepSeek-Modelle in ihren eigenen Diensten anzubieten. Auch kleinere Startups nutzen die Modelle als Grundlage für spezialisierte Anwendungen.

In Nachrichtenartikeln taucht DeepSeek vor allem in zwei Zusammenhängen auf: als Beispiel für den aufholenden chinesischen KI-Sektor und als Argument in der Debatte darüber, ob westliche Exportkontrollen für Chips tatsächlich wirksam sind. Datenschutzbehörden in Europa haben außerdem begonnen zu prüfen, wie DeepSeek mit Nutzerdaten umgeht — ein Thema, das bei chinesischen Technologieprodukten regelmäßig auf die Tagesordnung kommt.

Produkten dorto

Aktuelle Narichten

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.