

Mlc Ai · seit Ursprüngliches Projekt "Web LLM" April 2023; aktuelles npm-Paket @mlc-ai/web-llm fortlaufend weiterentwickelt (v0.2.84, · 5× · zuletzt 30. Juni 2026
WebLLM ist eine Open-Source In-Browser-Inferenz-Engine des MLC-AI-Teams, die quantisierte LLMs mittels Apache TVM kompiliert und über WebGPU direkt im Browser des Nutzers ausführt – ohne Server-Backend. Es bietet eine zu OpenAI weitgehend kompatible API (inkl. Streaming, JSON-Modus, Function-Calling) und unterstützt gängige offene Modelle wie Llama, Phi, Gemma, Mistral und Qwen im MLC-Format. Als npm-Paket (@mlc-ai/web-llm) unter Apache-2.0-Lizenz lässt es sich modular in Web-Apps integrieren; eine begleitende Referenz-App (WebLLM Chat) demonstriert den Einsatz als privates, vollständig im Browser laufendes Chat-Interface.
Features
| Durchsatz/Latenz | Ca. 15–20 Tokens/Sekunde, abhängig von Hardware und Modellgröße (kleine Modelle bis ~8B praktikabel) |
| Lizenz | Apache-2.0 |
| Plattform | Web-Browser (JavaScript/TypeScript, npm-Paket, CDN), läuft clientseitig via WebGPU/WebAssembly |
| Preis | Kostenlos, Open Source (kein kommerzielles Lizenzmodell) |
| Protokoll-Kompatibilität | Volle OpenAI-API-Kompatibilität (Chat Completions, Streaming, JSON-Modus, Function-Calling in Arbeit) |
| Release-Datum | Erstes Web-LLM-Projekt April 2023; npm-Paket @mlc-ai/web-llm v0.2.0 (Mai) und seither laufend aktualisiert, aktuell v0.2.84 |
| Unterstützte Modelle/Provider | Llama, Phi, Gemma, Mistral, Qwen, RedPajama u.a. im MLC-Format; eigene Custom-Modelle integrierbar |