

FreeToken
#8 in Lokale LLM-RuntimesUnknown · seit 17. August 2026 (arXiv-Preprint und Open-Source-Release) · 2× · zuletzt 26. Aug. 2026
FreeToken ist eine Open-Source-Inferenz-Engine von FlashML (mit Forschern der UC Berkeley, UT Austin und MIT) für das lokale Ausführen großer Mixture-of-Experts-Modelle auf Consumer-Hardware. Die Software verteilt Modellgewichte dynamisch zwischen GPU-VRAM, System-RAM und CPU, sodass Modelle wie Qwen3.6-35B, DeepSeek-V4-Flash 284B oder GLM-5.2 753B auch auf einer einzelnen Consumer- oder Workstation-GPU mit begrenztem VRAM lauffähig sind. Sie bietet OpenAI- und Anthropic-kompatible API-Endpunkte für die Integration mit Coding-Agents wie Claude Code, Codex oder OpenCode. Der Quellcode ist unter Apache-2.0-Lizenz auf GitHub verfügbar, zusätzlich existiert eine Desktop-App für Windows und Linux sowie ein PyPI-Paket.
Features
| Durchsatz/Latenz | Qwen3.6-35B: 39,3 Tok/s auf 8GB RTX 4060 Laptop; DeepSeek-V4-Flash 284B: 22-25 Tok/s auf RTX 5090; GLM-5.2 753B: 14,9 Tok/s auf RTX PRO 6000; 2-4x schneller als Ollama |
| Lizenz | Apache License 2.0 |
| Plattform | Linux x86_64 (CLI) und Windows/Linux Desktop-App; NVIDIA GPU (RTX 30/40/50-Serie), CUDA 13, Treiber r580+ |
| Preis | Kostenlos/Open Source (nur eigene Hardwarekosten) |
| Protokoll-Kompatibilität | OpenAI-kompatible API (/v1/chat/completions, /v1/responses, /v1/models) und Anthropic-kompatible API (/v1/messages) |
| Release-Datum | 17. August 2026 (arXiv-Preprint, Open-Source-Release) |
| Unterstützte Modelle/Provider | Über 20 MoE-Modelle, u.a. DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2; Formate MXFP4, NVFP4, FP8, BF16 |