

Inférence & serving LLM — Synthszr Charts
Cette catégorie regroupe les frameworks et moteurs utilisés pour exécuter de grands modèles de langage en production – des serveurs d'inférence aux couches de batching et d'ordonnancement, en passant par les optimisations de latence et de débit. On y trouve des projets comme vLLM, SGLang et TGI, utilisés pour servir des modèles derrière des API ou dans des centres de données auto-hébergés. Ils sont utilisés par des équipes qui doivent faire tourner des modèles à grande échelle et à coût maîtrisé, et non plus seulement les entraîner.
Les Synthszr Charts mesurent pour cette catégorie le momentum à partir des mentions dans des milliers de sources d'actualités et de newsletters, pondéré par la récence et granulaire par version, de sorte que les nouvelles versions comme EAGLE 3.1 sont suivies individuellement. Le classement est mis à jour chaque jour et montre quelles solutions de serving gagnent ou perdent en visibilité.
- 1vLLMvllm · 59× · 13 août 2026100
- 2Lightningnvidia · 4× · 13 août 202672
- 3Computercloudflare · 3× · 07 août 202651
- 4SubQsubquadratic · 18× · 17 août 202646
- 5TabFMgoogle · 9× · 27 juil. 202642
- 6SGLanglmsys · 11× · 05 août 202638
- 7Workers AIcloudflare · 2× · 08 août 202629
- 8Mooncakemoonshot · 2× · 19 juil. 202619
- 9ModelOptnvidia · 2× · 15 juil. 202616
- 10Yansubentoml · 3× · 01 juin 20263
- 11TGIhugging-face · 2× · 19 juin 20263
- 12CoreWeave Sandboxescoreweave · 3× · 24 mai 20262
- 13Text Generation Inferencehugging-face · 2× · 28 mai 20261
- 14Groq Llamagroq · 2× · 17 mai 20261
- 15vLLM 0.20.0vllm · 4× · 29 avr. 20261
- 16TokenSpeedlightseeking · 2× · 12 mai 20261
- 17Docker Model Runnerdocker · 2× · 08 mai 20261
- 18HybridClawhybridai · 2× · 29 avr. 20260
- 19NEAR AI Cloudnear-ai · 7× · 03 avr. 20260
- 20IronClawnear-ai · 7× · 03 avr. 20260
- 21TensorRT-LLMnvidia · 2× · 29 avr. 20260
- 22ClawProtencent · 2× · 04 mai 20260
- 23HDNA Workbenchunknown · 2× · 15 avr. 20260
- 24Crusoe Managed Inferencecrusoe · 2× · 07 avr. 20260