

Unknown · seit 2025-02-14 · 2× · zuletzt 30. Juni 2026
2
Momentum
LLaDA (Large Language Diffusion with mAsking) ist ein Open-Source-Sprachmodell mit 8 Milliarden Parametern, das vollständig auf dem Diffusionsprinzip basiert und ohne autoregressive Modellierung von Grund auf trainiert wurde. Es wurde von Forschenden der Renmin University of China und Ant Group entwickelt. Das Modell nutzt einen Vorwärts-Maskierungsprozess und einen Rückwärts-Generierungsprozess über einem Transformer, der maskierte Token vorhersagt. LLaDA wurde auf 2,3 Billionen Tokens vortrainiert und anschließend mit 4,5 Millionen Paaren per Supervised Fine-Tuning (SFT) optimiert.
Momentum-Verlauf
19.05.17.08.
Features
| Benchmark-Score (MMLU/ähnlich) | MMLU 5-shot: 65,9 (LLaDA 8B Base) — übertrifft LLaMA3 8B Base (65,4) bei gleichen Trainings-Tokens (2,3T); GSM8K: 70,7; Math: 27,3; HumanEval: 33,5 |
| Kontextfenster | Nativ bis 8.192 Tokens (8k); LongBench-Tests zeigen, dass 8k das unterstützte Kontextfenster ist – bei 4k und 8k evaluiert, darüber hinaus gehende Inhalte werden abgeschnitten |
| Modellgröße (Parameter) | 8 Milliarden Parameter (8B), trainiert von Grund auf (from scratch) |
| Preis-Tier | Kostenlos / Open Source (Apache-2.0-lizenziert, Gewichte auf HuggingFace unter GSAI-ML/LLaDA-8B-Base und GSAI-ML/LLaDA-8B-Instruct öffentlich verfügbar) |