Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts

Unknown · seit 2025-02-14 · 2× · zuletzt 30. Juni 2026

2
Momentum

LLaDA (Large Language Diffusion with mAsking) ist ein Open-Source-Sprachmodell mit 8 Milliarden Parametern, das vollständig auf dem Diffusionsprinzip basiert und ohne autoregressive Modellierung von Grund auf trainiert wurde. Es wurde von Forschenden der Renmin University of China und Ant Group entwickelt. Das Modell nutzt einen Vorwärts-Maskierungsprozess und einen Rückwärts-Generierungsprozess über einem Transformer, der maskierte Token vorhersagt. LLaDA wurde auf 2,3 Billionen Tokens vortrainiert und anschließend mit 4,5 Millionen Paaren per Supervised Fine-Tuning (SFT) optimiert.

Momentum-Verlauf
19.05.17.08.

Features

Benchmark-Score (MMLU/ähnlich)MMLU 5-shot: 65,9 (LLaDA 8B Base) — übertrifft LLaMA3 8B Base (65,4) bei gleichen Trainings-Tokens (2,3T); GSM8K: 70,7; Math: 27,3; HumanEval: 33,5
KontextfensterNativ bis 8.192 Tokens (8k); LongBench-Tests zeigen, dass 8k das unterstützte Kontextfenster ist – bei 4k und 8k evaluiert, darüber hinaus gehende Inhalte werden abgeschnitten
Modellgröße (Parameter)8 Milliarden Parameter (8B), trainiert von Grund auf (from scratch)
Preis-TierKostenlos / Open Source (Apache-2.0-lizenziert, Gewichte auf HuggingFace unter GSAI-ML/LLaDA-8B-Base und GSAI-ML/LLaDA-8B-Instruct öffentlich verfügbar)

Weitere Produkte in dieser Kategorie: Open-Source-Sprachmodelle

Belege (2)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.