Begriff
Mixtral 8x7B
Mixtral 8x7B (Dezember 2023) ist Mistral AIs offenes Sparse-MoE-Modell mit 8 Experten — 46,7 Mrd. Parameter, 12,9 Mrd. aktiv pro Token, 32K-Kontext, Apache-2.0-Lizenz.
Mixtral 8x7B — ausführlicher erklärt
Mistral AI veröffentlichte Mixtral 8x7B am 11. Dezember 2023 als quelloffenes Modell unter der Apache-2.0-Lizenz. Es ist ein Sparse-Mixture-of-Experts-Modell (SMoE) mit acht Experten-Netzwerken: Ein gelernter Router wählt pro Token in jeder Schicht zwei der acht Experten aus und kombiniert deren Ausgaben. Das Modell hat 46,7 Mrd. Gesamtparameter, von denen pro Forward-Pass nur rund 12,9 Mrd. aktiviert werden — daher die hohe Effizienz. Das Kontextfenster umfasst 32.768 Token.
Beispiel / Praxisbezug
Mixtral 8x7B übertraf zum Release Llama 2 70B auf den meisten Benchmarks bei rund sechsfach schnellerer Inferenz und erreichte oder überbot GPT-3.5 auf gängigen Standard-Benchmarks. Weil nur ein Bruchteil der Parameter pro Token aktiv ist, liefert das Modell die Qualität eines deutlich größeren Modells zu den Rechenkosten eines kleineren. Als Apache-2.0-Modell mit offenen Gewichten lässt es sich frei herunterladen, anpassen und selbst hosten — ein wichtiger Baustein der frühen Open-Weight-Welle.
Abgrenzung
Mixtral steht innerhalb der Mistral-Familie für die MoE-Architektur — im Unterschied zum dichten Basismodell Mistral 7B, bei dem alle Parameter aktiv sind. Gegenüber späteren, größeren Modellen (etwa Mistral Large) ist Mixtral 8x7B das frühe, effizienzorientierte MoE-Modell. Der Name „8x7B” verweist auf die acht Experten auf Basis der 7B-Architektur, ergibt aber wegen geteilter Komponenten nicht 56 Mrd., sondern 46,7 Mrd. Gesamtparameter.
Entdecke mehr
GPT-6 Astra fand Fragen, die mein erster Security-Review übersehen hatte
Ich habe GPT-6 Astra und Fable 5.1 unabhängig RLS, API-Autorisierung und Mandantentrennung prüfen lassen. Der Cross-Review machte den Unterschied.
GlossarCodestral
Codestral ist Mistral AIs auf Code spezialisiertes Modell (erstmals Mai 2024) — ein 22-Mrd.-Parameter-Modell für Code-Vervollständigung und -Generierung, ursprünglich als offene Gewichte veröffentlicht.
LexikonKI-Modelle vergleichen — wer baut was und wofür wählen
Die wichtigsten Modellfamilien 2026 im Überblick. Wer baut Claude, GPT, Gemini, Llama, Mistral, DeepSeek, Qwen — und welches Modell wofür wählen.