Begriff
DeepSeek V4-Flash
DeepSeek V4-Flash (Juli 2026) ist ein offenes MoE-Modell mit 284 Mrd. Parametern (13 Mrd. aktiv), 1-Mio.-Token-Kontext und MIT-Lizenz — frei ladbar auf Hugging Face.
DeepSeek V4-Flash — ausführlicher erklärt
DeepSeek veröffentlichte die Produktionsversion DeepSeek-V4-Flash (deepseek-ai/DeepSeek-V4-Flash-0731) am 31. Juli 2026 als quelloffenes Modell unter der MIT-Lizenz. Es ist ein Mixture-of-Experts-Modell (MoE) mit 284 Mrd. Gesamtparametern — 304 Mrd. inklusive des angehängten DSpark-Moduls für spekulatives Decoding —, von denen pro Token rund 13 Mrd. aktiviert werden. Zu den technischen Merkmalen zählen dynamische Reasoning-Steuerung und fortgeschrittene Sparse-Attention-Mechanismen.
Beispiel / Praxisbezug
Die offenen Gewichte liegen auf Hugging Face (166,9 GB über 48 Shards, BF16-Tensoren im 0731-GA-Stand); die API läuft in einer öffentlichen Beta. Das Modell fasst laut Release-Angaben den vollen 1-Mio.-Token-Kontext in einer einzelnen 128-GB-Maschine. Weil die Gewichte frei und unter MIT-Lizenz verfügbar sind, lässt sich V4-Flash on-premises betreiben — relevant für Teams mit Datenschutz- oder Kostenanforderungen, die nicht auf proprietäre APIs angewiesen sein wollen. Bemerkenswert: Das kleinere Flash-Modell übertraf in Berichten Teile des eigenen Flaggschiffs.
Abgrenzung
V4-Flash ist die schlanke, effiziente Variante der DeepSeek-V4-Reihe unterhalb der größeren V4-Pro-Modelle (bis 1,6 Bio. MoE-Parameter). Anders als proprietäre Modelle von OpenAI, Anthropic oder Google steht DeepSeek für offene Gewichte: Der Zugang erfolgt nicht nur über eine API, sondern durch freien Download und Selbstbetrieb der Gewichte.
Entdecke mehr
GPT-6 Astra fand Fragen, die mein erster Security-Review übersehen hatte
Ich habe GPT-6 Astra und Fable 5.1 unabhängig RLS, API-Autorisierung und Mandantentrennung prüfen lassen. Der Cross-Review machte den Unterschied.
GlossarDeepSeek R1
Am 20. Januar 2025 unter MIT-Lizenz veröffentlichtes offenes Reasoning-Modell des chinesischen Labors DeepSeek. Mixture-of-Experts mit 671 Mrd. Parametern (37 Mrd. pro Token aktiv), stark über Reinforcement Learning trainiert; erreichte als erstes offenes Modell OpenAIs o1-Niveau.
LexikonKI-Modelle vergleichen — wer baut was und wofür wählen
Die wichtigsten Modellfamilien 2026 im Überblick. Wer baut Claude, GPT, Gemini, Llama, Mistral, DeepSeek, Qwen — und welches Modell wofür wählen.