KI-Modelle vergleichen — wer baut was und wofür wählen
Die wichtigsten Modellfamilien 2026 im Überblick. Wer baut Claude, GPT, Gemini, Llama, Mistral, DeepSeek, Qwen — und welches Modell wofür wählen.
in KI-Modelle
Offene MoE- und Reasoning-Modelle von DeepSeek (China) — die V-Reihe als Allzweck-MoE, die R-Reihe für Reasoning und die multimodale Janus-Linie; bekannt für starke Leistung bei niedrigen Kosten.
Am 20. Januar 2025 unter MIT-Lizenz veröffentlichtes offenes Reasoning-Modell des chinesischen Labors DeepSeek. Mixture-of-Experts mit 671 Mrd. Parametern (37 Mrd. pro Token aktiv), stark über Reinforcement Learning trainiert; erreichte als erstes offenes Modell OpenAIs o1-Niveau.
DeepSeek V4.1-Flash (10. September 2026) ist das kleinste Modell der neuen DeepSeek-V4.1-Architektur — erste DeepSeek-Familie mit nativer multimodaler Bildverarbeitung. Speed-/kosten-optimiertes „Flash"-Modell mit offenen Gewichten (MIT), über boostN nutzbar.
DeepSeek V4-Pro (2026) ist das Open-Weight-Flaggschiff von DeepSeek — ein 1,6-Billionen-Parameter-MoE mit rund 49B aktiven Parametern pro Token, 1-Mio.-Tokens-Kontext und MIT-Lizenz.
DeepSeek V4-Flash (Juli 2026) ist ein offenes MoE-Modell mit 284 Mrd. Parametern (13 Mrd. aktiv), 1-Mio.-Token-Kontext und MIT-Lizenz — frei ladbar auf Hugging Face.
Janus-Pro-7B ist DeepSeeks Open-Source-Multimodal-Modell vom Januar 2025 — vereint Bildverstehen und Bildgenerierung in einer einzigen 7B-Architektur, MIT-lizenziert.
DeepSeek V3 ist ein im Dezember 2024 veröffentlichtes offenes KI-Modell des chinesischen Anbieters DeepSeek. Es nutzt eine Mixture-of-Experts-Architektur mit 671 Milliarden Parametern (37 Mrd. aktiv je Token) und rund 128.000 Tokens Kontext.
DeepSeek V3.1 ist das Open-Weights-Hybridmodell von DeepSeek vom August 2025 — vereint Think- und Non-Think-Modus in einem Modell, mit 128K-Kontext und starken Agenten-Fähigkeiten.
DeepSeek V3.2 (1. Dezember 2025) ist ein offenes MoE-Modell mit 685 Mrd. Parametern unter MIT-Lizenz — dank DeepSeek Sparse Attention besonders effizient bei langen Kontexten.
DeepSeek V4 (April 2026) ist die vierte Generation des chinesischen Open-Weight-MoE-Modells — als Pro (1,6 T Parameter) und Flash (284 B) unter MIT-Lizenz veröffentlicht, mit 1-Mio.-Tokens-Kontext.
Die wichtigsten Modellfamilien 2026 im Überblick. Wer baut Claude, GPT, Gemini, Llama, Mistral, DeepSeek, Qwen — und welches Modell wofür wählen.
Claude, GPT, Gemini, Llama & Co. — wer baut was, wofür ist welche Familie gut, und wie wählt man das passende Modell für die eigene Aufgabe aus.
DeepSeek V4.1-Flash: Platz 1 bei Coding unter 1h, Absturz bei Agentik über 1h. Preise, Benchmarks und ehrliche Einordnung im Lexikon.
DeepSeek V als offene Modelllinie: Positionierung, Einsatzprofil, Auswahlhilfe. Flaggschiff DeepSeek V4-Pro, günstig und selbst hostbar.
DeepSeek macht den 75-%-Rabatt auf V4-Pro dauerhaft: 0,435 $ Input, 0,87 $ Output je Mio. Token. Was der Preisdruck für die Modellwahl bedeutet.
Juli bis August 2026 brachte eine Welle offener Modelle: GLM-5.3, DeepSeek V4-Pro, Qwen3.8. Was die permissiven Lizenzen für Self-Hosting bedeuten.
DeepSeek veröffentlicht V4.1-Flash: in eigenen Coding-Tests vorn, bei Langläufer-Agentik weit hinten — zum Bruchteil des Preises der Konkurrenz.