$/MTok (Kosten pro Million Tokens)
Standard-Preisangabe bei KI-APIs — Kosten in US-Dollar pro eine Million verarbeitete Tokens. Wird getrennt für Input, Output und ggf. Cache angegeben.
Konkrete KI-Modelle und Modellfamilien im Überblick — wer sie entwickelt, wie sie sich in Reasoning, Coding, Multimodalität und Preis unterscheiden und wofür die einzelnen Linien im Alltag am besten taugen. Gegliedert nach Anbieter-Familien (GPT, Claude, Gemini …) und übergreifenden Einsatzzwecken wie Security, Bild & Video oder Open-Weight.
Standard-Preisangabe bei KI-APIs — Kosten in US-Dollar pro eine Million verarbeitete Tokens. Wird getrennt für Input, Output und ggf. Cache angegeben.
Universal-2 ist AssemblyAIs kommerzielles Speech-to-Text-Modell mit branchenfuehrender Genauigkeit (mittlere WER um 6 Prozent) und starker Formatierung, Zeichensetzung sowie Eigennamen-Erkennung ueber 99 Sprachen.
Asynchroner API-Modus, bei dem viele Anfragen gesammelt und mit deutlichem Preisrabatt verarbeitet werden — Ergebnisse liegen meist innerhalb von 24 Stunden vor.
Chatterbox ist ein quelloffenes Text-to-Speech-Modell von Resemble AI unter MIT-Lizenz. In Blindtests bevorzugten Hoerer es mehrheitlich gegenueber ElevenLabs; es bietet Emotionssteuerung, Voice-Cloning und niedrige Latenz.
Claude Fable 5 ist Anthropics erstes öffentlich verfügbares Modell der Mythos-Klasse, veröffentlicht im Juni 2026. Es ist auf anspruchsvollstes Schlussfolgern und langlaufende agentische Arbeit ausgelegt und bietet ein 1-Million-Token-Kontextfenster.
Am 1. September 2026 veröffentlichtes Spitzenmodell der Claude-Fable-Linie von Anthropic. Frontier-Modell für anspruchsvolles Reasoning, Coding, Recherche und lange Agenten-Läufe; 1M-Token-Kontext, multimodale Eingabe, proprietärer Zugang über API und Claude-Apps.
Claude Haiku 4.5 ist Anthropics schnelles Kompaktmodell vom Oktober 2025 — bringt Sonnet-4-nahe Leistung bei rund einem Drittel der Kosten und ist das erste Haiku-Modell mit Reasoning.
Claude Mythos (April 2026) ist Anthropics bisher leistungsstärkstes Modell — ein neuer Tier oberhalb der Opus-Reihe, primär verteilt über das Glasswing-Programm an Cybersecurity-Defender.
Claude Mythos 5 (9. Juni 2026) ist Anthropics leistungsstärkste Modell-Linie oberhalb von Opus — technisch identisch mit Fable 5, aber ohne dessen Sicherheits-Klassifikatoren, verteilt über Project Glasswing.
Claude Mythos 5.1 (September 2026) ist Anthropics Frontier-Modell fuer geprüfte Cyber- und Life-Science-Organisationen — dasselbe Modell wie Fable 5.1, nur mit freizuegigeren Safeguards.
Claude Opus 4.5 ist Anthropics Top-Tier-Modell vom November 2025 — der direkte Vorgänger von Opus 4.6, bringt „Infinite Chats" und deutlich reduzierten Token-Verbrauch.
Claude Opus 4.8 ist das im Mai 2026 veröffentlichte Spitzenmodell der Opus-Linie von Anthropic. Es zielt auf agentisches Programmieren, komplexes Schlussfolgern und Computer-Nutzung und gilt als schrittweise, aber messbare Verbesserung gegenüber Opus 4.7.
Am 24. Juli 2026 veröffentlichtes Spitzenmodell der Claude-Opus-Linie von Anthropic. Positioniert als leistungsstarkes Alltagsmodell für Wissensarbeit, Coding und Agenten; Zugang proprietär über Claude-App und API (Modell-ID claude-opus-5).
Claude Sonnet 4.5 (September 2025) ist Anthropics auf Agenten und Coding optimiertes Modell der Sonnet-Linie — bei Erscheinen fuehrend auf SWE-bench Verified, inzwischen von neueren Sonnet-Versionen abgeloest.
Claude Sonnet 4.6 ist Anthropics mittleres Modell vom Februar 2026 — nahe an Opus-Niveau, mit 1-Mio.-Token-Kontext und unveraendertem Sonnet-Preis von 3/15 USD pro Mio. Token.
Claude Sonnet 5 ist Anthropics Mittelklasse-Modell vom 30. Juni 2026 — das bislang agentischste Sonnet, mit Leistung nahe Opus 4.8 bei 2 USD Input und 10 USD Output je 1 Mio. Tokens.
Claude Sonnet 5.5 (28. September 2026) ist Anthropics günstiges Mittelklasse-Modell — eine schnellere, preiswertere Ergänzung zu Opus 5.5, mit 2/10 $ je 1 Mio. Token und dem Spitzenwert bei Terminal-Bench 4.0. Über boostN nutzbar.
Code Llama ist Metas auf Programmierung spezialisierte Llama-2-Variante vom August 2023 — offen gewichtet, in mehreren Größen und mit Basis-, Python- und Instruct-Ausprägungen.
Codestral ist Mistral AIs auf Code spezialisiertes Modell (erstmals Mai 2024) — ein 22-Mrd.-Parameter-Modell für Code-Vervollständigung und -Generierung, ursprünglich als offene Gewichte veröffentlicht.
Nova-3 ist Deepgrams Echtzeit-Speech-to-Text-Modell (Release Februar 2025) mit sehr niedriger Streaming-Latenz von rund 200 bis 300 Millisekunden, Keyterm-Prompting und Unterstuetzung fuer ueber 30 Sprachen.
Janus-Pro-7B ist DeepSeeks Open-Source-Multimodal-Modell vom Januar 2025 — vereint Bildverstehen und Bildgenerierung in einer einzigen 7B-Architektur, MIT-lizenziert.
Am 20. Januar 2025 unter MIT-Lizenz veröffentlichtes offenes Reasoning-Modell des chinesischen Labors DeepSeek. Mixture-of-Experts mit 671 Mrd. Parametern (37 Mrd. pro Token aktiv), stark über Reinforcement Learning trainiert; erreichte als erstes offenes Modell OpenAIs o1-Niveau.
DeepSeek V3 ist ein im Dezember 2024 veröffentlichtes offenes KI-Modell des chinesischen Anbieters DeepSeek. Es nutzt eine Mixture-of-Experts-Architektur mit 671 Milliarden Parametern (37 Mrd. aktiv je Token) und rund 128.000 Tokens Kontext.
DeepSeek V3.1 ist das Open-Weights-Hybridmodell von DeepSeek vom August 2025 — vereint Think- und Non-Think-Modus in einem Modell, mit 128K-Kontext und starken Agenten-Fähigkeiten.
DeepSeek V3.2 (1. Dezember 2025) ist ein offenes MoE-Modell mit 685 Mrd. Parametern unter MIT-Lizenz — dank DeepSeek Sparse Attention besonders effizient bei langen Kontexten.
DeepSeek V4 (April 2026) ist die vierte Generation des chinesischen Open-Weight-MoE-Modells — als Pro (1,6 T Parameter) und Flash (284 B) unter MIT-Lizenz veröffentlicht, mit 1-Mio.-Tokens-Kontext.
DeepSeek V4-Flash (Juli 2026) ist ein offenes MoE-Modell mit 284 Mrd. Parametern (13 Mrd. aktiv), 1-Mio.-Token-Kontext und MIT-Lizenz — frei ladbar auf Hugging Face.
DeepSeek V4-Pro (2026) ist das Open-Weight-Flaggschiff von DeepSeek — ein 1,6-Billionen-Parameter-MoE mit rund 49B aktiven Parametern pro Token, 1-Mio.-Tokens-Kontext und MIT-Lizenz.
DeepSeek V4.1-Flash (10. September 2026) ist das kleinste Modell der neuen DeepSeek-V4.1-Architektur — erste DeepSeek-Familie mit nativer multimodaler Bildverarbeitung. Speed-/kosten-optimiertes „Flash"-Modell mit offenen Gewichten (MIT), über boostN nutzbar.
Devstral ist Mistral AIs offenes Agenten-Modell für Software-Engineering (Mai 2025) — trainiert darauf, echte GitHub-Issues zu lösen, und stark auf SWE-bench Verified.
ElevenLabs v3 ist ein hochexpressives Text-to-Speech-Modell mit Inline-Audio-Tags fuer Emotion, Betonung und nonverbale Laute. Es unterstuetzt ueber 70 Sprachen sowie Mehrsprecher-Dialoge und gilt als Referenz fuer Realismus.
Fish Audio S2 ist ein quelloffenes Text-to-Speech-Modell aus der Fish-Speech-Familie. Mit Inline-Tags steuert es Emotion und Betonung auf Wortebene, unterstuetzt ueber 80 Sprachen und liefert sehr niedrige Latenz.
FLUX.2 ist die Text-zu-Bild-Modellfamilie von Black Forest Labs. Sie umfasst die proprietaeren Varianten Pro und Flex sowie das offene 32-Mrd.-Parameter-Modell Dev und die kompakte Klein-Reihe, die Bilderzeugung und Bildbearbeitung in einem Modell vereinen.
Foundation-Sec-8B ist Cisco Foundation AIs offenes, auf Cyber-Security spezialisiertes Sprachmodell (2025). Es erweitert Llama-3.1-8B durch fortgesetztes Pretraining auf rund 5 Mrd. Security-Tokens und steht unter Apache-2.0-Lizenz frei zur Verfügung.
Gemini 3 Flash ist Googles schnelles, günstiges Thinking-Modell vom 17. Dezember 2025 — Pro-nahe Reasoning-Leistung bei 1 Mio. Token Kontext, ausgelegt auf agentische Workflows und Coding.
Gemini 3 Pro (November 2025) ist Googles drittes Flaggschiff-Modell mit 1-Mio.-Tokens-Kontextfenster und nativer Multimodalität — inzwischen abgelöst von Gemini 3.1 Pro.
Gemini 3.1 Pro (Februar 2026) ist Googles aktuelles Top-Modell — 1-Mio.-Tokens-Kontext, 64K Output-Tokens, verdoppelte Reasoning-Leistung gegenüber Gemini 3 Pro.
Gemini 3.5 Flash ist Googles hocheffizientes Multimodal-Modell vom Mai 2026 — bringt Pro-nahe Coding- und Reasoning-Qualität zu Flash-typischen Kosten und Geschwindigkeit.
Gemini 3.6 Flash (Juli 2026) ist Googles schnelle, kostenguenstige Flash-Stufe mit 1-Mio.-Tokens-Kontext — auf hohen Durchsatz und niedrige Kosten pro Anfrage ausgelegt.
Gemini 3.7 Flash (August 2026) ist Googles schnelles Workhorse-Modell fuer Coding und Agenten — 1-Mio.-Token-Kontext, Einstiegspreis 0,75/3,75 USD pro Mio. Token, halb so teuer wie 3.6 Flash.
Gemini 3.8 Flash (September 2026) ist Googles intelligentestes Workhorse-Modell fuer Coding, Agenten und mehrstufiges Reasoning — 1-Mio.-Token-Kontext, Einstiegspreis 0,75/3,75 USD pro Mio. Token, direkter Nachfolger von 3.7 Flash.
Gemma 3 ist die im März 2025 veröffentlichte Familie offener KI-Modelle von Google. Sie umfasst vier Größen (1B, 4B, 12B, 27B), ist ab 4B multimodal, unterstützt über 140 Sprachen und bietet bis zu 128.000 Tokens Kontext.
Offenes, mobil-first ausgelegtes KI-Modell von Google, als Preview im Mai 2025 und voll ab 26. Juni 2025 verfügbar. Multimodal (Text, Bild, Audio, Video), auf Geräte-Betrieb optimiert; offene Gewichte in den Größen E2B und E4B.
Gemma 4 ist Google DeepMinds offene Modellfamilie vom April 2026 — vier Größen (E2B bis 31B), 256k-Kontext, Multimodalität, Apache-2.0-Lizenz.
GLM-4.5 ist ein im Juli 2025 veröffentlichtes offenes KI-Modell von Zhipu AI (Z.ai). Es ist ein agent-natives Mixture-of-Experts-Modell mit 355 Milliarden Parametern (32 Mrd. aktiv), 128.000 Tokens Kontext und MIT-Lizenz.
GLM-4.6 ist Zhipu AIs Open-Weight-MoE-Modell vom September 2025 — 355 Mrd. Parameter (32B aktiv), 200k-Kontext, MIT-lizenziert, mit Schwerpunkt auf Coding-Performance.
GLM-4.7 (Dezember 2025) ist Zhipu AIs offenes Coding-Flaggschiff — ein MoE-Modell mit rund 400 Mrd. Parametern, 200K-Input-Kontext und dem Feature „Preserved Thinking".
Im Februar 2026 unter MIT-Lizenz veröffentlichtes offenes Modell von Zhipu AI (Z.AI). Mixture-of-Experts mit rund 744 Mrd. Parametern (ca. 40 Mrd. pro Token aktiv), 200K-Kontext, Fokus auf Coding und Agenten. Frei herunterladbar über Hugging Face.
GLM-5.1 ist Z.ais Open-Source-Flaggschiff vom April 2026 — 744 Mrd. Parameter (40B aktiv), 200k-Kontext, ausgelegt auf agentisches Coding mit bis zu 8 Stunden autonomer Laufzeit.
GLM-5.2 (Juni 2026) ist das Open-Weight-Modell von Zhipu AI (Z.ai) — ein MoE mit rund 744B Parametern (~40B aktiv), 1-Mio.-Tokens-Kontext und MIT-Lizenz, stark bei agentischem Coding.
GLM-5.3 ist Zhipu AIs Open-Weights-Modell vom August 2026 — ein MoE-Modell mit Fokus auf Coding und Cybersecurity, das bei agentischen Benchmarks die Spitze der offenen Modelle erreicht.
Google Imagen ist die Text-zu-Bild-Modellfamilie von Google DeepMind. Die aktuelle Generation Imagen 4 erschien 2025 in den Stufen Fast, Generate und Ultra, ist ueber Gemini API und Vertex AI verfuegbar und bekannt fuer starke Typografie und Prompt-Treue.
GPT-6 Astra ist OpenAIs Flaggschiff vom September 2026 — erstes Modell auf der Preparedness-Stufe Critical, mit Schwerpunkt auf Computer-Use und Cybersecurity.
GPT Image 2 ist OpenAIs natives Bildmodell (April 2026), das vor dem Zeichnen schließt, sehr zuverlässig Text rendert und in hoher Auflösung fotorealistische Bilder erzeugt.
GPT Luna (GPT-5.6 Luna) ist das kleinste, schnellste und günstigste Modell der im Juli 2026 veröffentlichten GPT-5.6-Familie von OpenAI. Es ist für kostensensible Massen-Workloads ausgelegt und bietet ein Kontextfenster von rund 1,05 Millionen Tokens.
GPT-5.6 Sol ist OpenAIs Flaggschiff vom Juli 2026 — Spitzenmodell einer neuen Sonnensystem-Familie (Sol, Terra, Luna) mit Fokus auf Coding, Wissenschaft und Cybersecurity.
GPT Terra ist die mittlere Stufe von OpenAIs GPT-5.6-Familie (Juli 2026) zwischen dem sparsamen Luna und dem Flaggschiff Sol — mit 1-Mio.-Tokens-Kontext auf ein starkes Preis-Leistungs-Verhaeltnis ausgelegt.
GPT-4o (Mai 2024) war OpenAIs erstes nativ multimodales Modell — Text, Audio und Bild in einem einheitlichen Modell, mit Echtzeit-Sprachmodus und deutlich niedrigeren Kosten als GPT-4 Turbo.
GPT-4o mini (Juli 2024) ist OpenAIs kleine, günstige Variante von GPT-4o — als Ablösung für GPT-3.5 Turbo positioniert, deutlich stärker bei spürbar niedrigerem Preis pro Token.
GPT-5.2 ist OpenAIs Modell-Generation vom Dezember 2025 — drei Varianten (instant, thinking, Pro), 400k-Kontextfenster und neuer Stand der Technik bei beruflicher Wissensarbeit.
GPT-5.3 ist eine Iteration der GPT-5-Reihe von OpenAI — die Instant-Variante kam am 3. März 2026 und fokussiert sich auf Faktentreue, kürzere Vorreden und natürlicheren Konversationsfluss.
GPT-5.3-Codex ist OpenAIs spezialisiertes agentisches Coding-Modell (Februar 2026), Nachfolger von GPT-5.2-Codex — 25 % schneller, mit deutlichen Sprüngen bei Terminal-Bench und OSWorld.
GPT-5.3-Codex-Spark ist OpenAIs Coding-Modell vom Februar 2026 — eine kleinere, real-time-optimierte Variante von GPT-5.3-Codex mit über 1000 Tokens pro Sekunde auf Cerebras-Hardware.
GPT-5.4 ist OpenAIs Reasoning-Modell vom 5. März 2026 — erstes Mainline-Modell mit den Coding-Fähigkeiten von GPT-5.3-codex, nativer Computer-Use-Steuerung und 1-Mio.-Tokens-Kontext.
GPT-5.5 ist OpenAIs Flaggschiff vom 23. April 2026 — positioniert als „smartestes und intuitivstes Modell" und gedacht als Schritt Richtung KI, die selbstständig durch Tools arbeitet.
GPT-6.1 Sol (29. September 2026) ist OpenAIs günstiges Coding- und Agenten-Modell — Nachfolger von GPT-6 Sol nach nur sieben Tagen, mit nahezu der Intelligenz von GPT-6 Astra zu rund einem Fünftel des Preises. Über boostN nutzbar.
Echtzeit-Sprachmodell von OpenAI, seit 8. Juli 2026 die Standard-Sprachfunktion in ChatGPT. Hört und spricht gleichzeitig (bidirektional), erlaubt Unterbrechungen und reicht komplexe Fragen an ein stärkeres Textmodell weiter. Proprietärer Zugang über ChatGPT.
Am 17. Februar 2025 veröffentlichtes Reasoning-Modell von xAI (Elon Musks KI-Firma). Trainiert auf dem Colossus-Supercluster, mit „Think"-Reasoning und DeepSearch sowie Echtzeit-Zugriff auf X. Proprietärer Zugang über die Grok-App und API.
Grok 4 ist xAIs Reasoning-Modell vom Juli 2025 — Text- und Bild-Eingabe, 256k-Kontext, trainiert per Reinforcement Learning auf dem 200.000-GPU-Cluster Colossus.
Grok 4.1 ist das im November 2025 veröffentlichte KI-Modell von xAI. Es liefert natürlichere Dialoge, weniger Halluzinationen und bessere Stilkontrolle und ist in zwei Varianten verfügbar: einer direkt antwortenden und einer vorab schlussfolgernden (Thinking).
Grok 4.3 ist xAIs Reasoning-orientiertes Modell vom April 2026 — mit 1-Mio.-Token-Kontext, nativer Video-Eingabe und Fokus auf agentische Workflows und faktische Genauigkeit.
Grok 4.5 ist xAIs Frontier-Modell vom Juli 2026 für Coding, agentische Aufgaben und Wissensarbeit — hohe Token-Effizienz bei 2 USD Input und 6 USD Output je 1 Mio. Tokens.
Grok 4.6 (August 2026) ist xAIs Flaggschiff-Modell fuer langlaufende agentische Arbeit — 500k-Token-Kontext, Text- und Bild-Input, gestaffelter Preis ab 2/6 USD pro Mio. Token.
Hunyuan3D 2.0 ist Tencents offenes generatives 3D-Modell (Januar 2025). Es erzeugt in zwei Stufen hochauflösende 3D-Assets mit Texturen aus Text oder Bild und unterstützt Text-, Bild-, Skizzen- und Porträt-zu-3D. Die Gewichte sind auf Hugging Face frei verfügbar.
Hyper3D Rodin ist ein kommerzielles 3D-Generierungsmodell von Deemos. Die Generation 2.5 erzeugt aus Bild oder Text hochdetaillierte Geometrie mit ueber 10 Millionen Polygonen und 3D-nativen PBR-Texturen und gilt als fuehrend bei Photorealismus.
Tokens, die du beim API-Aufruf an ein KI-Modell sendest — dein Prompt, der Kontext, mitgegebene Dokumente. Werden separat von Output-Tokens und meist deutlich günstiger berechnet.
Kimi K2 ist die Open-Weight-MoE-Modellreihe von Moonshot AI mit 1 Billion Parametern und 32 Mrd. aktiven Parametern, trainiert auf 15,5 Billionen Tokens — Fokus auf Agenten- und Coding-Aufgaben.
Kimi K2 Thinking (November 2025) ist Moonshot AIs offenes Reasoning-Agenten-Modell — ein Billion-Parameter-MoE mit 256K Kontext, das lange Denk- und Tool-Use-Ketten eigenständig durchläuft.
Kimi K2.5 ist ein im Januar 2026 veröffentlichtes offenes KI-Modell von Moonshot AI. Es ist ein natives multimodales Mixture-of-Experts-Modell mit rund 1 Billion Parametern (32 Mrd. aktiv), 256.000 Tokens Kontext und agentischen Fähigkeiten.
Kimi K2.6 ist Moonshot AIs Open-Weight-Agent-Modell vom April 2026 — 1 Billion Parameter (32B aktiv), 262k-Kontext, nativ multimodal, mit Agent-Swarms aus bis zu 300 Subagenten.
Kimi K3 (Juli 2026) ist Moonshot AIs Flaggschiff mit offenen Gewichten — ein MoE-Modell mit 2,8 Bio. Parametern (104 Mrd. aktiv), nativer Vision und 1-Mio.-Token-Kontext.
Kling 3.0 ist das Video-Modell von Kuaishou, veröffentlicht am 5. Februar 2026. Es erzeugt bis zu 15 Sekunden lange, fotorealistische Clips mit nativem Ton in mehreren Sprachen und gilt als preis-leistungsstärkster Video-Generator.
Kokoro ist ein offenes Text-to-Speech-Modell (v1.0, Januar 2025) mit nur 82 Mio. Parametern. Es erzeugt natürlich klingende Sprache in 8 Sprachen mit 54 Stimmen, läuft mit rund 1 GB VRAM und steht unter Apache-2.0-Lizenz.
Llama 2 ist Metas offen gewichtetes Sprachmodell vom Juli 2023 — das erste Llama mit kommerziell nutzbarer Lizenz, in den Größen 7B, 13B und 70B mit 4K-Kontext.
Am 18. April 2024 veröffentlichte offene Modellgeneration von Meta. Erschien zunächst in den Größen 8B und 70B (jeweils Basis- und Instruct-Variante) unter der Llama-3-Community-Lizenz; frei herunterladbar, für Forschung und kommerzielle Nutzung.
Llama 3.1 (Juli 2024) ist Metas Open-Weight-Familie in 8B, 70B und 405B mit 128K-Kontext und Mehrsprachigkeit — das 405B war das erste offene Modell auf Augenhoehe mit GPT-4o und Claude 3.5 Sonnet.
Llama 3.2 ist Metas Modellgeneration vom September 2024 — erstmals mit Vision-Unterstützung (11B/90B) und schlanken Edge-Modellen (1B/3B) für Mobil- und On-Device-Einsatz.
Llama 3.3 (Dezember 2024) ist Metas offenes 70B-Instruct-Modell — es erreicht 405B-Klasse-Qualitaet bei 70B-Kosten, mit 128K-Kontext und offenen Gewichten.
Llama 4 Maverick (April 2025) ist Metas große Mixture-of-Experts-Variante der Llama-4-Reihe — 17 Mrd. aktive von 400 Mrd. Parametern auf 128 Experten, 1-Mio.-Tokens-Kontext.
Llama 4 Scout (April 2025) ist Metas kleine Mixture-of-Experts-Variante der Llama-4-Reihe — 17 Mrd. aktive von 109 Mrd. Parametern, 10-Mio.-Tokens-Kontext, multimodal.
Llama-3-SauerkrautLM-70b ist ein deutschsprachig DPO-feingetuntes 70B-Modell auf Basis von Meta Llama 3, entwickelt von VAGOsolutions und Hyperspace.ai.
Magistral ist Mistral AIs erstes Reasoning-Modell vom Juni 2025 — mit transparenter, nachvollziehbarer Argumentationskette und Stärke in europäischen Sprachen, teils als offene Gewichte.
Meshy ist eine kommerzielle Hosted-Plattform fuer 3D-Generierung aus Text oder Bild. Version 6 erzeugt in etwa einer Minute produktionsreife Assets mit PBR-Texturen, Auto-Retopology und Rigging und gilt als vielseitiges Allround-Werkzeug.
Microsoft TRELLIS.2 ist das staerkste offene Bild-zu-3D-Modell (4 Mrd. Parameter, MIT-Lizenz). Es erzeugt in Sekunden hochaufloesende Assets mit nativen PBR-Materialien und unterstuetzt Gaussian Splatting; Gewichte sind auf Hugging Face frei verfuegbar.
Midjourney v8 ist die achte Generation des Bildgenerators von Midjourney (Alpha März 2026) mit rund fünffach schnellerer Erzeugung, nativer 2K-Auflösung und verbesserter Textwiedergabe.
MiniMax ist ein 2021 in Shanghai gegründetes KI-Labor, dessen offene M-Modellfamilie (LLMs) auf sehr lange Kontextfenster und niedrige Betriebskosten durch Sparse Attention setzt.
Mistral 7B (September 2023) ist das erste Open-Weight-Modell von Mistral AI — ein 7,3B-Parameter-Modell unter Apache 2.0, das damals das groessere Llama 2 13B in Benchmarks uebertraf.
Mistral Large 3 (Dezember 2025) ist Mistrals offenes MoE-Flaggschiff — 675 Mrd. Parameter, 256K-Tokens-Kontext, nativ multimodal, Apache 2.0.
Mistral Medium 3 ist ein im Mai 2025 veröffentlichtes proprietäres KI-Modell von Mistral AI. Es ist als Enterprise-Modell auf hohe Leistung bei niedrigen Betriebskosten ausgelegt, bietet rund 128.000 Tokens Kontext und ist auch on-premise oder in der eigenen VPC betreibbar.
Mistral Small 4 ist Mistral AIs Open-Weight-MoE-Modell vom März 2026 — vereint Reasoning, Vision und Coding in einem Modell, 119B Parameter (6,5B aktiv), Apache 2.0.
Mixtral 8x7B (Dezember 2023) ist Mistral AIs offenes Sparse-MoE-Modell mit 8 Experten — 46,7 Mrd. Parameter, 12,9 Mrd. aktiv pro Token, 32K-Kontext, Apache-2.0-Lizenz.
Muse Spark ist Metas closed-weight-Flaggschiff vom April 2026 — das erste Modell der Muse-Linie aus den Meta Superintelligence Labs, mit Fokus auf effizientes Reasoning per Thought Compression.
Canary ist NVIDIAs offene ASR- und Speech-Translation-Modellfamilie (CC-BY-4.0), die auf dem Open-ASR-Leaderboard bei englischer Genauigkeit vor OpenAI Whisper liegt und 25 europaeische Sprachen abdeckt.
Claude Opus 4.6 ist Anthropics Flaggschiff-Modell vom Februar 2026 — Top-Tier der Claude-4-Familie mit 1-Mio.-Tokens-Kontext, gestärktem Coding und neuen Effort-Controls.
Claude Opus 4.7 ist Anthropics Top-Tier-Modell vom April 2026 — Nachfolger von Opus 4.6 mit hochauflösender Bildverarbeitung, neuem xhigh-Effort-Level und Task-Budgets für lange agentische Läufe.
Tokens, die ein KI-Modell als Antwort erzeugt. Werden separat berechnet und sind meist drei- bis fünfmal teurer als Input-Tokens, weil das Modell sie aktiv generieren muss.
Erstes multimodales Modell von Mistral AI, im September 2024 unter Apache 2.0 veröffentlicht. Vision-Sprachmodell mit 12 Mrd. Parametern plus 400-Mio.-Vision-Encoder, verarbeitet Text und (mehrere) Bilder; 128K-Kontext, offene Gewichte über Hugging Face.
Prompt Caching ist eine API-Funktion, bei der ein Anbieter wiederkehrende Prompt-Bestandteile zwischenspeichert — Folgeanfragen werden dadurch günstiger und schneller, weil der gecachte Teil nicht erneut verarbeitet wird.
Im September 2024 veröffentlichte offene Modellfamilie von Alibaba. Umfasst Basisgrößen von 0,5B bis 72B Parametern plus Coder- und Math-Varianten; 128K-Kontext, mehrsprachig. Kleinere Größen unter Apache 2.0, das 72B-Modell unter eigener Qwen-Lizenz.
Qwen 3 ist die im April 2025 veröffentlichte Familie offener KI-Modelle von Alibaba. Sie reicht von 0,6B bis 235B Parametern (dichte und MoE-Modelle), steht unter Apache-2.0-Lizenz und vereint einen Thinking- und einen Non-Thinking-Modus in einem Modell.
Qwen 3.5 (Februar 2026) ist Alibabas offene Modellfamilie der dritten Generation — von 0,8B bis 397B Parameter, MoE-Flaggschiff mit 1-Mio.-Tokens-Kontext, multimodal.
Qwen 3.6 ist Alibabas Open-Weights-Modell vom April 2026 — die dichte 27B-Variante erreicht auf agentischen Coding-Benchmarks das Niveau deutlich größerer MoE-Modelle, unter Apache-2.0-Lizenz.
Qwen 3.7-Max (Mai 2026) ist Alibabas proprietaeres Max-Flaggschiff mit 1-Mio.-Tokens-Kontext, positioniert als „Agent Frontier" fuer lange, tool-intensive Agenten-Workflows.
Qwen 3.8-Max (August 2026) ist Alibabas groesstes Flaggschiff — ein MoE-Modell mit 2,4 Bio. Parametern, 1-Mio.-Token-Kontext und multimodalem Input, spaeter mit offenen Gewichten.
Qwen3-Max ist Alibabas Billion-Parameter-Flaggschiff vom September 2025 — ein Mixture-of-Experts-Modell mit 262K Kontext, das anders als frühere Qwen-Modelle nur über API zugänglich ist.
Vom API-Anbieter durchgesetzte Obergrenze für Anfragen oder Tokens pro Zeitfenster — schützt die Infrastruktur und sichert faire Nutzung über alle Kunden hinweg.
Runway Gen-4.5 ist das Video-Modell von Runway, das aus Text oder Bild 5- und 10-Sekunden-Clips mit starker Prompt-Treue und cineastischer Bewegung erzeugt. Es entstand mit NVIDIA und nutzt eine Autoregressive-to-Diffusion-Technik.
SauerkrautLM ist eine deutschsprachige LLM-Familie des deutschen Startups VAGOsolutions — Feintunings auf Basis von Llama, Qwen, Mistral und anderen offenen Architekturen.
Sec-Gemini v1 ist Googles experimentelles, auf Gemini basierendes KI-Modell fuer Cybersecurity. Es kombiniert Gemini-Reasoning mit aktueller Threat Intelligence aus Mandiant, der OSV-Schwachstellendatenbank und Google Threat Intelligence.
Seedream 4.0 ist ByteDances multimodales Bildmodell (September 2025), das Text und mehrere Bilder als Eingabe verarbeitet, bis zu 4K rendert und über zehnmal schneller ist als Seedream 3.0.
Mehrstufiges Modell-Angebot eines Anbieters — kleine, schnelle Varianten (Mini/Flash/Haiku) zum Bruchteil des Preises der großen Frontier-Modelle. Auch: Volume-Tiers mit Mengenrabatt.
Tripo AI ist eine kommerzielle 3D-Generierungsplattform von VAST AI. Version 3.1 fuehrt 2026 die ELO-Arena-Rankings an und liefert aus Text oder Bild game-ready Modelle mit sauberer Quad-Topologie, PBR-Texturen und Auto-Rigging.
Veo 3.1 ist Googles Video-Modell (DeepMind), das aus Text oder Bild 8-Sekunden-Clips mit nativ synchronisiertem Ton erzeugt. Seit dem Update im Januar 2026 liefert es echtes 4K (3840x2160) sowie vertikale Formate.
Whisper ist OpenAIs offenes Speech-to-Text-Modell von 2022 — ein mehrsprachiger Encoder-Decoder-Transformer, der Audio in Text umwandelt und in mehreren Größen unter MIT-Lizenz verfügbar ist.