KI-Rückblick August 2026: Preis-Kehrtwende, Open-Weight-Welle und ein scharfer EU AI Act
KI-Rückblick August 2026: Sonnet-5-Preisstopp, Qwen3.8-Max, die Open-Weight-Welle, Google AI Mode auf Gemini Flash und der EU AI Act — eingeordnet.
in KI-Modelle
Was kosten KI-Modelle? Token-Preise nach Input vs. Output, Aufschläge für Tool Use und Reasoning, Batch-Rabatte und Ersparnis durch Prompt Caching — plus wie man die Kosten pro Anfrage realistisch abschätzt.
KI-Modelle kosten Geld — und zwar nicht pauschal pro Monat, sondern pro Token. Wer KI in eigene Workflows einbaut, kommt um eine Auseinandersetzung mit der Preislogik der Anbieter nicht herum: Sie entscheidet, ob ein Use Case wirtschaftlich tragfähig ist oder nicht. Diese Seite bündelt alles rund um KI-Pricing — von Begriffsklärungen bis zu aktuellen Preisänderungen.
Input-Tokens vs. Output-Tokens — beide werden separat abgerechnet, und Output ist meistens drei- bis fünfmal teurer als Input. Grund: Output muss das Modell neu erzeugen, Input nur lesen.
„$3 pro MTok” — gemeint sind eine Million Tokens, nicht ein Megatoken im technischen Sinn. Faustregel: 1.000 Tokens ≈ 750 deutsche Wörter. Eine längere Konversation mit Kontext kann schnell 50.000–100.000 Tokens erreichen — pro Anfrage.
Kontextfenster ≠ kostenlos — nur weil ein Modell ein 1-Million-Token-Kontextfenster anbietet, heißt das nicht, dass die Nutzung billig wird. Jeder Token im Kontext wird beim Senden mitberechnet.
Wer hier einsparen will, kommt früher oder später bei drei Hebeln an: Prompt Caching (wiederholt gesendete Kontexte günstiger), Batch-API (asynchron, ~50 % Rabatt) und Tier-Modelle (kleinere Varianten wie Mini/Flash/Haiku für einfache Aufgaben).
In den News unten siehst du aktuelle Preisänderungen einzelner Anbieter. Blog-Artikel zeigen Praxis-Erfahrungen — was ein KI-Projekt im Alltag wirklich kostet. Im Lexikon findest du den ausführlichen Erklärartikel „KI-Pricing einfach erklärt” mit konkreten Preistabellen, Rechenbeispielen und Sparstrategien. Das Glossar liefert die einzelnen Begriffe — von Input-Token bis Tier-Pricing.
KI-Rückblick August 2026: Sonnet-5-Preisstopp, Qwen3.8-Max, die Open-Weight-Welle, Google AI Mode auf Gemini Flash und der EU AI Act — eingeordnet.
Konkrete Zahlen aus einem Kunden-Setup mit Claude Sonnet. Was Prompt Caching bringt, wann es sich lohnt — und wo die Stolperfallen liegen.
KI-Anbieter kippen Flat-Rates Richtung Verbrauch. Warum das kommen musste, was es kostet und welche drei Hebel den Umstieg abfedern.
Standard-Preisangabe bei KI-APIs — Kosten in US-Dollar pro eine Million verarbeitete Tokens. Wird getrennt für Input, Output und ggf. Cache angegeben.
Tokens, die du beim API-Aufruf an ein KI-Modell sendest — dein Prompt, der Kontext, mitgegebene Dokumente. Werden separat von Output-Tokens und meist deutlich günstiger berechnet.
Tokens, die ein KI-Modell als Antwort erzeugt. Werden separat berechnet und sind meist drei- bis fünfmal teurer als Input-Tokens, weil das Modell sie aktiv generieren muss.
Asynchroner API-Modus, bei dem viele Anfragen gesammelt und mit deutlichem Preisrabatt verarbeitet werden — Ergebnisse liegen meist innerhalb von 24 Stunden vor.
Prompt Caching ist eine API-Funktion, bei der ein Anbieter wiederkehrende Prompt-Bestandteile zwischenspeichert — Folgeanfragen werden dadurch günstiger und schneller, weil der gecachte Teil nicht erneut verarbeitet wird.
Vom API-Anbieter durchgesetzte Obergrenze für Anfragen oder Tokens pro Zeitfenster — schützt die Infrastruktur und sichert faire Nutzung über alle Kunden hinweg.
Mehrstufiges Modell-Angebot eines Anbieters — kleine, schnelle Varianten (Mini/Flash/Haiku) zum Bruchteil des Preises der großen Frontier-Modelle. Auch: Volume-Tiers mit Mengenrabatt.
Wie KI-Modelle abrechnen — Token, Input vs. Output, versteckte Kostentreiber und drei Hebel zum Sparen. Mit Preistabelle und Rechenbeispielen.
Anthropic hat Claude Fable 5.1 und Mythos 5.1 veröffentlicht. Basispreis bleibt, aber Cache-Reads sind 75% günstiger und der Verbrauch sinkt.
Anthropic hat Claude Opus 5.5 veröffentlicht: 4 / 20 $ pro Mio. Token, rund 40 % günstiger als Opus 5 und in Coding-Benchmarks vor Fable 5.1.
OpenAI hat GPT-6.1 Sol veröffentlicht: 2 / 10 $ pro Mio. Token, fast Astra-Niveau bei Coding, aber im Gesamtindex hinter Anthropics Modellen.
Anthropic hat den 50%-Boost beendet. Seit 14. September, 9 Uhr MESZ, gelten dauerhaft +25% zur alten Basis – netto rund 17% weniger als zuvor.
Anthropic veröffentlicht Claude Sonnet 5 am 1. Juli 2026 — laut Hersteller Near-Opus-Leistung zum Einführungspreis von 2/10 Dollar je Mio. Token.
Der für 1. September geplante 50-Prozent-Aufschlag auf Claude Sonnet 5 entfällt. Anthropic macht den Einführungspreis von 2/10 Dollar dauerhaft.