Zurück zum Glossar

Begriff

Pixtral

Erstes multimodales Modell von Mistral AI, im September 2024 unter Apache 2.0 veröffentlicht. Vision-Sprachmodell mit 12 Mrd. Parametern plus 400-Mio.-Vision-Encoder, verarbeitet Text und (mehrere) Bilder; 128K-Kontext, offene Gewichte über Hugging Face.

Pixtral — ausführlicher erklärt

Pixtral (Pixtral 12B) ist das erste multimodale Modell von Mistral AI und wurde im September 2024 unter der offenen Apache-2.0-Lizenz veröffentlicht. Als Vision-Sprachmodell verarbeitet es Text und Bilder in einem gemeinsamen Kontext — ein Schritt über die zuvor rein textbasierten Mistral-Modelle hinaus. Die Gewichte stehen offen zur Verfügung und lassen sich frei herunterladen, selbst hosten und feinabstimmen.

Technisch baut Pixtral auf Mistrals Textmodell Nemo 12B auf und ergänzt es um einen eigenen Vision-Encoder mit rund 400 Millionen Parametern; zusammen ergibt das ein Modell mit rund 12 Milliarden Parametern plus Bild-Adapter. Es unterstützt ein Kontextfenster von bis zu 128.000 Token und kann mehrere Bilder pro Eingabe verarbeiten — übergeben per URL oder als base64-kodierte Daten. Trotz der vergleichsweise kompakten Größe bleibt die Leistung auf reinen Text-Benchmarks konkurrenzfähig.

Der Zugang ist offen: Verfügbar ist Pixtral über Hugging Face (Version Pixtral-12B-2409) sowie über große Cloud-Plattformen.

Beispiel / Praxisbezug

Pixtral eignet sich für Aufgaben, bei denen Bild und Text zusammen betrachtet werden müssen: Bildbeschreibung (Captioning), Objektzählung, das Auslesen von Diagrammen oder Screenshots sowie Dokument-Verständnis mit Abbildungen. Die Möglichkeit, mehrere Bilder gleichzeitig einzugeben, ist etwa für Vergleiche oder Bildserien nützlich.

Für Teams mit Datenschutz- oder Kostenanforderungen ist die Apache-2.0-Lizenz attraktiv: Das Modell lässt sich lokal betreiben, ohne API-Kosten pro Anfrage und ohne dass Bilddaten an einen externen Dienst gehen.

Abgrenzung zu ähnlichen Begriffen

Pixtral ist Mistrals multimodale Linie und unterscheidet sich von den rein textbasierten Mistral-Modellen (etwa Mistral Nemo oder Mistral Large). Gegenüber proprietären Vision-Modellen (GPT-4o, Gemini) ist Pixtral offen lizenziert und selbst hostbar. Der Name kombiniert „Pixel” und „Mistral” und markiert den Bild-Fokus der Linie.

Alle Beiträge im Überblick:Pixtral