Lexikon · KI & Technik

Was ist multimodale KI?

Kurz erklärt

Multimodale KI kann mehrere Arten von Daten verarbeiten oder erzeugen – etwa Text, Bilder, Audio und Video – und sie miteinander in Beziehung setzen. Sie beschreibt zum Beispiel ein Foto, beantwortet Fragen zu einem Diagramm oder versteht gesprochene Sprache direkt.

Auch genannt: Multimodales Modell · Multimodal AI

Was eine „Modalität“ ist

Mit Modalität ist die Form einer Information gemeint: geschriebener Text, Bild, gesprochene Sprache, Geräusche, Video, aber auch Tabellen oder Sensordaten. Ein unimodales Modell beherrscht genau eine davon – ein klassisches Sprachmodell nur Text, eine Bilderkennung nur Bilder.

Multimodal ist ein Modell, wenn es mehrere Modalitäten verarbeitet. Dabei lohnt sich ein genauer Blick: Manche Modelle verstehen Bilder und Text als Eingabe, antworten aber nur in Text. Andere können auch Bilder oder Sprache erzeugen. „Multimodal“ sagt also noch nicht, welche Kombinationen ein System wirklich beherrscht.

Wie multimodale Modelle arbeiten

Der Kern ist eine gemeinsame Sprache für alle Datenarten. Jede Modalität bekommt einen eigenen Übersetzer, einen sogenannten Encoder, der Bildausschnitte, Tonabschnitte oder Wörter in Zahlenvektoren umwandelt – ähnlich wie bei einem Embedding. Diese Vektoren landen in einem gemeinsamen Raum, in dem ein Modell sie zusammen verarbeiten kann. So kann es erkennen, dass das Foto eines Hundes und das Wort „Hund“ zusammengehören.

Bei vielen aktuellen Systemen ist der zentrale Teil ein großes Sprachmodell, das zusätzlich gelernt hat, Bild- oder Audiovektoren zu lesen. Es behandelt ein Bild dann im Grunde wie eine Folge besonderer Tokens neben dem Text.

Für die Praxis entscheidend ist weniger die Architektur als die Frage, was ein Modell zuverlässig erkennt. Gedruckter Text auf einem scharfen Foto ist meist kein Problem, krakelige Handschrift, kleine Tabellen oder schräg fotografierte Whiteboards dagegen schon. Ein kurzer Test mit eigenem Material sagt mehr als jede Produktbeschreibung.

Verkettete Systeme und native Modelle

Nicht alles, was nach multimodaler KI aussieht, ist ein einziges Modell. Oft arbeiten spezialisierte Modelle hintereinander:

Verkettetes SystemNatives multimodales Modell
Ablaufz. B. erst Spracherkennung, dann Sprachmodellein Modell verarbeitet Audio und Text direkt
VorteilZwischenergebnis (etwa Transkript) prüfbar, Bausteine austauschbarkann Tonfall, Bildinhalte, Zusammenhänge direkt nutzen
NachteilInformation wie Tonfall geht zwischen den Schritten verlorenweniger nachvollziehbar, Fehler schwerer zu lokalisieren

Für Protokolle hat die Verkettung einen praktischen Vorteil: Das Transkript bleibt als prüfbare Zwischenstufe erhalten. Wer wissen will, ob eine Zusammenfassung stimmt, kann nachlesen, was tatsächlich gesagt wurde.

Einsatz im Büroalltag

Multimodale Modelle sind vor allem dort nützlich, wo Informationen nicht als sauberer Text vorliegen:

  • Foto eines Flipcharts oder Whiteboards nach dem Workshop in eine strukturierte Liste verwandeln
  • Fragen zu einem Diagramm, einer Präsentationsfolie oder einem Bauplan beantworten
  • Gescannte Formulare, Rechnungen oder handschriftliche Notizen auslesen
  • Screenshot einer Fehlermeldung erklären lassen
  • Gesprochene Anweisungen direkt verstehen, ohne Umweg über ein Transkript

Grenzen

Auch multimodale Modelle können sich irren – und zwar auf neue Weise. Sie lesen Zahlen in unscharfen Bildern falsch, verwechseln ähnliche Symbole oder beschreiben Details, die gar nicht im Bild sind. Das ist die Bildvariante der Halluzination.

Beim Datenschutz ist besondere Vorsicht angebracht: Ein Screenshot oder Foto enthält oft mehr, als man auf den ersten Blick sieht – Namen in der Taskleiste, offene Mails, Gesichter im Hintergrund. Was hochgeladen wird, wird auch verarbeitet.

Beispiel
Flipchart und Gespräch zusammenführen

Nach einem Strategie-Workshop fotografiert Teamleiter Berger die drei beschrifteten Flipcharts und lädt sie in einen multimodalen Assistenten hoch. Die Bitte: „Mach daraus eine Liste der Maßnahmen, gruppiert nach den Überschriften.“

Das Modell liest die Handschrift, ordnet die Klebezettel den Spalten zu und liefert eine Liste. Zwei Kürzel kann es nicht entziffern und markiert sie als unklar. Zusammen mit dem Transkript der Abschlussrunde ergänzt Herr Berger die fehlenden Punkte.

Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.

Häufige Fragen
Was bedeutet multimodal bei KI?

Dass ein KI-System mehrere Datenarten wie Text, Bild und Audio verarbeiten oder erzeugen kann, statt nur eine.

Sind ChatGPT und Claude multimodal?

Aktuelle Versionen verarbeiten neben Text auch Bilder und Dokumente. Welche Datenarten genau unterstützt werden, hängt von Modell und App ab.

Was ist der Unterschied zwischen multimodaler und generativer KI?

Generativ beschreibt, dass eine KI Inhalte erzeugt. Multimodal beschreibt, dass sie mehrere Datenarten beherrscht. Viele Modelle sind beides.

Kann multimodale KI Videos verstehen?

Manche Modelle können Videos verarbeiten, meist indem sie einzelne Bilder und die Tonspur auswerten. Die Fähigkeiten unterscheiden sich stark je nach System.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen