Was eine „Modalität“ ist
Mit Modalität ist die Form einer Information gemeint: geschriebener Text, Bild, gesprochene Sprache, Geräusche, Video, aber auch Tabellen oder Sensordaten. Ein unimodales Modell beherrscht genau eine davon – ein klassisches Sprachmodell nur Text, eine Bilderkennung nur Bilder.
Multimodal ist ein Modell, wenn es mehrere Modalitäten verarbeitet. Dabei lohnt sich ein genauer Blick: Manche Modelle verstehen Bilder und Text als Eingabe, antworten aber nur in Text. Andere können auch Bilder oder Sprache erzeugen. „Multimodal“ sagt also noch nicht, welche Kombinationen ein System wirklich beherrscht.
Wie multimodale Modelle arbeiten
Der Kern ist eine gemeinsame Sprache für alle Datenarten. Jede Modalität bekommt einen eigenen Übersetzer, einen sogenannten Encoder, der Bildausschnitte, Tonabschnitte oder Wörter in Zahlenvektoren umwandelt – ähnlich wie bei einem Embedding. Diese Vektoren landen in einem gemeinsamen Raum, in dem ein Modell sie zusammen verarbeiten kann. So kann es erkennen, dass das Foto eines Hundes und das Wort „Hund“ zusammengehören.
Bei vielen aktuellen Systemen ist der zentrale Teil ein großes Sprachmodell, das zusätzlich gelernt hat, Bild- oder Audiovektoren zu lesen. Es behandelt ein Bild dann im Grunde wie eine Folge besonderer Tokens neben dem Text.
Für die Praxis entscheidend ist weniger die Architektur als die Frage, was ein Modell zuverlässig erkennt. Gedruckter Text auf einem scharfen Foto ist meist kein Problem, krakelige Handschrift, kleine Tabellen oder schräg fotografierte Whiteboards dagegen schon. Ein kurzer Test mit eigenem Material sagt mehr als jede Produktbeschreibung.
Verkettete Systeme und native Modelle
Nicht alles, was nach multimodaler KI aussieht, ist ein einziges Modell. Oft arbeiten spezialisierte Modelle hintereinander:
| Verkettetes System | Natives multimodales Modell | |
|---|---|---|
| Ablauf | z. B. erst Spracherkennung, dann Sprachmodell | ein Modell verarbeitet Audio und Text direkt |
| Vorteil | Zwischenergebnis (etwa Transkript) prüfbar, Bausteine austauschbar | kann Tonfall, Bildinhalte, Zusammenhänge direkt nutzen |
| Nachteil | Information wie Tonfall geht zwischen den Schritten verloren | weniger nachvollziehbar, Fehler schwerer zu lokalisieren |
Für Protokolle hat die Verkettung einen praktischen Vorteil: Das Transkript bleibt als prüfbare Zwischenstufe erhalten. Wer wissen will, ob eine Zusammenfassung stimmt, kann nachlesen, was tatsächlich gesagt wurde.
Einsatz im Büroalltag
Multimodale Modelle sind vor allem dort nützlich, wo Informationen nicht als sauberer Text vorliegen:
- Foto eines Flipcharts oder Whiteboards nach dem Workshop in eine strukturierte Liste verwandeln
- Fragen zu einem Diagramm, einer Präsentationsfolie oder einem Bauplan beantworten
- Gescannte Formulare, Rechnungen oder handschriftliche Notizen auslesen
- Screenshot einer Fehlermeldung erklären lassen
- Gesprochene Anweisungen direkt verstehen, ohne Umweg über ein Transkript
Grenzen
Auch multimodale Modelle können sich irren – und zwar auf neue Weise. Sie lesen Zahlen in unscharfen Bildern falsch, verwechseln ähnliche Symbole oder beschreiben Details, die gar nicht im Bild sind. Das ist die Bildvariante der Halluzination.
Beim Datenschutz ist besondere Vorsicht angebracht: Ein Screenshot oder Foto enthält oft mehr, als man auf den ersten Blick sieht – Namen in der Taskleiste, offene Mails, Gesichter im Hintergrund. Was hochgeladen wird, wird auch verarbeitet.
Nach einem Strategie-Workshop fotografiert Teamleiter Berger die drei beschrifteten Flipcharts und lädt sie in einen multimodalen Assistenten hoch. Die Bitte: „Mach daraus eine Liste der Maßnahmen, gruppiert nach den Überschriften.“
Das Modell liest die Handschrift, ordnet die Klebezettel den Spalten zu und liefert eine Liste. Zwei Kürzel kann es nicht entziffern und markiert sie als unklar. Zusammen mit dem Transkript der Abschlussrunde ergänzt Herr Berger die fehlenden Punkte.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.