Bedeutung als Koordinaten
Stell dir eine Landkarte vor: Jede Stadt hat zwei Koordinaten, und Städte, die nah beieinanderliegen, haben ähnliche Zahlen. Ein Embedding funktioniert nach demselben Prinzip – nur nicht mit zwei, sondern mit Hunderten oder Tausenden Dimensionen, und statt geografischer Nähe wird Bedeutungsnähe abgebildet.
„Vertrag kündigen“ und „Zusammenarbeit beenden“ landen in diesem Raum dicht beieinander, obwohl sie kein Wort gemeinsam haben. „Kuchenrezept“ liegt weit weg. Die einzelnen Dimensionen haben dabei keine für Menschen lesbare Bedeutung wie „Höflichkeit“ oder „Thema Finanzen“ – erst das Zusammenspiel aller Zahlen ergibt die Position.
Wie Embeddings entstehen
Embeddings werden von einem eigens trainierten neuronalen Netz berechnet, dem Embedding-Modell. Es lernt aus riesigen Textmengen, dass Wörter und Sätze, die in ähnlichen Zusammenhängen vorkommen, Ähnliches bedeuten. Die Idee dahinter ist älter als die KI: Sprachwissenschaftler formulierten schon in den 1950er-Jahren, dass man die Bedeutung eines Wortes an seinen Nachbarn erkennt.
Bekannt wurde das Prinzip 2013 durch das Verfahren Word2Vec, das Einzelwörter in Vektoren übersetzte. Berühmt ist das Beispiel, dass sich damit sogar rechnen lässt: Der Vektor von „König“ minus „Mann“ plus „Frau“ liegt nahe bei „Königin“. Heutige Modelle berechnen Embeddings für ganze Sätze und Absätze und berücksichtigen dabei den Zusammenhang – „Bank“ als Sitzgelegenheit und „Bank“ als Geldinstitut landen an verschiedenen Stellen.
Wie Ähnlichkeit gemessen wird
Um zu prüfen, wie ähnlich sich zwei Texte sind, vergleicht man ihre Vektoren. Am verbreitetsten ist die Kosinus-Ähnlichkeit: Sie misst den Winkel zwischen zwei Vektoren. Zeigen sie in fast dieselbe Richtung, liegt der Wert nahe bei 1 – die Texte sind inhaltlich verwandt. Stehen sie fast im rechten Winkel zueinander, haben sie wenig miteinander zu tun.
Wichtig: Vergleichen lassen sich nur Embeddings aus demselben Modell. Jedes Modell baut seinen eigenen Bedeutungsraum auf; Vektoren aus zwei verschiedenen Modellen passen nicht zusammen.
Wofür Embeddings genutzt werden
Embeddings arbeiten meist unsichtbar im Hintergrund, stecken aber in vielen Anwendungen:
- Semantische Suche: Treffer nach Bedeutung statt nach exakten Wörtern
- Retrieval-Augmented Generation: passende Dokumentabschnitte für ein Sprachmodell finden
- Gruppieren: Hunderte Kundenrückmeldungen automatisch nach Themen bündeln
- Dubletten erkennen: inhaltlich gleiche Tickets oder Anfragen zusammenführen
- Empfehlungen: ähnliche Artikel, Produkte oder Dokumente vorschlagen
Gespeichert und durchsucht werden große Mengen von Embeddings meist in einer Vektordatenbank.
Wo Embeddings danebenliegen
Embeddings erfassen Themenähnlichkeit gut, feine logische Unterschiede schlechter. „Wir haben Budget“ und „Wir haben kein Budget“ können nah beieinanderliegen, weil sie vom selben Thema handeln. Auch exakte Angaben wie Rechnungsnummern, Artikelcodes oder seltene Eigennamen werden oft unzuverlässig abgebildet – dafür ist klassische Volltextsuche besser.
Beim Datenschutz gilt: Ein Embedding ist kein anonymisierter Text. Aus Vektoren lassen sich unter Umständen Rückschlüsse auf den Inhalt ziehen. Embeddings von personenbezogenen Texten sollten deshalb genauso sorgfältig behandelt werden wie die Texte selbst.
Suchanfrage: „Kunde ist mit dem Preis unzufrieden“
Sehr ähnlich: „Herr Gruber meinte, das Angebot sprengt sein Budget.“ – Ähnlich: „Der Mitbewerber bietet das Paket günstiger an.“ – Kaum ähnlich: „Die Lieferung kommt am Donnerstag.“
Keiner der ersten beiden Sätze enthält die Wörter „Preis“ oder „unzufrieden“. Trotzdem landen sie im Bedeutungsraum nah an der Anfrage – genau das macht Embeddings für die Suche in Gesprächsnotizen so nützlich.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.