Lexikon · KI & Technik

Was ist ein Embedding?

Kurz erklärt

Ein Embedding ist eine Darstellung von Text, Bildern oder Audio als lange Zahlenreihe (Vektor), in der ähnliche Bedeutungen nahe beieinanderliegen. Damit können Computer Bedeutungsähnlichkeit berechnen – die Grundlage von semantischer Suche und RAG.

Auch genannt: Einbettung · Vektorrepräsentation · Vektor-Embedding

Bedeutung als Koordinaten

Stell dir eine Landkarte vor: Jede Stadt hat zwei Koordinaten, und Städte, die nah beieinanderliegen, haben ähnliche Zahlen. Ein Embedding funktioniert nach demselben Prinzip – nur nicht mit zwei, sondern mit Hunderten oder Tausenden Dimensionen, und statt geografischer Nähe wird Bedeutungsnähe abgebildet.

„Vertrag kündigen“ und „Zusammenarbeit beenden“ landen in diesem Raum dicht beieinander, obwohl sie kein Wort gemeinsam haben. „Kuchenrezept“ liegt weit weg. Die einzelnen Dimensionen haben dabei keine für Menschen lesbare Bedeutung wie „Höflichkeit“ oder „Thema Finanzen“ – erst das Zusammenspiel aller Zahlen ergibt die Position.

Wie Embeddings entstehen

Embeddings werden von einem eigens trainierten neuronalen Netz berechnet, dem Embedding-Modell. Es lernt aus riesigen Textmengen, dass Wörter und Sätze, die in ähnlichen Zusammenhängen vorkommen, Ähnliches bedeuten. Die Idee dahinter ist älter als die KI: Sprachwissenschaftler formulierten schon in den 1950er-Jahren, dass man die Bedeutung eines Wortes an seinen Nachbarn erkennt.

Bekannt wurde das Prinzip 2013 durch das Verfahren Word2Vec, das Einzelwörter in Vektoren übersetzte. Berühmt ist das Beispiel, dass sich damit sogar rechnen lässt: Der Vektor von „König“ minus „Mann“ plus „Frau“ liegt nahe bei „Königin“. Heutige Modelle berechnen Embeddings für ganze Sätze und Absätze und berücksichtigen dabei den Zusammenhang – „Bank“ als Sitzgelegenheit und „Bank“ als Geldinstitut landen an verschiedenen Stellen.

Wie Ähnlichkeit gemessen wird

Um zu prüfen, wie ähnlich sich zwei Texte sind, vergleicht man ihre Vektoren. Am verbreitetsten ist die Kosinus-Ähnlichkeit: Sie misst den Winkel zwischen zwei Vektoren. Zeigen sie in fast dieselbe Richtung, liegt der Wert nahe bei 1 – die Texte sind inhaltlich verwandt. Stehen sie fast im rechten Winkel zueinander, haben sie wenig miteinander zu tun.

Wichtig: Vergleichen lassen sich nur Embeddings aus demselben Modell. Jedes Modell baut seinen eigenen Bedeutungsraum auf; Vektoren aus zwei verschiedenen Modellen passen nicht zusammen.

Wofür Embeddings genutzt werden

Embeddings arbeiten meist unsichtbar im Hintergrund, stecken aber in vielen Anwendungen:

  • Semantische Suche: Treffer nach Bedeutung statt nach exakten Wörtern
  • Retrieval-Augmented Generation: passende Dokumentabschnitte für ein Sprachmodell finden
  • Gruppieren: Hunderte Kundenrückmeldungen automatisch nach Themen bündeln
  • Dubletten erkennen: inhaltlich gleiche Tickets oder Anfragen zusammenführen
  • Empfehlungen: ähnliche Artikel, Produkte oder Dokumente vorschlagen

Gespeichert und durchsucht werden große Mengen von Embeddings meist in einer Vektordatenbank.

Wo Embeddings danebenliegen

Embeddings erfassen Themenähnlichkeit gut, feine logische Unterschiede schlechter. „Wir haben Budget“ und „Wir haben kein Budget“ können nah beieinanderliegen, weil sie vom selben Thema handeln. Auch exakte Angaben wie Rechnungsnummern, Artikelcodes oder seltene Eigennamen werden oft unzuverlässig abgebildet – dafür ist klassische Volltextsuche besser.

Beim Datenschutz gilt: Ein Embedding ist kein anonymisierter Text. Aus Vektoren lassen sich unter Umständen Rückschlüsse auf den Inhalt ziehen. Embeddings von personenbezogenen Texten sollten deshalb genauso sorgfältig behandelt werden wie die Texte selbst.

Beispiel
Drei Sätze, eine Suchanfrage

Suchanfrage: „Kunde ist mit dem Preis unzufrieden“

Sehr ähnlich: „Herr Gruber meinte, das Angebot sprengt sein Budget.“ – Ähnlich: „Der Mitbewerber bietet das Paket günstiger an.“ – Kaum ähnlich: „Die Lieferung kommt am Donnerstag.“

Keiner der ersten beiden Sätze enthält die Wörter „Preis“ oder „unzufrieden“. Trotzdem landen sie im Bedeutungsraum nah an der Anfrage – genau das macht Embeddings für die Suche in Gesprächsnotizen so nützlich.

Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.

Häufige Fragen
Was heißt Embedding auf Deutsch?

Wörtlich Einbettung. Gemeint ist, dass Texte oder Bilder in einen mathematischen Raum eingebettet werden, in dem Nähe Bedeutungsähnlichkeit ausdrückt.

Was ist der Unterschied zwischen Embedding und Token?

Ein Token ist ein Textbaustein, etwa ein Wortteil. Ein Embedding ist eine Zahlenreihe, die die Bedeutung eines Tokens, Satzes oder Dokuments darstellt.

Wie viele Dimensionen hat ein Embedding?

Je nach Modell meist einige hundert bis einige tausend. Mehr Dimensionen können feinere Unterschiede abbilden, brauchen aber mehr Speicher.

Kann man aus einem Embedding den Text zurückgewinnen?

Nicht ohne Weiteres wörtlich, aber Rückschlüsse auf den Inhalt sind teilweise möglich. Embeddings gelten daher nicht automatisch als anonym.

Dein nächster Call
schreibt sich selbst mit.

7 Tage alles aus Pro gratis – ohne Kreditkarte.

Jetzt kostenlos testen