Bedeutung statt Buchstaben
Klassische Suche vergleicht Zeichenketten. Steht das gesuchte Wort im Text, gibt es einen Treffer, sonst nicht. Das stößt schnell an Grenzen: Menschen sagen dasselbe mit sehr verschiedenen Worten. Eine Kundin beschwert sich über den „Preis“, die nächste findet das Angebot „zu teuer“, ein dritter sagt, das „Budget gibt das heuer nicht her“.
Besonders deutlich wird das bei gesprochener Sprache. In Meeting-Transkripten fallen Fachbegriffe selten in Reinform; man umschreibt, deutet an, verwendet Dialekt. Wer dort nach Stichwörtern sucht, muss alle möglichen Formulierungen erraten. Semantische Suche nimmt dir das ab.
So funktioniert sie
Alle Dokumente werden vorab in Abschnitte zerlegt und von einem KI-Modell in Embeddings übersetzt – Zahlenvektoren, die die Bedeutung abbilden. Diese werden meist in einer Vektordatenbank gespeichert.
Bei einer Suchanfrage wird auch die Anfrage in einen Vektor übersetzt. Dann sucht das System die Abschnitte, deren Vektoren am nächsten liegen, und sortiert sie nach Ähnlichkeit. Viele Systeme schalten danach noch einen zweiten Schritt nach: Ein genaueres, aber langsameres Modell bewertet die besten Kandidaten erneut und bringt sie in eine bessere Reihenfolge. Dieses Nachsortieren heißt Reranking.
Semantische Suche und Volltextsuche im Vergleich
Beide Verfahren haben klare Stärken – und genau entgegengesetzte Schwächen:
| Semantische Suche | Volltextsuche | |
|---|---|---|
| Findet | inhaltlich Ähnliches, auch mit anderen Worten | genau die eingegebenen Wörter und ihre Formen |
| Stark bei | Umschreibungen, Synonymen, Fragen in Alltagssprache | Namen, Nummern, Codes, exakten Zitaten |
| Schwach bei | Rechnungsnummern, seltenen Eigennamen, Verneinungen | Synonymen und Umschreibungen |
| Nachvollziehbar? | eher nicht – warum etwas ähnlich ist, bleibt verborgen | ja – das Wort steht im Treffer |
Details zur Wortsuche unter Volltextsuche.
Hybride Suche: das Beste aus beiden
Weil sich die Schwächen ergänzen, kombinieren viele Systeme beide Verfahren. Eine Anfrage läuft parallel durch Volltext- und semantische Suche, und die beiden Ergebnislisten werden zu einer gemeinsamen Rangfolge zusammengeführt. Wer nach „Angebot Gruber zu teuer“ sucht, bekommt dann Treffer, in denen der Name Gruber exakt vorkommt und es inhaltlich um Preisbedenken geht.
Auch in RAG-Systemen, in denen ein Sprachmodell vor dem Antworten passende Stellen sucht, hat sich hybride Suche als robuster Standard etabliert.
Wo semantische Suche irrt
Semantische Suche wirkt manchmal fast magisch, hat aber typische Fehlerbilder:
- Es gibt immer ein Ergebnis: Auch wenn nichts Passendes existiert, liefert sie die „ähnlichsten“ Einträge – die dann trotzdem irrelevant sein können.
- Verneinungen: „Es gab keine Beschwerden“ kann bei einer Suche nach Beschwerden weit oben landen.
- Exakte Angaben: Rechnungsnummern, Paragrafen oder Produktcodes werden unzuverlässig gefunden.
- Fachsprache: Begriffe, die im Training des Embedding-Modells selten vorkamen, werden schlechter eingeordnet.
Ein guter Umgang damit: Bei Suchen nach exakten Angaben auf Volltextsuche setzen, bei offenen Fragen auf semantische Suche – und Treffer immer im Zusammenhang lesen, bevor man daraus Schlüsse zieht.
Vertriebsleiter Gruber will wissen, in welchen Kundengesprächen des letzten Quartals der Preis ein Thema war. Eine Stichwortsuche nach „Preis“ findet vier Gespräche.
Die semantische Suche findet zusätzlich: „Das Budget ist heuer schon ziemlich ausgeschöpft“, „Der Mitbewerber ist da deutlich günstiger“ und „Für das Geld hätten wir uns mehr erwartet“ – drei Gespräche, in denen das Wort „Preis“ nie fällt.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.