Der ganze Text statt nur Schlagwörter
Früher wurden Dokumente in Archiven und Datenbanken vor allem über Metadaten gefunden: Titel, Aktenzeichen, Datum, vergebene Schlagwörter. Was nicht verschlagwortet war, blieb unauffindbar. Die Volltextsuche durchsucht dagegen jedes Wort eines Dokuments – im Protokoll also auch den Halbsatz auf Seite drei, in dem ein Lieferant nebenbei erwähnt wurde.
Das unterscheidet sie auch von der Suchfunktion „Strg+F“ in einem geöffneten Dokument. Diese liest einen einzelnen Text von vorn bis hinten durch. Eine echte Volltextsuche durchsucht Tausende Dokumente auf einmal und braucht dafür eine vorbereitete Struktur: den Index.
Der invertierte Index
Das Herzstück jeder Volltextsuche funktioniert wie das Stichwortregister am Ende eines Fachbuchs. Statt bei jeder Suche alle Dokumente zu lesen, legt das System vorab eine Liste an: Zu jedem Wort steht, in welchen Dokumenten und an welchen Stellen es vorkommt. Weil die Zuordnung vom Wort zum Dokument geht statt umgekehrt, heißt diese Struktur invertierter Index.
Eine Suche nach „Abnahme“ schlägt dann nur noch im Register nach und bekommt sofort die Liste aller passenden Stellen – auch bei Millionen von Dokumenten in Sekundenbruchteilen. Kommt ein neues Dokument dazu, wird es einmal in den Index aufgenommen.
Was eine gute Volltextsuche zusätzlich kann
Reine Buchstabengleichheit reicht in der Praxis nicht. Gute Suchsysteme bereiten Text und Anfrage deshalb sprachlich auf:
- Groß- und Kleinschreibung ignorieren
- Wortformen zusammenführen: „Protokolle“, „Protokolls“ und „Protokoll“ werden auf eine Grundform zurückgeführt (Stemming oder Lemmatisierung).
- Zusammengesetzte Wörter zerlegen: Wichtig fürs Deutsche – eine Suche nach „Protokoll“ soll auch „Besprechungsprotokoll“ finden.
- Phrasensuche: In Anführungszeichen gesetzte Wortfolgen werden nur in genau dieser Reihenfolge gefunden.
- Verknüpfungen: UND, ODER, NICHT sowie Platzhalter wie „Liefer*“
- Unscharfe Suche: findet auch Treffer mit Tippfehlern
- Ranking: Treffer werden nach Relevanz sortiert, etwa nach dem verbreiteten Verfahren BM25, das berücksichtigt, wie oft ein Wort im Dokument und wie selten es insgesamt vorkommt.
Stärken und Grenzen
Volltextsuche ist unschlagbar, wenn du genau weißt, wonach du suchst: Namen, Rechnungs- und Artikelnummern, Paragrafen, Fachbegriffe, wörtliche Zitate. Sie ist nachvollziehbar – das gesuchte Wort steht im Treffer – und braucht keine KI.
Ihre Grenze sind andere Formulierungen. Wer nach „Kündigung“ sucht, findet die Stelle „Wir wollen den Vertrag auslaufen lassen“ nicht. Dafür gibt es die semantische Suche, die nach Bedeutung sucht. Viele Systeme kombinieren beide Ansätze.
Bei Transkripten kommt eine eigene Fehlerquelle dazu: Hat die Spracherkennung einen Namen falsch verstanden, steht er falsch im Text – und wird nicht gefunden. Ein Benutzerwörterbuch für Namen und Fachbegriffe verbessert deshalb nicht nur das Transkript, sondern auch die spätere Suche.
Ein praktischer Tipp für die Suche in Gesprächsnotizen: Suche nach einem markanten Wortteil statt nach dem ganzen Begriff, und probiere gängige Schreibvarianten aus – bei Namen etwa „Maier“, „Meier“ und „Mayer“. Das kostet Sekunden und findet oft genau die Stelle, die sonst durchgerutscht wäre.
Bauleiterin Hofer sucht in den Transkripten von 80 Baubesprechungen nach dem Begriff „Abnahme“ in Verbindung mit „Leitner“. Die Suche liefert sieben Treffer in vier Meetings, sortiert nach Relevanz, mit dem jeweiligen Satz als Vorschau.
Mit der Phrasensuche „Abnahme am 14.“ grenzt sie auf eine einzige Stelle ein. Was sie nicht findet: die Besprechung, in der vom „Übergabetermin“ die Rede war – da hätte die semantische Suche geholfen.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.