Auswählen statt umschreiben
Wer einen Fachartikel mit dem Textmarker liest und am Ende nur die markierten Sätze abschreibt, hat eine extraktive Zusammenfassung erstellt. Automatische Verfahren machen genau das: Sie bewerten jeden Satz eines Textes nach seiner Wichtigkeit, wählen die besten aus und geben sie in der ursprünglichen Reihenfolge wieder.
Das Gegenstück ist die abstraktive Zusammenfassung, die Inhalte in neuen Worten wiedergibt. Extraktive Verfahren waren über Jahrzehnte der Standard, weil sie technisch viel einfacher sind: Ein System muss keinen neuen Text erzeugen, sondern nur entscheiden, was wichtig ist.
Wie die wichtigsten Sätze gefunden werden
Für die Bewertung der Sätze haben sich mehrere Ansätze entwickelt, die oft kombiniert werden:
- Häufigkeit: Sätze mit Wörtern, die im Text auffällig oft vorkommen und anderswo selten sind, gelten als zentral. Ein klassisches Maß dafür heißt TF-IDF.
- Position: In Nachrichtentexten stehen die wichtigsten Informationen meist am Anfang, also werden frühe Sätze höher gewichtet.
- Graphverfahren: Sätze „stimmen“ füreinander ab – ein Satz ist wichtig, wenn ihm viele andere Sätze inhaltlich ähneln. Bekannt ist das Verfahren TextRank.
- Lernende Modelle: Ein trainiertes Modell schätzt für jeden Satz, ob er in eine gute Zusammenfassung gehört, oft auf Basis von Embeddings.
- Vermeidung von Wiederholung: Sätze, die fast dasselbe sagen wie ein bereits gewählter, werden zurückgestellt.
Wo extraktive Verfahren ihre Stärken haben
Der große Vorteil: Jeder Satz der Zusammenfassung steht wörtlich so im Original. Es kann nichts dazuerfunden werden, und jede Aussage lässt sich mit einem Klick zur Fundstelle zurückverfolgen. Das ist wertvoll, wo der genaue Wortlaut zählt – bei Vertragsklauseln, Gesetzestexten, Zeugenaussagen oder Zitaten in der Forschung.
Außerdem sind extraktive Verfahren schnell, günstig und lassen sich ohne großes Sprachmodell betreiben. Für das Durchsuchen großer Dokumentmengen, für Vorschautexte in Suchergebnissen oder für das Markieren von Kernstellen in einem langen Bericht sind sie nach wie vor gut geeignet.
Warum sie bei Gesprächen oft scheitern
Bei gesprochener Sprache zeigen sich die Schwächen deutlich. Sätze aus einem Transkript sind oft unvollständig, voller Füllwörter und ohne Zusammenhang kaum verständlich. Ein herausgelöster Satz wie „Ja, dann machen wir das so“ ist zwar möglicherweise der wichtigste des ganzen Meetings – aber ohne die zehn Sätze davor weiß niemand, was „das“ ist.
Hinzu kommt: In Besprechungen entsteht ein Ergebnis selten in einem einzigen Satz. Die Information ist über mehrere Wortmeldungen verteilt, und keine davon fasst sie vollständig zusammen. Ein extraktives Verfahren kann diese Teile nur nebeneinanderstellen, nicht verbinden. Für Meeting-Protokolle haben sich deshalb abstraktive Verfahren durchgesetzt.
Mischformen in der Praxis
Viele Systeme verbinden heute beide Ansätze. Ein häufiges Muster: Zuerst werden die relevanten Stellen extraktiv herausgesucht, dann fasst ein Sprachmodell nur diese abstraktiv zusammen. Oder umgekehrt: Eine abstraktive Zusammenfassung wird um wörtliche Belegzitate mit Zeitstempel ergänzt. So entsteht ein gut lesbarer Text, dessen wichtige Aussagen trotzdem überprüfbar bleiben – das Beste aus beiden Welten.
Aus einem 40-minütigen Call zwischen Hausverwaltung Gruber und einer Dachdeckerfirma wählt ein extraktives Verfahren diese drei Sätze aus:
„Das Dach im Hof ist an zwei Stellen undicht.“ – „Also, wenn das Gerüst bis Mittwoch steht, dann schaffen wir das.“ – „Dann machen wir das so.“
Der erste Satz ist klar. Beim zweiten fehlt, was „das“ ist und welcher Mittwoch gemeint ist. Der dritte ist ohne Kontext wertlos. Eine abstraktive Zusammenfassung würde daraus machen: „Reparatur der zwei undichten Stellen im Hofdach, sofern das Gerüst bis Mittwoch, 12. Juni, steht – beide Seiten einverstanden.“
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.