Was eine „Entität“ ist
Eine benannte Entität ist etwas Konkretes, das einen Namen trägt oder eindeutig bezeichnet wird. Für Menschen springen diese Stellen beim Lesen sofort ins Auge, für Software sind sie zunächst Wörter wie alle anderen. NER macht sie sichtbar und ordnet sie typischen Kategorien zu:
- Personen: Frau Gruber, Lukas Berger
- Organisationen: Firmen, Behörden, Vereine, Hochschulen
- Orte: Städte, Länder, Adressen, Gebäude
- Zeitangaben: Datum, Uhrzeit, Wochentag, „nächsten Dienstag“
- Zahlen mit Bedeutung: Geldbeträge, Prozentsätze, Mengen
- Je nach Anwendung weitere: Produkte, Aktenzeichen, Gesetze, Medikamente, Vertragsnummern
Die Kategorien sind nicht naturgegeben, sondern werden für jede Anwendung festgelegt. Ein System für Anwaltskanzleien braucht andere Kategorien als eines für Krankenhäuser.
Wie NER funktioniert
Die ersten Systeme arbeiteten mit Regeln und Namenslisten: Was in einer Liste von Städten steht, ist ein Ort; was auf „GmbH“ endet, ist eine Firma. Das funktioniert bei bekannten Namen, versagt aber bei neuen und mehrdeutigen.
Später setzten sich lernende Verfahren durch. Dabei wird jedes Wort eines Satzes markiert, ob es eine Entität beginnt, fortsetzt oder keine ist – in der Fachsprache etwa B-PER (Beginn einer Person), I-PER (Fortsetzung) und O (nichts). Das Modell lernt aus vielen so markierten Beispielsätzen, auch Kontext zu nutzen: Nach „Frau“ folgt meist ein Personenname, nach „bei der“ oft eine Organisation.
Heute übernehmen neuronale Modelle diese Aufgabe, und auch große Sprachmodelle können Entitäten zuverlässig herausziehen, wenn man sie per Prompt darum bittet – mit dem Vorteil, dass sich die Kategorien ohne neues Training frei festlegen lassen.
Wofür NER eingesetzt wird
NER ist selten ein Selbstzweck, sondern ein Zwischenschritt für andere Aufgaben:
- Anonymisierung und Pseudonymisierung: Namen und Orte in Interviewtranskripten finden und ersetzen
- Dokumente verschlagworten: automatisch festhalten, welche Kunden, Projekte und Orte in einem Text vorkommen
- Daten übernehmen: Ansprechpartner, Termine und Beträge aus Mails oder Gesprächsnotizen in strukturierte Felder übertragen
- Suche verbessern: nach allen Dokumenten filtern, in denen eine bestimmte Person oder Firma erwähnt wird
- Zuordnen: ein Meeting dem richtigen Kunden oder Projekt zuweisen
Warum NER auf Deutsch kniffliger ist
Im Englischen ist Großschreibung ein starker Hinweis auf einen Namen. Im Deutschen werden alle Nomen großgeschrieben – „Bauer“ kann ein Beruf oder ein Familienname sein, „Huber“ eine Person und „Huber Bau“ eine Firma. Hinzu kommen verschachtelte Entitäten: In „Universität Innsbruck“ steckt ein Ort in einer Organisation.
Bei Transkripten gesprochener Sprache gibt es eine weitere Hürde: Wenn die Spracherkennung einen ungewöhnlichen Namen falsch verstanden hat, kann ihn auch die beste NER nicht retten. Ein Benutzerwörterbuch mit Namen von Kund:innen und Produkten setzt deshalb einen Schritt früher an.
Eine weitere Feinheit sind Bezüge über Satzgrenzen hinweg. Wenn erst „Frau Berger“ und später nur noch „sie“ oder „die Kollegin“ steht, muss ein System erkennen, dass dieselbe Person gemeint ist. Diese verwandte Aufgabe heißt Koreferenzauflösung und ist besonders in langen Gesprächen wichtig.
„Am Dienstag hat [Frau Berger]Person von der [Hausverwaltung Gruber]Organisation zugesagt, die [2.400 €]Betrag für die Fassade in [Linz]Ort bis [Ende Mai]Zeit freizugeben.“
Aus diesem einen Satz lassen sich damit automatisch eine Ansprechpartnerin, ein Kunde, ein Betrag, ein Ort und eine Frist ablesen – die Grundlage für eine Aufgabe, einen Eintrag in der Kundenakte oder eine Erinnerung.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.