Entitätsextraktion
Die Entitätsextraktion ist die Aufgabe der Verarbeitung natürlicher Sprache (Natural Language Processing, NLP), bei der automatisch bedeutsame im Text erwähnte Dinge identifiziert und jeweils nach Typ gekennzeichnet werden. Zu diesen Dingen können Personen, Organisationen, Orte, Daten, Produkte und andere domänenrelevante Entitäten gehören. In vielen Systemen ist die Erkennung benannter Entitäten (Named Entity Recognition, NER) ein zentraler Bestandteil der Entitätsextraktion, doch die Entitätsextraktion kann je nach Schema und Anwendungsfall auch umfassender sein.
Kurz gesagt: Die Entitätsextraktion findet Namen, Orte und andere Entitäten im Text und markiert, worum es sich jeweils handelt, wodurch Fließtext in strukturierte Fakten umgewandelt wird, die Maschinen durchsuchen und nutzen können.
Wie die Entitätsextraktion funktioniert
Das Ziel besteht darin, von rohem Text zu einer beschrifteten Liste von Entitäten zu gelangen, üblicherweise in mehreren Schritten:
- Vorverarbeitung: Der Text wird bereinigt und in Token und Sätze aufgeteilt.
- Erkennung: Das System lokalisiert Textabschnitte, die sich auf Entitäten beziehen. Beispielsweise könnte „Brave Software wurde 2015 in San Francisco gegründet" analysiert werden als Brave Software [ORG], San Francisco [LOC], 2015 [DATE].
- Klassifizierung: Jedem erkannten Abschnitt wird ein Typ zugewiesen, etwa Person, Organisation, Ort, Datum oder eine benutzerdefinierte Domänenkategorie. Frühe Systeme verwendeten für diesen Schritt Regeln und Wörterbücher; die meisten Produktivsysteme setzen heute transformerbasierte Modelle ein, die den Typ aus dem Kontext ableiten, anstatt aus festen Mustern.
- Entitätsverknüpfung (optionaler nächster Schritt): Extrahierte Entitäten können anschließend an die Entitätsverknüpfung übergeben werden, die jeden Eintrag einem eindeutigen Datensatz in einer Wissensdatenbank zuordnet und Begriffe kontextbasiert eindeutig macht.
- Ausgabe: Entitäten, Typen und Verknüpfungen werden als strukturierte Daten zurückgegeben, oft dem Dokument als Metadaten angehängt oder in einen Wissensgraph eingespeist.
Das charakteristische Merkmal ist, dass die Entitätsextraktion nicht nur Wörter findet; sie identifiziert, worauf diese Wörter verweisen und um welche Art von Ding es sich jeweils handelt. Es ist dieser letztere Schritt, der Text in eine maschinell nutzbare Struktur umwandelt.
Entitätsextraktion im Vergleich zu Schlüsselwortextraktion, Entitätsverknüpfung und Relationsextraktion
- Schlüsselwortextraktion extrahiert häufige oder prägnante Wörter und Phrasen, ohne anzugeben, worum es sich handelt; die Entitätsextraktion identifiziert bestimmte reale Dinge und kennzeichnet jedes nach Typ.
- Entitätsverknüpfung verbindet eine extrahierte Entität mit einem eindeutigen Datensatz in einer Wissensdatenbank wie Wikidata und bestimmt, welches reale Ding gemeint ist; die Entitätsextraktion ist der vorangehende Schritt, der die Erwähnung findet und typisiert.
- Relationsextraktion identifiziert, wie Entitäten miteinander in Beziehung stehen, etwa „Brave Software stellt eine Such-API her"; die Entitätsextraktion identifiziert die Entitäten, die diese Beziehungen verbinden.
Wo die Entitätsextraktion eingesetzt wird
- Wissensgraphen: Extrahierte Entitäten und ihre Typen werden zu Knoten, die einen Wissensgraph füllen.
- Suche und Abruf: Das Kennzeichnen von Dokumenten mit Entitäten verbessert das Filtern, Facettieren und Abgleichen von Entitäten in einer Query mit Inhalten, was sowohl der klassischen Suche als auch KI-Antwortmaschinen zugutekommt.
- Inhaltsanreicherung: Artikel, Support-Tickets und Produktseiten können automatisch mit den Entitäten gekennzeichnet werden, die sie erwähnen, wodurch reichhaltigere Metadaten entstehen.
- Strukturierte Daten und Markup: Extrahierte Entitäten können schema.org-Typen zugeordnet werden, was Crawlern und KI-Systemen hilft zu verstehen, worum es auf einer Seite geht.
- Fragebeantwortung: Das Identifizieren von Entitäten in einer Frage und in möglichen Antworten hilft einem System, die richtigen Fakten abzurufen und zu verifizieren.
Zu den gängigen Werkzeugen gehören Open-Source-Bibliotheken wie spaCy und auf Hugging Face gehostete Modelle sowie verwaltete Cloud-APIs. Die Entitätsextraktion ist am nützlichsten, wenn ein System vom Zeichenkettenabgleich zum Verständnis realer Konzepte übergehen muss.
Verwandte Begriffe
Erkennung benannter Entitäten (NER), Entitätsverknüpfung, Relationsextraktion, Wissensgraph, Semantische Suche, Embeddings, strukturierte Daten, Verarbeitung natürlicher Sprache (NLP), schema.org.