Extraction d’entités
L’extraction d’entités est une tâche de traitement automatique du langage naturel (TALN) qui consiste à identifier automatiquement les éléments significatifs mentionnés dans un texte et à attribuer un type à chacun d’eux. Ces éléments peuvent inclure des personnes, des organisations, des lieux, des dates, des produits et d’autres entités pertinentes selon le domaine. Dans de nombreux systèmes, la reconnaissance d’entités nommées (NER) constitue un élément central de l’extraction d’entités, mais cette dernière peut aussi avoir une portée plus large selon le schéma et le cas d’usage.
En résumé : l’extraction d’entités repère les noms, les lieux et d’autres entités dans un texte et indique ce que chacun représente, transformant ainsi la prose en faits structurés que les machines peuvent parcourir et exploiter.
Comment fonctionne l’extraction d’entités
L’objectif est de passer d’un texte brut à une liste d’entités étiquetées, généralement en plusieurs étapes :
- Prétraitement : le texte est nettoyé, puis découpé en jetons et en phrases.
- Détection : le système localise les passages de texte qui font référence à des entités. Par exemple, « Brave Software a été fondée à San Francisco en 2015 » pourrait être analysé comme Brave Software [ORG], San Francisco [LIEU], 2015 [DATE].
- Classification : chaque passage détecté se voit attribuer un type tel que personne, organisation, lieu, date ou une catégorie personnalisée propre au domaine. Les premiers systèmes utilisaient des règles et des dictionnaires pour cette étape ; la plupart des systèmes en production s’appuient aujourd’hui sur des modèles à base de transformeurs qui déduisent le type à partir du contexte plutôt que de motifs figés.
- Liaison d’entités (étape suivante facultative) : les entités extraites peuvent ensuite être transmises à la liaison d’entités, qui associe chaque entrée à un enregistrement unique dans une base de connaissances, en levant l’ambiguïté des termes en fonction du contexte.
- Sortie : les entités, les types et les liens sont renvoyés sous forme de données structurées, souvent rattachées au document en tant que métadonnées ou intégrées à un graphe de connaissances.
La caractéristique déterminante est que l’extraction d’entités ne se contente pas de repérer des mots ; elle identifie ce à quoi ces mots font référence et de quel type d’élément il s’agit dans chaque cas. C’est cette dernière étape qui convertit le texte en une structure exploitable par les machines.
Extraction d’entités et extraction de mots-clés, liaison d’entités et extraction de relations
- L’extraction de mots-clés fait ressortir les mots et expressions fréquents ou marquants sans préciser ce qu’ils sont ; l’extraction d’entités identifie des éléments concrets du monde réel et attribue un type à chacun.
- La liaison d’entités relie une entité extraite à un enregistrement unique dans une base de connaissances telle que Wikidata, en déterminant à quelle réalité elle correspond ; l’extraction d’entités est l’étape préalable qui repère la mention et lui attribue un type.
- L’extraction de relations identifie la manière dont les entités sont liées entre elles, par exemple « Brave Software conçoit une API de recherche » ; l’extraction d’entités identifie les entités que ces relations relient.
Où l’extraction d’entités est-elle utilisée
- Graphes de connaissances : les entités extraites et leurs types deviennent des nœuds qui alimentent un graphe de connaissances.
- Recherche et récupération : l’étiquetage des documents à l’aide d’entités améliore le filtrage, la navigation à facettes et la mise en correspondance des entités d’une requête avec le contenu, ce qui profite à la fois à la recherche classique et aux moteurs de réponse par IA.
- Enrichissement du contenu : les articles, les tickets d’assistance et les pages produit peuvent être étiquetés automatiquement avec les entités qu’ils mentionnent, ce qui crée des métadonnées plus riches.
- Données structurées et balisage : les entités extraites peuvent correspondre aux types de schema.org, ce qui aide les robots d’indexation et les systèmes d’IA à comprendre le sujet d’une page.
- Systèmes de questions-réponses : identifier les entités dans une question et dans les réponses candidates aide un système à récupérer et à vérifier les bons faits.
Parmi les outils courants figurent des bibliothèques open source telles que spaCy et des modèles hébergés sur Hugging Face, ainsi que des API cloud gérées. L’extraction d’entités est particulièrement utile lorsqu’un système doit passer de la simple correspondance de chaînes à la compréhension de concepts du monde réel.
Termes associés
Reconnaissance d’entités nommées (NER), liaison d’entités, extraction de relations, graphe de connaissances, recherche sémantique, plongements, données structurées, traitement automatique du langage naturel (TALN), schema.org.