Glossaire de l’API
A
- Ancrage web
- L’ancrage web consiste à fonder les réponses d’un modèle de langage sur du contenu web en direct récupéré au moment de la requête, afin que ses réponses reflètent des sources actuelles et vérifiables, plutôt que uniquement ce qu’il a appris lors de son entraînement. Un modèle ancré effectue une recherche sur le Web pour une requête donnée, récupère les pages pertinentes et génère sa réponse à partir de ce contenu, en citant souvent les sources utilisées.
- API de recherche web
- Une API de recherche web est un service qui permet à un logiciel d’interroger l’index du Web d’un moteur de recherche et de recevoir les résultats sous forme de données structurées, plutôt que via un navigateur ou en extrayant une page de résultats de recherche. Un programme émet une requête contenant une query et des paramètres, puis reçoit en retour des résultats lisibles par machine (généralement des URL, des titres et des snippets de texte, ainsi que des actualités, des images, des vidéos et des contenus plus riches) prêts à être utilisés dans une application d’IA.
- Appel d’outils
- L’appel d’outils est la capacité qui permet à un grand modèle de langage (LLM) d’utiliser des outils externes comme des API, des fonctions, des bases de données ou des services. En produisant une requête structurée pour invoquer un outil, une application ou le fournisseur du modèle peut alors exécuter une tâche et renvoyer un résultat au modèle. C’est ainsi qu’un modèle dépasse la simple génération de texte pour aller récupérer des données en temps réel et effectuer des actions.
- Appel de fonctions
- L’appel de fonctions est une capacité qui permet à un grand modèle de langage (LLM) de demander l’utilisation d’un outil externe, d’une API ou d’un fragment de code en produisant un appel structuré et lisible par une machine, plutôt qu’une réponse en texte brut. Le modèle n’exécute pas le code lui-même ; il décide quelle fonction invoquer et avec quels arguments, puis l’application exécute cette fonction, et le résultat est renvoyé au modèle afin qu’il l’intègre à sa réponse finale. L’appel de fonctions est souvent utilisé de manière interchangeable avec l’« utilisation d’outils » ou l’« appel d’outils », même si, à proprement parler, il désigne des fonctions définies par le développeur, un sous-ensemble du modèle plus large d’appel d’outils.
- Attribution des sources
- L’attribution des sources est la pratique consistant à identifier et à créditer les sources originales à l’origine d’une information, afin qu’un lecteur puisse voir d’où provient une affirmation. Dans la recherche par IA et les moteurs de réponses, cela consiste à associer les réponses générées à des citations (des liens ou des références renvoyant aux pages et passages précis sur lesquels s’appuie la réponse) plutôt que de présenter des conclusions sans origine traçable.
B
- Base de données vectorielle
- Une base de données vectorielle est une base de données conçue pour stocker et rechercher des plongements, c’est-à-dire les vecteurs numériques à haute dimension qui représentent le sens d’un texte, d’une image ou d’autres données. Au lieu de faire correspondre des enregistrements selon des valeurs exactes comme une base de données traditionnelle, une base de données vectorielle trouve les enregistrements dont les vecteurs sont les plus similaires à une requête. C’est ce qui rend possible la recherche fondée sur le sens (sémantique) à grande échelle.
- Budget d'exploration
- Le budget d’exploration correspond à la quantité d’exploration qu’un moteur de recherche ou un robot effectuera sur un site donné pendant une période déterminée (en pratique, l’ensemble des URL qu’il peut et souhaite récupérer). Souvent, cela résulte de la combinaison de deux facteurs : la capacité d’exploration (la charge que le serveur d’un site peut supporter sans ralentir) et la demande d’exploration (ce que le robot d’indexation souhaite réellement récupérer, en fonction de la popularité d’un site et de la fréquence à laquelle son contenu change). Pour les sites volumineux ou fréquemment mis à jour, le budget d’exploration détermine la rapidité avec laquelle les pages nouvelles ou modifiées sont découvertes.
C
- Classification des intentions
- La classification des intentions est une tâche de traitement du langage naturel qui consiste à déterminer ce qu’un utilisateur cherche à accomplir à partir de sa saisie, en attribuant une requête ou un message à l’une des catégories d’intention prédéfinies. Elle répond à la question « que veut cette personne ? » (par exemple, si une requête est informationnelle, navigationnelle ou transactionnelle, ou si un message adressé à un chatbot est une salutation, une réclamation ou une demande de réservation).
D
- Date limite de connaissances
- La date limite de connaissances est le moment au-delà duquel un modèle de langage ne dispose plus de données d’entraînement et, par conséquent, n’a aucune connaissance intégrée des événements, des faits ou des changements survenus ultérieurement. Comme les connaissances d’un modèle sont figées au moment de l’entraînement, tout ce qui s’est produit après cette date limite ne fait pas partie de ses connaissances intégrées, à moins que des informations plus récentes ne soient fournies au moment de l’exécution par le biais d’un contexte externe, d’une récupération ou d’outils.
E
- Extracteur web
- Un extracteur web est un programme qui extrait automatiquement des données de sites web (y compris des pages de résultats de moteurs de recherche), généralement en téléchargeant leurs pages et en analysant le HTML rédigé pour les navigateurs humains ; les extracteurs web peuvent transformer un contenu conçu pour être lisible par des humains en données structurées qu’un programme informatique peut stocker et réutiliser. Les extracteurs web ont de nombreux usages légitimes (comme la comparaison de prix, la recherche, l’archivage et la surveillance de systèmes), mais selon ce qui est extrait et la manière dont cela se fait, ils peuvent soulever des questions juridiques, techniques et de conformité. Dans le contexte de la recherche, un extracteur web récupère des résultats en chargeant et en analysant les pages de résultats d’un moteur de recherche, une approche que de nombreux grands fournisseurs restreignent ou interdisent par le biais de leurs conditions de service et de leurs politiques anti-automatisation.
- Extraction d'entités
- L’extraction d’entités est une tâche de traitement automatique du langage naturel (TALN) qui consiste à identifier automatiquement les éléments significatifs mentionnés dans un texte et à attribuer un type à chacun d’eux. Ces éléments peuvent inclure des personnes, des organisations, des lieux, des dates, des produits et d’autres entités pertinentes selon le domaine. Dans de nombreux systèmes, la reconnaissance d’entités nommées (NER) constitue un élément central de l’extraction d’entités, mais cette dernière peut aussi avoir une portée plus large selon le schéma et le cas d’usage.
F
- Fenêtre de contexte
- Une fenêtre de contexte correspond à la quantité maximale de texte (mesurée en tokens) qu’un modèle de langage peut prendre en compte simultanément. Elle englobe tout ce sur quoi le modèle travaille au sein d’une même conversation : les instructions système, l’invite de l’utilisateur, l’historique de la conversation, les documents récupérés et la réponse que le modèle est en train de générer. Dès que le texte combiné dépasse la fenêtre, le modèle ne peut plus « voir » le surplus ; le contenu le plus ancien ou le moins pertinent doit donc être supprimé, résumé ou récupéré à la demande.
- Fonctionnalités de la SERP
- Les fonctionnalités de la SERP sont des modules enrichis présents sur une page de résultats d’un moteur de recherche, qui vont au-delà d’une simple liste de liens organiques. Parmi les exemples courants, on trouve les featured snippets, les panneaux de connaissances, les encadrés « Autres questions », les carrousels d’images et de vidéos, les blocs de résultats locaux sur une carte, les blocs d’actualités à la une, les modules d’achat et les aperçus générés par IA.
- Fractionnement
- Le fractionnement est le processus qui consiste à diviser un document volumineux ou un ensemble de texte en segments plus petits et autonomes (appelés « chunks ») afin qu’ils puissent être plongés, indexés et récupérés individuellement. Dans la génération augmentée par récupération (RAG) et la recherche sémantique, le fractionnement détermine l’unité de texte qu’un système stocke, puis récupère comme contexte. Cela façonne à son tour directement la pertinence et l’exhaustivité des résultats récupérés.
G
- Génération augmentée par récupération (RAG)
- La génération augmentée par récupération (RAG) est une technique qui améliore les réponses d’un modèle de langage en récupérant des informations pertinentes depuis une source externe, puis en fournissant ces informations au modèle sous forme de contexte avant qu’il ne génère une réponse. Plutôt que de s’appuyer exclusivement sur ce qu’il a appris lors de son entraînement, le modèle répond à l’aide de documents récupérés au moment de la requête, ce qui permet à sa sortie d’être actuelle, précise et ancrée dans des sources réelles.
- Grand modèle de langage (LLM)
- Un grand modèle de langage (LLM) est un modèle d’intelligence artificielle entraîné sur de vastes quantités de texte afin de comprendre et de générer le langage humain. Il apprend les schémas statistiques du langage, ce qui lui permet de prédire et de produire l’élément de texte suivant dans une séquence. À une échelle suffisante, cela lui permet de répondre à des questions, de résumer, de traduire, d’écrire du code et de tenir une conversation.
- Graphe de connaissances
- Un graphe de connaissances est une représentation structurée de la connaissance sous la forme d’un réseau d’entités (par exemple des personnes, des lieux, des produits ou des concepts) et des relations qui les relient. Au lieu de stocker l’information sous forme de texte isolé, un graphe de connaissances enregistre les faits en tant que nœuds (les entités) reliés par des arêtes (les relations), souvent accompagnés de types et d’attributs. Cela permet aux machines comme aux humains de comprendre plus facilement comment les éléments se rapportent les uns aux autres.
H
- Hallucination
- Une hallucination est une sortie produite par un modèle d’IA (en particulier un grand modèle de langage) qui est fausse, inventée ou sans ancrage, tout en étant présentée avec fluidité et assurance comme si elle était vraie. (« Sans ancrage » signifie ici que la sortie n’est étayée ni par les données d’entraînement du modèle ni par les sources qui lui ont été fournies.) Les hallucinations vont des citations inventées et des statistiques fictives jusqu’aux détails à l’apparence plausible qu’aucune source ne vient réellement appuyer. Elles peuvent également survenir lorsqu’un modèle interprète mal, attribue de manière erronée ou généralise excessivement à partir de sources obsolètes ou partielles.
L
- Latence
- La latence est le délai entre une requête et sa réponse ; il s’agit essentiellement du temps qu’un utilisateur ou un système attend pour obtenir des résultats. Dans la recherche par IA et les applications de modèles de langage, elle désigne généralement le temps écoulé entre l’envoi d’une requête et la réception d’une réponse. C’est une mesure essentielle de la réactivité et de la fluidité perçues d’un système.
- Limitation du débit
- La limitation du débit est la pratique consistant à plafonner le nombre de requêtes qu’un client (souvent une application sur un ordinateur ou un appareil mobile) peut adresser à un service pendant une période déterminée. Lorsqu’un client dépasse la limite, le service rejette ou retarde les requêtes suivantes (en renvoyant généralement une réponse HTTP 429 Too Many Requests) jusqu’à la réinitialisation de la fenêtre. La limitation du débit protège un service contre la surcharge, garantit un accès équitable entre les utilisateurs et applique les paliers d’utilisation que de nombreuses API commercialisent.
M
- Moteur de recherche programmable
- Un moteur de recherche programmable est un moteur de recherche que les développeurs configurent et interrogent par le biais de code, plutôt qu’uniquement via un site web grand public. Cela permet aux développeurs d’intégrer la recherche directement dans leurs propres applications, de contrôler son comportement et de recevoir des résultats dans un format structuré et lisible par machine. Le terme « moteur de recherche programmable » désigne plus largement tout moteur de recherche exposé pour un usage programmatique, généralement au moyen d’une API de recherche.
P
- Page de résultats d'un moteur de recherche (SERP)
- Une page de résultats d’un moteur de recherche (SERP) est la page qu’un moteur de recherche renvoie en réponse à une requête. Sur les moteurs de recherche modernes, il s’agit généralement d’un mélange d’éléments plutôt que d’une simple liste : des liens organiques (non payants) classés, des Ads payantes et des fonctionnalités de la SERP telles que des featured snippets ou des panneaux de connaissances qui répondent directement à certaines parties de la requête. Pour certaines requêtes et certains moteurs, des aperçus générés par l’IA peuvent également apparaître, souvent près du haut de la page.
- Plongements vectoriels
- Un plongement vectoriel (ou simplement un plongement) est une liste de nombres qui représente le sens d’une donnée (comme un texte, une image ou un fichier audio) sous la forme d’un point dans un espace à haute dimension. Un modèle de plongement produit ces vecteurs de sorte que les éléments ayant un sens similaire se retrouvent proches les uns des autres, ce qui permet à un logiciel de comparer le sens en mesurant la distance entre les vecteurs plutôt qu’en faisant correspondre des mots.
R
- Recherche agentique
- La recherche agentique est une approche de récupération dans laquelle un agent IA (généralement piloté par un grand modèle de langage) planifie et exécute activement un processus de recherche en plusieurs étapes, plutôt que d’effectuer une simple recherche statique. L’agent décompose une requête, décide quelles sources ou quels outils consulter, lance plusieurs recherches, évalue ce qu’il trouve et affine son approche en boucle jusqu’à ce qu’il ait rassemblé suffisamment d’informations pour répondre.
- Recherche conversationnelle
- La recherche conversationnelle est une approche de la récupération d’informations dans laquelle une personne trouve des informations grâce à un dialogue en langage naturel et interactif, plutôt qu’au moyen d’une seule requête par mots-clés. Le système interprète chaque demande dans le contexte de la conversation en cours, en mémorisant les échanges précédents, en résolvant les questions de suivi et en affinant les résultats au fil de l’échange. Les internautes peuvent ainsi effectuer une recherche comme s’ils s’adressaient à une personne compétente.
- Recherche hybride
- La recherche hybride est une approche de récupération qui combine la recherche par mots-clés (lexicale) et la recherche sémantique (vectorielle) comme deux méthodes complémentaires, dont les résultats sont ensuite fusionnés en une seule liste classée. En exécutant les deux simultanément, la recherche hybride combine les correspondances de termes exacts (dans lesquelles la recherche par mots-clés excelle) avec les correspondances basées sur le sens (dans lesquelles la recherche sémantique excelle). Dans les charges de travail à requêtes mixtes, cela améliore souvent la robustesse de la récupération par rapport à l’utilisation de l’une ou l’autre méthode seule.
- Recherche sans clic
- Une recherche sans clic est une session de recherche qui se termine sans que l’utilisateur clique sur un résultat externe. Cela peut se produire parce que la page de résultats fournit directement suffisamment d’informations, parce que l’utilisateur abandonne sa requête ou parce qu’il la reformule et effectue une nouvelle recherche.
- Recherche sémantique
- La recherche sémantique est une approche de la recherche qui met en correspondance les résultats selon leur sens et leur intention, et pas seulement selon une correspondance exacte de mots-clés. Dans les systèmes modernes, elle est généralement mise en œuvre en représentant les requêtes et le contenu sous forme de plongements (des vecteurs numériques qui capturent les relations sémantiques), puis en récupérant les éléments dont les vecteurs sont les plus similaires. Ainsi, une requête telle que « meilleur vin pour les fruits de mer » peut correspondre à un contenu comme « bon avec le poisson », même lorsque les termes exacts diffèrent.
- Reclassement
- Le reclassement est un processus de seconde étape qui réordonne une liste initiale de résultats de recherche afin de placer les plus pertinents en premier. Un système de récupération rapide de première étape extrait un large ensemble de résultats candidats, puis le système de reclassement évalue chaque candidat plus attentivement par rapport à la requête (à l’aide d’un modèle plus lent mais plus précis) et les trie selon ce score. Le reclassement est l’étape de précision qui vient après l’étape de rappel.
- Robot d'exploration web IA
- Un robot d’exploration web IA est un robot automatisé qui récupère des pages web afin que le contenu obtenu puisse alimenter des systèmes d’IA. Parmi les usages courants en aval figurent l’entraînement de grands modèles de langage (LLM), l’alimentation d’index de récupération pour les moteurs de réponses IA et l’actualisation du contenu utilisé pour répondre aux requêtes des utilisateurs. Contrairement à la définition la plus restrictive d’un robot d’indexation de recherche traditionnel (axé sur le classement des pages et la génération de trafic par clics), l’exploration orientée IA est généralement abordée sous l’angle de la réutilisation du contenu récupéré au sein de flux de travail destinés aussi bien aux modèles qu’aux réponses.
S
- Score de récupération
- Un score de récupération est un nombre qu’un système de recherche ou de récupération attribue à chaque résultat candidat, exprimant à quel point le résultat est pertinent ou similaire à la requête initiale de l’utilisateur. Le système classe les résultats selon ce score, en plaçant en tête les éléments ayant obtenu les scores les plus élevés, et peut l’utiliser pour déterminer quels résultats sont suffisamment solides pour être conservés. Selon la méthode, le score peut mesurer la correspondance de mots-clés, la similarité sémantique, ou une combinaison des deux.
- Sortie structurée
- La sortie structurée est une sortie produite par un modèle de langage qui suit un format spécifique et prédéfini (le plus souvent du JSON correspondant à un schéma défini) plutôt qu’un texte libre. En contraignant la forme de la réponse, la sortie structurée facilite l’analyse et l’exploitation de la sortie du modèle par les logiciels, sans logique de nettoyage fragile.
T
- Tokenisation
- La tokenisation est le processus qui consiste à découper un texte en unités plus petites appelées tokens, les éléments qu’un système traite réellement. Pour un modèle de langage, les tokens sont généralement des fragments de sous-mots que le modèle lit sous forme de nombres plutôt que sous forme de mots entiers. Dans la recherche classique, la tokenisation découpe plutôt le texte en termes utilisés pour construire et interroger un index. Dans les deux cas, il s’agit de l’étape qui transforme un texte brut en unités exploitables par un système.