Score de récupération

Un score de récupération est un nombre qu’un système de recherche ou de récupération attribue à chaque résultat candidat, exprimant à quel point le résultat est pertinent ou similaire à la requête initiale de l’utilisateur. Le système classe les résultats selon ce score, en plaçant en tête les éléments ayant obtenu les scores les plus élevés, et peut l’utiliser pour déterminer quels résultats sont suffisamment solides pour être conservés. Selon la méthode, le score peut mesurer la correspondance de mots-clés, la similarité sémantique, ou une combinaison des deux.

En bref : un score de récupération indique à quel point le système estime qu’un résultat correspond à la requête, ainsi que le nombre qu’il utilise pour classer et parfois filtrer les résultats.

Comment fonctionne un score de récupération

Le système compare la requête à chaque candidat et convertit cette comparaison en un nombre :

  1. Comparer la requête et le candidat : le système mesure dans quelle mesure chaque candidat correspond à la requête, soit par la correspondance de termes (recherche par mots-clés), soit par la proximité vectorielle (recherche sémantique).
  2. Produire un nombre : cette comparaison génère un score, tel qu’un score de pertinence lexicale (par exemple, BM25) pour la recherche par mots-clés, ou une mesure de similarité comme la similarité cosinus pour la recherche vectorielle.
  3. Classer par score : les candidats sont triés du plus élevé au plus faible, de sorte que les résultats les plus pertinents apparaissent en premier.
  4. Seuil : un seuil optionnel élimine les résultats situés en dessous d’un score minimum, en filtrant les correspondances faibles avant qu’elles ne soient affichées ou transmises.
  5. Combiner ou affiner : dans la recherche hybride, les scores issus de différentes méthodes sont fusionnés en un seul classement, et un modèle de reclassement peut les remplacer par un score de pertinence plus précis.

La réserve essentielle est qu’un score de récupération est relatif, et non absolu : il reflète la façon dont un résultat se compare aux autres selon une méthode donnée, et non une garantie que le résultat est correct. Ainsi, les scores issus de différentes méthodes ne sont pas directement comparables.

Score de récupération, rang et scores de reclassement

  • Un score de récupération est le nombre sous-jacent mesurant la pertinence ; le rang d’un résultat est sa position ordinale après tri selon ce score. De nombreux résultats partagent des scores comparables, mais un seul peut occuper le rang 1.
  • Un score de similarité cosinus (recherche vectorielle) et un score lexical de type BM25 se situent sur des échelles différentes ; ainsi, un score « élevé » ne signifie pas la même chose dans chaque cas et les deux ne peuvent pas être comparés directement.
  • Un score de récupération de première étape est calculé rapidement sur de nombreux candidats ; un score de reclassement est un jugement de pertinence plus lent et plus précis, appliqué aux quelques candidats restants.

Où les scores de récupération sont importants

  • Classement des résultats : le score est ce qui ordonne tout ensemble de résultats de recherche, en déterminant ce qu’un utilisateur ou un modèle voit en premier.
  • Filtrage par seuils : un score minimum empêche les correspondances faibles d’entrer dans une invite RAG, de sorte que le modèle ne reçoive pas de contexte non pertinent.
  • Pipelines hybrides et reclassés : la combinaison ou le recalcul des scores est la façon dont la récupération multi-étapes améliore la pertinence.
  • API de recherche : certaines API de recherche exposent un score de pertinence à côté de chaque résultat, tandis que d’autres renvoient des résultats classés sans exposer les valeurs brutes de score. Lorsqu’ils sont disponibles, les scores permettent aux développeurs de classer, de filtrer par seuil ou de fusionner les résultats de manière programmatique, plutôt que de se fier uniquement à la position.

Un score de récupération est le signal dont tout ce qui suit dépend, et il est préférable de le considérer comme une aide au classement relatif, plutôt que comme une mesure absolue de la vérité.

Termes associés

Recherche sémantique, recherche hybride, reclassement, similarité cosinus, BM25, embeddings, base de données vectorielle, génération augmentée par récupération (RAG), API de recherche.

Brave logo

Vous y êtes presque…

Veuillez poursuivre l’installation de Brave dans le .

Veuillez poursuivre l’installation de Brave dans le .

Plus qu’une minute avant de commencer à bénéficier de la meilleure protection de la vie privée en ligne.

  1. Téléchargez Brave
  2. Ouvrez le programme d’installation
  3. Importez vos paramètres
  1. Étapes d’installation 1
    Téléchargez Brave

    Ouvrez le programme d’installation depuis les téléchargements de Chrome (dans le coin supérieur droit de cette fenêtre).

  2. Étapes d’installation 2
    Ouvrez le programme d’installation

    Si une boîte de dialogue de contrôle d’accès apparaît, cliquez sur « Oui » pour autoriser l’accès à Brave.

  3. Étapes d’installation 3
    Importez vos paramètres

    Une fois l’installation terminée, importez vos paramètres depuis Chrome.

Si votre téléchargement ne se lance pas automatiquement, cliquez .

Besoin d’aide ?