Plongements vectoriels

Un plongement vectoriel (ou simplement un plongement) est une liste de nombres qui représente le sens d’une donnée (comme un texte, une image ou un fichier audio) sous la forme d’un point dans un espace à haute dimension. Un modèle de plongement produit ces vecteurs de sorte que les éléments ayant un sens similaire se retrouvent proches les uns des autres, ce qui permet à un logiciel de comparer le sens en mesurant la distance entre les vecteurs plutôt qu’en faisant correspondre des mots.

En bref : un plongement est une représentation numérique du sens. Il s’agit essentiellement d’un vecteur où les éléments similaires se situent à proximité les uns des autres, de sorte que les machines peuvent comparer par le sens plutôt que par les mots exacts.

Comment fonctionnent les plongements vectoriels

L’objectif est de convertir le sens en coordonnées qui peuvent être comparées :

  1. Entraîner un modèle : à partir de grandes quantités de données, un modèle de plongement apprend à associer des entrées à des vecteurs de sorte que des entrées apparentées produisent des vecteurs proches.
  2. Encoder l’entrée : le modèle convertit un fragment de texte ou une image en un vecteur de longueur fixe, souvent composé de centaines ou de milliers de nombres. La longueur fixe simplifie les comparaisons lorsque les vecteurs proviennent du même espace de plongement (généralement le même modèle ou la même version et un prétraitement compatible), même si les entrées d’origine avaient des longueurs différentes.
  3. Positionner par le sens : chaque dimension capture une caractéristique abstraite de l’entrée. Les dimensions individuelles sont rarement interprétables isolément, mais ensemble, elles placent l’élément dans un espace où la proximité reflète la similarité.
  4. Comparer : la similarité entre deux éléments est mesurée à l’aide d’une métrique telle que la similarité cosinus ; plus les vecteurs sont proches, plus les sens se ressemblent.

L’idée fondamentale est qu’un plongement transforme le sens en position : une fois les données plongées, une question abstraite comme « qu’est-ce qui est similaire à ceci ? » devient un calcul de distance concret qu’un ordinateur peut effectuer rapidement.

Plongements vectoriels vs. tokens et mots-clés

  • La tokenisation découpe le texte en unités discrètes qu’un modèle peut traiter ; un plongement convertit un texte (qu’il s’agisse d’un mot, d’une phrase ou d’un passage entier) en un vecteur continu qui capture le sens. La tokenisation concerne les fragments de texte et la structure ; les plongements concernent le sens.
  • Les représentations par mots-clés suivent les mots exacts qui apparaissent ; les plongements capturent le sujet du texte, de sorte que des paraphrases ne partageant aucun mot peuvent tout de même se retrouver proches.
  • Un plongement est la représentation ; une base de données vectorielle est le système capable de stocker et de rechercher ces plongements.

Où les plongements vectoriels sont utilisés

  • Recherche sémantique : le plongement des requêtes et des documents est ce qui permet à la recherche sémantique de faire correspondre par le sens plutôt que par les mots-clés.
  • RAG et bases de données vectorielles : les fragments plongés sont stockés dans une base de données vectorielle et récupérés par similarité afin d’ancrer la réponse d’un LLM.
  • Recommandations et regroupement : les plongements proches révèlent des produits similaires, des contenus connexes ou des regroupements naturels dans les données.
  • Pertinence de la recherche : les plongements constituent un mécanisme courant derrière le classement neuronal et la pertinence sémantique dans les API de recherche. Selon le système, le classement peut combiner les plongements avec d’autres signaux, mais l’idée centrale reste de faire correspondre les résultats à l’intention par le sens, et non par la formulation exacte.

Les plongements vectoriels constituent une représentation essentielle de la recherche par IA moderne. Ils transforment les mots et les images en quelque chose qu’une machine peut comparer, regrouper et récupérer par le sens.

Termes associés

Modèle de plongement, base de données vectorielle, recherche sémantique, similarité cosinus, tokenisation, génération augmentée par récupération (RAG), score de récupération, dimensionnalité, grand modèle de langage (LLM).

Brave logo

Vous y êtes presque…

Veuillez poursuivre l’installation de Brave dans le .

Veuillez poursuivre l’installation de Brave dans le .

Plus qu’une minute avant de commencer à bénéficier de la meilleure protection de la vie privée en ligne.

  1. Téléchargez Brave
  2. Ouvrez le programme d’installation
  3. Importez vos paramètres
  1. Étapes d’installation 1
    Téléchargez Brave

    Ouvrez le programme d’installation depuis les téléchargements de Chrome (dans le coin supérieur droit de cette fenêtre).

  2. Étapes d’installation 2
    Ouvrez le programme d’installation

    Si une boîte de dialogue de contrôle d’accès apparaît, cliquez sur « Oui » pour autoriser l’accès à Brave.

  3. Étapes d’installation 3
    Importez vos paramètres

    Une fois l’installation terminée, importez vos paramètres depuis Chrome.

Si votre téléchargement ne se lance pas automatiquement, cliquez .

Besoin d’aide ?