Latence

La latence est le délai entre une requête et sa réponse ; il s’agit essentiellement du temps qu’un utilisateur ou un système attend pour obtenir des résultats. Dans la recherche par IA et les applications de modèles de langage, elle désigne généralement le temps écoulé entre l’envoi d’une requête et la réception d’une réponse. C’est une mesure essentielle de la réactivité et de la fluidité perçues d’un système.

En résumé : la latence, c’est le temps d’attente. Mais dans les systèmes de LLM, ce temps d’attente se divise en plusieurs étapes distinctes, et le temps jusqu’au premier jeton compte souvent autant que le temps jusqu’à la réponse complète.

Comment fonctionne la latence

Pour un grand modèle de langage, l’attente totale se décompose en plusieurs étapes :

  1. Réseau et mise en file d’attente : la requête voyage jusqu’au serveur et peut patienter si le système est occupé avant que le moindre traitement ne commence.
  2. Préremplissage : le modèle lit et traite l’intégralité de l’invite, y compris tout contexte récupéré. Cette étape évolue en fonction de la longueur de l’invite, si bien que des contextes plus longs augmentent directement le temps jusqu’au premier jeton.
  3. Temps jusqu’au premier jeton (TTFT) : le moment où la première partie de la réponse apparaît. C’est la mesure que les utilisateurs ressentent le plus, car elle indique que le système est en train de travailler.
  4. Génération : le modèle produit le reste de la réponse jeton par jeton, à un rythme souvent mesuré comme le temps par jeton généré.
  5. Latence de bout en bout : la durée totale entre la requête et le dernier jeton, soit approximativement le TTFT plus le temps total nécessaire pour générer une réponse.

Le point essentiel est que la latence n’est pas un chiffre unique : un système peut commencer à répondre rapidement tout en mettant du temps à terminer, ou inversement. La mesure la plus pertinente dépendra donc de l’expérience utilisateur que l’on cherche à optimiser.

Latence, débit et qualité

  • La latence correspond au temps que prend une seule requête ; le débit correspond au nombre de requêtes ou de jetons qu’un système peut traiter par unité de temps. Optimiser l’un peut se faire au détriment de l’autre.
  • Le temps jusqu’au premier jeton mesure la réactivité et la rapidité avec laquelle la sortie démarre ; la latence de bout en bout mesure l’achèvement, c’est-à-dire la rapidité avec laquelle le processus se termine. Les deux comptent, pour des tâches différentes.
  • Des réponses plus rapides et une qualité supérieure sont souvent en opposition, car les modèles plus grands et plus performants ont tendance à répondre plus lentement.

Où la latence compte

  • Longueur du contexte : une fenêtre de contexte plus grande (remplie d’invites et de texte récupéré) augmente le temps de préremplissage et le temps jusqu’au premier jeton.
  • Taille du modèle : les modèles plus grands produisent généralement une sortie de meilleure qualité, mais répondent plus lentement.
  • Récupération et traitement en plusieurs étapes : la génération augmentée par récupération (RAG) ajoute une étape de recherche, et la recherche agentique enchaîne de nombreux appels au modèle ; ainsi, chaque étape supplémentaire allonge l’attente totale.
  • API de recherche : lorsqu’une application appelle une API de recherche pour récupérer des résultats en direct, souvent comme étape de récupération alimentant un LLM, le temps de réponse propre à l’API s’ajoute directement à l’attente totale de l’utilisateur. Une API de recherche à faible latence est donc essentielle pour maintenir la réactivité d’un pipeline de réponses par IA.
  • Solutions d’atténuation : diffuser la réponse en flux, élaguer le contexte inutile, mettre en cache et utiliser des modèles plus petits ou plus rapides permettent de réduire la latence réelle ou perçue.

Dans la recherche par IA et le chat, la latence fait souvent la différence entre un système qui semble « rapide » et un système que les utilisateurs abandonneront en raison d’une lenteur perçue. C’est pourquoi obtenir rapidement les premiers jetons peut compter autant que la qualité de la réponse finale.

Termes associés

Débit, fenêtre de contexte, grand modèle de langage (LLM), temps jusqu’au premier jeton (TTFT), diffusion en flux, inférence, génération augmentée par récupération (RAG), recherche agentique.

Brave logo

Vous y êtes presque…

Veuillez poursuivre l’installation de Brave dans le .

Veuillez poursuivre l’installation de Brave dans le .

Plus qu’une minute avant de commencer à bénéficier de la meilleure protection de la vie privée en ligne.

  1. Téléchargez Brave
  2. Ouvrez le programme d’installation
  3. Importez vos paramètres
  1. Étapes d’installation 1
    Téléchargez Brave

    Ouvrez le programme d’installation depuis les téléchargements de Chrome (dans le coin supérieur droit de cette fenêtre).

  2. Étapes d’installation 2
    Ouvrez le programme d’installation

    Si une boîte de dialogue de contrôle d’accès apparaît, cliquez sur « Oui » pour autoriser l’accès à Brave.

  3. Étapes d’installation 3
    Importez vos paramètres

    Une fois l’installation terminée, importez vos paramètres depuis Chrome.

Si votre téléchargement ne se lance pas automatiquement, cliquez .

Besoin d’aide ?