Latencia

La latencia es el retraso entre una solicitud y su respuesta: básicamente, cuánto tiempo espera un usuario o sistema para obtener resultados. En las aplicaciones de búsqueda con IA y de modelos de lenguaje, generalmente se refiere al tiempo que transcurre desde el envío de una consulta hasta la recepción de una respuesta, y es una medida fundamental de qué tan receptivo y utilizable se siente un sistema.

En resumen: la latencia es tiempo de espera. Pero en los sistemas de LLM este tiempo de espera se divide en etapas distintas, y el tiempo hasta el primer token a menudo importa tanto como el tiempo hasta la respuesta completa.

Cómo funciona la latencia

Para un modelo de lenguaje grande, la espera total se divide en etapas:

  1. Red y encolamiento: La solicitud viaja al servidor y puede esperar si el sistema está ocupado antes de que comience cualquier trabajo.
  2. Prellenado: El modelo lee y procesa el prompt completo, incluyendo cualquier contexto recuperado. Este paso escala con la longitud del prompt, por lo que los contextos más largos aumentan directamente el tiempo hasta el primer token.
  3. Tiempo hasta el primer token (TTFT): El momento en que aparece la primera parte de la respuesta, que es la métrica que los usuarios más perciben porque señala que el sistema está funcionando.
  4. Generación: El modelo produce el resto de la respuesta token por token, a una tasa que a menudo se mide como tiempo por token de salida.
  5. Latencia de extremo a extremo: La duración total desde la solicitud hasta el token final, que es aproximadamente el TTFT más el tiempo total para generar una respuesta.

El punto definitorio es que la latencia no es un solo número: un sistema puede comenzar a responder rápidamente pero tardar un tiempo en terminar, o viceversa, por lo que la medida más significativa dependerá de la experiencia de usuario que se esté optimizando.

Latencia frente a rendimiento y calidad

  • La latencia es cuánto tarda una sola solicitud; el rendimiento es cuántas solicitudes o tokens puede manejar un sistema por unidad de tiempo. Optimizar uno puede ser a expensas del otro.
  • El tiempo hasta el primer token mide la capacidad de respuesta y qué tan rápido comienza la salida; la latencia de extremo a extremo mide la finalización, y qué tan rápido termina. Ambos importan, para distintas tareas.
  • Las respuestas más rápidas y la mayor calidad a menudo se compensan entre sí, ya que los modelos más grandes y capaces tienden a responder más lentamente.

Dónde importa la latencia

  • Longitud del contexto: Una ventana de contexto más grande (una llena de prompts y texto recuperado) aumentará el tiempo de prellenado y el tiempo hasta el primer token.
  • Tamaño del modelo: Los modelos más grandes generalmente producen una salida de mayor calidad pero responden más lentamente.
  • Recuperación y trabajo de múltiples pasos: La generación aumentada por recuperación (RAG) agrega un paso de búsqueda, y la búsqueda agéntica encadenará muchas llamadas al modelo, por lo que cada paso agregado acumula la espera total.
  • API del Buscador: Cuando una aplicación llama a una API del Buscador para obtener resultados en vivo, a menudo como el paso de recuperación que alimenta a un LLM, el propio tiempo de respuesta de la API se suma directamente a la espera total del usuario, por lo que una API del Buscador de baja latencia es esencial para mantener receptivo un flujo de respuestas de IA.
  • Mitigaciones: Transmitir la respuesta, recortar el contexto innecesario, el almacenamiento en caché y usar modelos más pequeños o más rápidos reducen la latencia real o percibida.

En la búsqueda con IA y el chat, la latencia suele ser la diferencia entre un sistema que se siente “rápido” y uno que los usuarios abandonarán debido a la lentitud percibida. Por eso lograr que los primeros tokens salgan rápidamente puede importar tanto como la calidad de la respuesta final.

Términos relacionados

Rendimiento, ventana de contexto, modelo de lenguaje grande (LLM), tiempo hasta el primer token (TTFT), transmisión, inferencia, generación aumentada por recuperación (RAG), búsqueda agéntica.

Brave logo

Ya casi estamos…

Por favor, continúa la instalación de Brave en la .

Por favor, continúa la instalación de Brave en la .

Estás a solo 60 segundos de disfrutar de la máxima privacidad en Internet

  1. Descargar Brave
  2. Ejecuta el instalador
  3. Importar configuración
  1. paso 1
    Descargar Brave

    Abre el instalador desde las descargas de Chrome (debería estar en la esquina superior derecha de esta ventana).

  2. paso 2
    Ejecuta el instalador

    Si se te solicita, haz clic en “Sí” en el diálogo de Control de Acceso de Usuario.

  3. paso 3
    Importar configuración

    Espera a que finalice la instalación, luego importa tus configuraciones del navegador desde Chrome.

Si tu descargar no se inicia automáticamente, haga clic en .

¿Necesitas ayuda?