Tokenización
La tokenización es el proceso de dividir el texto en unidades más pequeñas llamadas tokens, las piezas que un sistema procesa realmente. Para un modelo de lenguaje, los tokens suelen ser fragmentos de subpalabras que el modelo lee como números en lugar de palabras completas. En la búsqueda clásica, la tokenización divide el texto en los términos que se usan para crear y consultar un índice. De cualquier manera, es el paso que convierte el texto sin procesar en unidades con las que un sistema puede trabajar.
En resumen: la tokenización divide el texto en tokens, que son las piezas de subpalabras que procesa un LLM, o los términos que coincide un índice de Buscador.
Cómo funciona la tokenización
Para los modelos de lenguaje, los enfoques comunes usan la tokenización de subpalabras:
- Elige un tokenizador: Un modelo usa un esquema de tokenización específico. Los enfoques comunes incluyen la codificación por pares de bytes (BPE), WordPiece y las variantes de SentencePiece, que crean un vocabulario fijo a partir de unidades de subpalabras.
- Divide el texto: La entrada se divide en tokens de ese vocabulario, lo que permite que las palabras comunes se conviertan en tokens únicos, mientras que las palabras raras, el código y los emojis se dividen en varios tokens.
- Asigna a los ID: Cada token se convierte en un ID numérico, ya que el modelo procesa números y no ve directamente las letras.
- Cuenta: La cantidad de tokens determina cuánto de la ventana de contexto usa el texto y, en la mayoría de las API, cuánto cuesta una solicitud.
En la indexación de Buscador, la tokenización es más simple y diferente: el texto se divide en términos, a menudo en torno a los espacios en blanco y la puntuación, para que los documentos y las consultas puedan coincidir. Los analizadores de Buscador pueden aplicar entonces pasos de normalización (por ejemplo, conversión a minúsculas, derivación o lematización), que son distintos de la división de límites de tokens.
El punto definitorio es que la tokenización es específica del modelo y específica del método: el mismo texto puede producir un conteo de tokens diferente según el modelo, el proveedor y si lo procesa un LLM o un índice de Buscador. Nunca asumas que los conteos de tokens se transfieren entre sistemas.
Tokenización vs. fragmentación y embeddings
- La tokenización divide el texto en las unidades más pequeñas que usa un modelo o índice; la fragmentación divide un documento en pasajes más grandes para la recuperación. Los tokens son fragmentos pequeños; los fragmentos son pasajes completos.
- La tokenización produce ID de tokens discretos; los embeddings convierten los tokens o fragmentos en vectores continuos que capturan el significado. Uno es una búsqueda, el otro una representación aprendida.
- La tokenización de subpalabras (para los LLM) se optimiza para un vocabulario fijo del modelo; la tokenización de Buscador (para la indexación) se optimiza para hacer coincidir términos entre consultas y documentos.
Dónde importa la tokenización para los desarrolladores
- Costo y límites: Las solicitudes de API suelen facturarse por token y están limitadas por la ventana de contexto, por lo que los conteos de tokens determinan directamente tanto el precio como lo que cabe.
- Latencia y presupuesto: Más tokens significan más para procesar, lo que aumenta la latencia, por lo que recortar las indicaciones y el contexto recuperado es una forma de optimizar para obtener tiempos de respuesta más rápidos.
- Búsqueda por palabras clave: Crear o consultar un índice léxico depende de tokenizar de manera consistente los documentos y las consultas, lo que es la base de la coincidencia de palabras clave en la búsqueda híbrida.
- API de Buscador en canalizaciones de LLM: El contenido devuelto por una API de Buscador para la fundamentación consume tokens una vez que entra en el contexto del modelo, por lo que los resultados eficientes en tokens y preextraídos ayudan a una canalización de respuestas a mantenerse dentro del presupuesto y a costar menos su ejecución.
La tokenización es invisible hasta que deja de serlo: determina silenciosamente lo que un modelo puede leer, lo que un índice de Buscador puede coincidir y cuánto cuesta cada solicitud.
Términos relacionados
Token, ventana de contexto, fragmentación, embeddings, modelo de lenguaje grande (LLM), codificación por pares de bytes (BPE), búsqueda por palabras clave, búsqueda híbrida, latencia, API de Buscador.