Incrustaciones vectoriales
Una incrustación vectorial (o simplemente una incrustación) es una lista de números que representa el significado de un fragmento de datos (como texto, imagen o audio) como un punto en un espacio de alta dimensión. Un modelo de incrustación produce estos vectores de modo que los elementos con significados similares queden cerca entre sí, lo que permite que el software compare significados midiendo la distancia entre vectores en lugar de coincidir palabras.
En resumen: una incrustación es una representación numérica del significado. Esencialmente, un vector donde las cosas similares se sitúan cerca entre sí, de modo que las máquinas pueden comparar por significado en lugar de por palabras exactas.
Cómo funcionan las incrustaciones vectoriales
El objetivo es convertir el significado en coordenadas que se puedan comparar:
- Entrenar un modelo: Un modelo de incrustación aprende, a partir de grandes cantidades de datos, a asignar entradas a vectores de modo que las entradas relacionadas produzcan vectores cercanos.
- Codificar la entrada: El modelo convierte un fragmento de texto o una imagen en un vector de longitud fija, a menudo de cientos o miles de números. La longitud fija facilita las comparaciones cuando los vectores provienen del mismo espacio de incrustación (normalmente el mismo modelo/versión y un preprocesamiento compatible), incluso si las entradas originales tenían longitudes diferentes.
- Posicionar por significado: Cada dimensión captura alguna característica abstracta de la entrada. Las dimensiones individuales rara vez son interpretables de forma aislada, pero juntas ubican el elemento en un espacio donde la proximidad refleja la similitud.
- Comparar: La similitud entre dos elementos se mide con una métrica como la similitud del coseno; cuanto más cerca estén los vectores, más parecidos son los significados.
La idea que la define es que una incrustación convierte el significado en posición: una vez que los datos están incrustados, una pregunta abstracta como “¿qué es similar a esto?” se convierte en un cálculo de distancia concreto que una computadora puede hacer rápidamente.
Incrustaciones vectoriales frente a tokens y palabras clave
- La tokenización divide el texto en unidades discretas para que un modelo lo procese; una incrustación convierte el texto (ya sea una palabra, oración o pasaje completo) en un vector continuo que captura el significado. La tokenización se ocupa de fragmentos de texto y estructura; las incrustaciones se ocupan del significado.
- Las representaciones por palabras clave rastrean qué palabras exactas aparecen; las incrustaciones capturan de qué trata el texto, de modo que las paráfrasis que no comparten palabras aún pueden quedar cerca entre sí.
- Una incrustación es la representación; una base de datos vectorial es el sistema capaz de almacenar y buscar esas incrustaciones.
Dónde se usan las incrustaciones vectoriales
- Búsqueda semántica: Incrustar consultas y documentos es lo que permite que la búsqueda semántica coincida por significado en lugar de por palabras clave.
- RAG y bases de datos vectoriales: Los fragmentos incrustados se almacenan en una base de datos vectorial y se recuperan por similitud para fundamentar la respuesta de un LLM.
- Recomendaciones y agrupamiento: Las incrustaciones cercanas revelan productos similares, contenido relacionado o agrupaciones naturales en los datos.
- Relevancia de búsqueda: Las incrustaciones son un mecanismo común detrás de la clasificación neuronal y la relevancia semántica en las API del Buscador. Según el sistema, la clasificación puede combinar incrustaciones con otras señales, pero la idea central sigue siendo hacer coincidir los resultados con la intención por significado, no por la redacción exacta.
Las incrustaciones vectoriales son una representación central en la búsqueda con IA moderna. Convierten palabras e imágenes en algo que una máquina puede comparar, agrupar y recuperar por significado.
Términos relacionados
Modelo de incrustación, base de datos vectorial, búsqueda semántica, similitud del coseno, tokenización, generación aumentada por recuperación (RAG), puntuación de recuperación, dimensionalidad, modelo de lenguaje grande (LLM).