Alucinación

Una alucinación es la salida de un modelo de IA (especialmente un modelo de lenguaje grande) que es falsa, inventada o carente de fundamento, pero que se presenta de manera fluida y con confianza como si fuera verdadera. («Carente de fundamento» en este caso significa que la salida no está respaldada por los datos de entrenamiento del modelo ni por las fuentes que se le proporcionaron.) Las alucinaciones van desde citas inventadas y estadísticas falsas hasta detalles que suenan plausibles pero que ninguna fuente respalda en realidad, y también pueden surgir cuando un modelo interpreta mal, atribuye erróneamente o generaliza en exceso a partir de fuentes desactualizadas o parciales.

En resumen: una alucinación es una salida fluida y segura que no es confiablemente verdadera, una respuesta en la que el modelo ha llenado un vacío con algo plausible en lugar de algo correcto.

Cómo ocurren las alucinaciones

Un modelo de lenguaje predice texto probable, no hechos verificados, y varios factores lo empujan hacia la invención segura:

  1. Predicción, no recuperación: El modelo genera palabras estadísticamente probables, por lo que se optimiza la fluidez mientras que la exactitud factual no está garantizada.
  2. Vacíos en el conocimiento: Cuando los datos de entrenamiento faltan, están desactualizados o son escasos sobre un tema, el modelo llena el vacío con una suposición plausible.
  3. Sin verdad fundamental integrada: Sin una fuente con la cual comparar en el momento en que se genera una respuesta, el modelo no puede distinguir una afirmación respaldada de una inventada.
  4. Indicaciones tendenciosas o ambiguas: Las preguntas vagas o las premisas falsas pueden inducir al modelo a responder en lugar de replicar.
  5. Sesgo hacia responder: Los modelos tienden a producir una respuesta segura en lugar de admitir incertidumbre, por lo que los vacíos en el conocimiento pueden aparecer en forma de invenciones.

El punto clave es que el modelo no está mintiendo: no tiene ninguna distinción interna entre una afirmación bien respaldada y una invención que suena plausible.

Alucinación vs. errores factuales y desinformación

  • Un error factual puede provenir de cualquier causa, incluido un razonamiento correcto sobre datos incorrectos; una alucinación significa específicamente que el modelo produjo algo carente de fundamento o sin respaldo, a menudo inventándolo por completo, pero también interpretando mal o atribuyendo erróneamente las fuentes.
  • La desinformación es información falsa o inexacta, sin importar la intención; mientras que la desinformación o la información engañosa implican una intención de engañar, una alucinación es involuntaria, ya que el modelo no tiene conciencia de que su salida es falsa.
  • Las alucinaciones intrínsecas contradicen una fuente que se le dio al modelo; las alucinaciones extrínsecas no pueden verificarse a partir de esa fuente, incluso cuando resultan ser verdaderas.

Cómo se reducen las alucinaciones

  • Generación aumentada por recuperación (RAG): Anclar las respuestas en texto recuperado y citable le da al modelo fuentes reales con las cuales trabajar en lugar de adivinar (pero la RAG aún puede producir errores si la recuperación omite fuentes relevantes o el modelo hace mal uso de lo que encuentra).
  • Citas y verificación: Pedirle al modelo que cite fuentes y luego verificarlas revela afirmaciones que nada respalda.
  • Permiso para abstenerse: Permitir que el modelo diga «No lo sé» reduce las suposiciones forzadas, una técnica que Anthropic recomienda para obtener una salida más confiable.
  • Revisión humana en dominios de alto riesgo: En medicina, derecho y finanzas, donde una invención segura es más costosa, la verificación humana sigue siendo esencial.
  • Aprendizaje por refuerzo a partir de retroalimentación humana (RLHF): El entrenamiento adicional basado en ejemplos seleccionados puede ayudar a enseñarle al modelo a seguir instrucciones, rechazar solicitudes dañinas y producir respuestas más confiables.
  • Ajuste fino: El entrenamiento adicional de un modelo preentrenado con ejemplos seleccionados puede mejorar la confiabilidad dentro de un dominio y animarlo a abstenerse cuando no esté seguro. El ajuste fino es complementario al anclaje en lugar de un reemplazo, y a veces puede resultar contraproducente si se usa para enseñar hechos desconocidos.

Las alucinaciones pueden reducirse pero no eliminarse por completo; el objetivo práctico es anclar las salidas en fuentes verificables y construir sistemas que revelen la incertidumbre en lugar de ocultarla.

Términos relacionados

Generación aumentada por recuperación (RAG), anclaje en la web, atribución de fuentes, cita, modelo de lenguaje grande (LLM), ingeniería de indicaciones, motor de respuestas con IA, exactitud factual, confabulación.

Brave logo

Ya casi estamos…

Por favor, continúa la instalación de Brave en la .

Por favor, continúa la instalación de Brave en la .

Estás a solo 60 segundos de disfrutar de la máxima privacidad en Internet

  1. Descargar Brave
  2. Ejecuta el instalador
  3. Importar configuración
  1. paso 1
    Descargar Brave

    Abre el instalador desde las descargas de Chrome (debería estar en la esquina superior derecha de esta ventana).

  2. paso 2
    Ejecuta el instalador

    Si se te solicita, haz clic en “Sí” en el diálogo de Control de Acceso de Usuario.

  3. paso 3
    Importar configuración

    Espera a que finalice la instalación, luego importa tus configuraciones del navegador desde Chrome.

Si tu descargar no se inicia automáticamente, haga clic en .

¿Necesitas ayuda?