Vektoreinbettungen

Eine Vektoreinbettung (oder einfach ein Embedding) ist eine Liste von Zahlen, die die Bedeutung eines Datenelements (wie Text, Bild oder Audio) als Punkt in einem hochdimensionalen Raum darstellt. Ein Embedding-Modell erzeugt diese Vektoren so, dass Elemente mit ähnlicher Bedeutung nah beieinander liegen, wodurch Software Bedeutung durch Messung des Abstands zwischen Vektoren vergleichen kann, anstatt Wörter abzugleichen.

Kurz gesagt: Ein Embedding ist eine numerische Darstellung von Bedeutung. Im Wesentlichen ein Vektor, bei dem ähnliche Dinge nah beieinander liegen, sodass Maschinen nach Bedeutung statt nach exakten Wörtern vergleichen können.

So funktionieren Vektoreinbettungen

Der Sinn besteht darin, Bedeutung in Koordinaten umzuwandeln, die verglichen werden können:

  1. Ein Modell trainieren: Ein Embedding-Modell lernt aus großen Datenmengen, Eingaben auf Vektoren abzubilden, sodass verwandte Eingaben nahe beieinander liegende Vektoren erzeugen.
  2. Die Eingabe kodieren: Das Modell wandelt ein Textstück oder ein Bild in einen Vektor fester Länge um, der oft Hunderte oder Tausende von Zahlen umfasst. Eine feste Länge macht Vergleiche unkompliziert, wenn die Vektoren aus demselben Embedding-Raum stammen (typischerweise dasselbe Modell/dieselbe Version und kompatible Vorverarbeitung), selbst wenn die ursprünglichen Eingaben unterschiedliche Längen hatten.
  3. Positionierung nach Bedeutung: Jede Dimension erfasst ein abstraktes Merkmal der Eingabe. Einzelne Dimensionen sind isoliert selten interpretierbar, aber zusammen platzieren sie das Element in einem Raum, in dem Nähe Ähnlichkeit widerspiegelt.
  4. Vergleichen: Die Ähnlichkeit zwischen zwei Elementen wird mit einer Metrik wie der Kosinus-Ähnlichkeit gemessen; je näher die Vektoren, desto ähnlicher die Bedeutungen.

Die entscheidende Idee ist, dass ein Embedding Bedeutung in Position umwandelt: Sobald Daten eingebettet sind, wird eine abstrakte Frage wie „Was ist diesem ähnlich?“ zu einer konkreten Abstandsberechnung, die ein Computer schnell durchführen kann.

Vektoreinbettungen im Vergleich zu Tokens und Schlüsselwörtern

  • Die Tokenisierung teilt Text in diskrete Einheiten auf, die ein Modell verarbeiten kann; ein Embedding wandelt Text (ob ein Wort, ein Satz oder eine ganze Passage) in einen kontinuierlichen Vektor um, der Bedeutung erfasst. Bei der Tokenisierung geht es um Textstücke und Struktur; bei Embeddings geht es um Bedeutung.
  • Schlüsselwortdarstellungen verfolgen, welche exakten Wörter vorkommen; Embeddings erfassen, worum es im Text geht, sodass Umschreibungen, die keine Wörter teilen, dennoch nah beieinander liegen können.
  • Ein Embedding ist die Darstellung; eine Vektordatenbank ist das System, das diese Embeddings speichern und durchsuchen kann.

Wo Vektoreinbettungen verwendet werden

  • Semantische Suche: Das Einbetten von Queries und Dokumenten ist das, was der semantischen Suche ermöglicht, nach Bedeutung statt nach Schlüsselwörtern abzugleichen.
  • RAG und Vektordatenbanken: Eingebettete Chunks werden in einer Vektordatenbank gespeichert und nach Ähnlichkeit abgerufen, um die Antwort eines LLM zu fundieren.
  • Empfehlungen und Clustering: Nahe beieinander liegende Embeddings zeigen ähnliche Produkte, verwandte Inhalte oder natürliche Gruppierungen in Daten auf.
  • Suchrelevanz: Embeddings sind ein häufiger Mechanismus hinter neuronalem Ranking und semantischer Relevanz in Such-APIs. Je nach System kann das Ranking Embeddings mit anderen Signalen kombinieren, aber die Kernidee bleibt, Ergebnisse nach Bedeutung mit der Absicht abzugleichen, nicht nach exakter Formulierung.

Vektoreinbettungen sind eine zentrale Darstellung in der modernen KI-Suche. Sie wandeln Wörter und Bilder in etwas um, das eine Maschine nach Bedeutung vergleichen, clustern und abrufen kann.

Verwandte Begriffe

Embedding-Modell, Vektordatenbank, semantische Suche, Kosinus-Ähnlichkeit, Tokenisierung, Retrieval-Augmented Generation (RAG), Retrieval-Score, Dimensionalität, großes Sprachmodell (LLM).

Brave logo

Fast geschafft …

Bitte setzen Sie die Installation von Brave fort in der .

Bitte setzen Sie die Installation von Brave fort in der .

Sie sind nur 60 Sekunden von der besten Privatsphäre im Internet entfernt

  1. Brave herunterladen
  2. Führen Sie das Installationsprogramm aus
  3. Einstellungen importieren
  1. schritt 1
    Brave herunterladen

    Öffnen Sie das Installationsprogramm aus den Chrome-Downloads (es sollte sich in der oberen rechten Ecke dieses Fensters befinden).

  2. schritt 2
    Führen Sie das Installationsprogramm aus

    Wenn Sie dazu aufgefordert werden, klicken Sie im Dialogfeld 'Benutzerzugriffskontrolle' auf „Ja“.

  3. schritt 3
    Einstellungen importieren

    Warten Sie, bis die Installation abgeschlossen ist, und importieren Sie dann Ihre Browsereinstellungen aus Chrome.

Wenn Ihr Download nicht automatisch gestartet wurde, klicken Sie auf .

Benötigen Sie Hilfe?