Retrieval-Score
Ein Retrieval-Score ist eine Zahl, die ein Such- oder Retrieval-System jedem Kandidatenergebnis zuweist und die ausdrückt, wie relevant oder ähnlich das Ergebnis der ursprünglichen Nutzeranfrage ist. Das System ordnet die Ergebnisse anhand dieses Scores, stellt die Elemente mit den höchsten Werten an erste Stelle und kann anhand dessen entscheiden, welche Ergebnisse gut genug sind, um beibehalten zu werden. Je nach Methode kann der Score die Schlüsselwort-Überschneidung, die semantische Ähnlichkeit oder eine Mischung aus beidem messen.
Kurz gesagt: Ein Retrieval-Score gibt an, wie stark das System davon ausgeht, dass ein Ergebnis zur Anfrage passt, und ist die Zahl, die es verwendet, um Ergebnisse zu ordnen und manchmal zu filtern.
So funktioniert ein Retrieval-Score
Das System vergleicht die Anfrage mit jedem Kandidaten und wandelt diesen Vergleich in eine Zahl um:
- Anfrage und Kandidat vergleichen: Das System misst, wie gut jeder Kandidat zur Anfrage passt, entweder anhand der Term-Überschneidung (Schlüsselwortsuche) oder der Vektornähe (Semantische Suche).
- Eine Zahl erzeugen: Dieser Vergleich ergibt einen Score, etwa einen lexikalischen Relevanz-Score (zum Beispiel BM25) für die Schlüsselwortsuche oder eine Ähnlichkeitsmetrik wie die Kosinus-Ähnlichkeit für die Vektorsuche.
- Nach Score ordnen: Die Kandidaten werden vom höchsten zum niedrigsten Wert sortiert, sodass die relevantesten Ergebnisse zuerst erscheinen.
- Schwellenwert: Ein optionaler Grenzwert entfernt Ergebnisse unterhalb eines Mindest-Scores und filtert schwache Übereinstimmungen heraus, bevor sie angezeigt oder weitergegeben werden.
- Kombinieren oder verfeinern: Bei der Hybriden Suche werden Scores aus verschiedenen Methoden zu einer einzigen Rangfolge zusammengeführt, und ein Reranking-Modell kann sie durch einen genaueren Relevanz-Score ersetzen.
Die entscheidende Einschränkung ist, dass ein Retrieval-Score relativ und nicht absolut ist: Er spiegelt wider, wie ein Ergebnis im Rahmen einer Methode im Vergleich zu anderen abschneidet, und ist keine Garantie dafür, dass das Ergebnis korrekt ist. Auf diese Weise sind Scores aus verschiedenen Methoden nicht direkt vergleichbar.
Retrieval-Score im Vergleich zu Rang- und Reranker-Scores
- Ein Retrieval-Score ist die zugrunde liegende Zahl, die die Relevanz misst; der Rang eines Ergebnisses ist seine ordinale Position nach dem Sortieren anhand dieses Scores. Viele Ergebnisse haben vergleichbare Scores, aber nur eines kann auf Rang 1 stehen.
- Ein Kosinus-Ähnlichkeits-Score (Vektorsuche) und ein lexikalischer Score im BM25-Stil liegen auf unterschiedlichen Skalen, sodass ein „hoher“ Score in jedem Fall etwas anderes bedeutet und die beiden nicht direkt verglichen werden können.
- Ein Retrieval-Score der ersten Stufe wird schnell über viele Kandidaten hinweg berechnet; ein Reranker-Score ist eine langsamere, präzisere Relevanzbeurteilung über die wenigen verbleibenden Kandidaten.
Wo Retrieval-Scores wichtig sind
- Ergebnisse ordnen: Der Score bestimmt die Reihenfolge jeder Menge von Suchergebnissen und legt fest, was ein Nutzer oder Modell zuerst sieht.
- Filtern mit Schwellenwerten: Ein Mindest-Score hält schwache Übereinstimmungen aus einem RAG-Prompt fern, sodass dem Modell kein irrelevanter Kontext übergeben wird.
- Hybride und rerangte Pipelines: Das Kombinieren oder Neuberechnen von Scores ist die Art und Weise, wie mehrstufiges Retrieval die Relevanz verbessert.
- Such-APIs: Einige Such-APIs geben neben jedem Ergebnis einen Relevanz-Score aus, während andere geordnete Ergebnisse zurückgeben, ohne die rohen Scoring-Werte offenzulegen. Sofern verfügbar, ermöglichen Scores es Entwicklern, Ergebnisse programmatisch zu ordnen, mit Schwellenwerten zu versehen oder zusammenzuführen, anstatt sich allein auf die Position zu verlassen.
Ein Retrieval-Score ist das Signal, von dem alles Nachgelagerte abhängt, und es ist am besten, diesen Score als relative Ranghilfe zu behandeln und nicht als absolutes Maß für die Wahrheit.
Verwandte Begriffe
Semantische Suche, Hybride Suche, Reranking, Kosinus-Ähnlichkeit, BM25, Embeddings, Vektordatenbank, Retrieval-Augmented Generation (RAG), Such-API.