Tokenisierung
Tokenisierung ist der Prozess, bei dem Text in kleinere Einheiten namens Token zerlegt wird – die Teile, die ein System tatsächlich verarbeitet. Für ein Sprachmodell sind Token in der Regel Teilwortfragmente, die das Modell als Zahlen statt als ganze Wörter liest. Bei der klassischen Suche zerlegt die Tokenisierung den Text stattdessen in die Begriffe, die zum Erstellen und Abfragen eines Index verwendet werden. So oder so ist es der Schritt, der Rohtext in Einheiten umwandelt, mit denen ein System arbeiten kann.
Kurz gesagt: Die Tokenisierung zerlegt Text in Token, also die Teilwortstücke, die ein LLM verarbeitet, oder die Begriffe, mit denen ein Suchindex Übereinstimmungen findet.
So funktioniert die Tokenisierung
Bei Sprachmodellen verwenden gängige Ansätze eine Teilwort-Tokenisierung:
- Einen Tokenizer wählen: Ein Modell verwendet ein bestimmtes Tokenisierungsschema. Zu den gängigen Ansätzen gehören Byte Pair Encoding (BPE), WordPiece und SentencePiece-Varianten, die alle ein festes Vokabular aus Teilworteinheiten aufbauen.
- Den Text zerlegen: Die Eingabe wird in Token aus diesem Vokabular zerlegt, sodass gängige Wörter zu einzelnen Token werden, während seltene Wörter, Code und Emojis in mehrere Token aufgeteilt werden.
- Auf IDs abbilden: Jedes Token wird in eine numerische ID umgewandelt, da das Modell Zahlen verarbeitet und keine Buchstaben direkt sieht.
- Zählen: Die Anzahl der Token bestimmt, wie viel vom Kontextfenster der Text nutzt und, bei den meisten APIs, wie viel eine Anfrage kostet.
Bei der Suchindexierung ist die Tokenisierung einfacher und anders: Der Text wird in Begriffe zerlegt, oft an Leerzeichen und Satzzeichen, damit Dokumente und Suchanfragen abgeglichen werden können. Suchanalysatoren können dann Normalisierungsschritte anwenden (zum Beispiel Kleinschreibung, Stemming oder Lemmatisierung), die sich vom Aufteilen an Tokengrenzen unterscheiden.
Der entscheidende Punkt ist, dass die Tokenisierung modellspezifisch und methodenspezifisch ist: Derselbe Text kann je nach Modell, Anbieter und je nachdem, ob er von einem LLM oder einem Suchindex verarbeitet wird, eine unterschiedliche Tokenanzahl ergeben. Gehen Sie niemals davon aus, dass sich Tokenzahlen zwischen Systemen übertragen lassen.
Tokenisierung im Vergleich zu Chunking und Embeddings
- Tokenisierung zerlegt Text in die kleinsten Einheiten, die ein Modell oder Index verwendet; Chunking teilt ein Dokument für das Retrieval in größere Passagen auf. Token sind kleine Fragmente; Chunks sind ganze Passagen.
- Tokenisierung erzeugt diskrete Token-IDs; Embeddings wandeln Token oder Chunks in kontinuierliche Vektoren um, die Bedeutung erfassen. Das eine ist ein Nachschlagevorgang, das andere eine erlernte Repräsentation.
- Teilwort-Tokenisierung (für LLMs) optimiert für ein festes Modellvokabular; die Such-Tokenisierung (für die Indexierung) optimiert für den Abgleich von Begriffen zwischen Suchanfragen und Dokumenten.
Wo die Tokenisierung für Entwickler wichtig ist
- Kosten und Grenzen: API-Anfragen werden in der Regel pro Token abgerechnet und durch das Kontextfenster begrenzt, sodass die Tokenanzahl sowohl den Preis als auch das, was passt, direkt bestimmt.
- Latenz und Budgetierung: Mehr Token bedeuten mehr zu verarbeiten, was beides die Latenz erhöht, sodass das Kürzen von Prompts und abgerufenem Kontext eine Möglichkeit ist, für schnellere Antwortzeiten zu optimieren.
- Schlüsselwortsuche: Das Erstellen oder Abfragen eines lexikalischen Index hängt von der konsistenten Tokenisierung von Dokumenten und Abfragen ab, was die Grundlage des Schlüsselwortabgleichs in der hybriden Suche bildet.
- Such-APIs in LLM-Pipelines: Inhalte, die von einer Such-API zur Fundierung zurückgegeben werden, verbrauchen Token, sobald sie in den Kontext des Modells gelangen, sodass tokeneffiziente, vorab extrahierte Ergebnisse einer Antwort-Pipeline helfen, im Budget zu bleiben und günstiger im Betrieb zu sein.
Tokenisierung ist unsichtbar, bis sie es nicht mehr ist: Sie bestimmt im Stillen, was ein Modell lesen kann, was ein Suchindex abgleichen kann und was jede Anfrage kostet.
Verwandte Begriffe
Token, Kontextfenster, Chunking, Embeddings, großes Sprachmodell (LLM), Byte Pair Encoding (BPE), Schlüsselwortsuche, hybride Suche, Latenz, Such-API.