Öffnet in einem neuen Tab

Digitale Begriffe einfach erklärt

Ein Token ist die kleinste Verarbeitungseinheit eines Sprachmodells. Texte werden vor der Verarbeitung in Token zerlegt – je nach Sprache und Wort kann ein Token ein ganzes Wort, ein Wortteil, ein Satzzeichen oder ein einzelnes Zeichen sein. Token sind die Recheneinheit von KI-Systemen: Sie bestimmen, wie viel Text ein Modell gleichzeitig berücksichtigen kann und wie sich die Nutzung kostenseitig bemisst.

Der Begriff wird auch in anderen Zusammenhängen verwendet, etwa für Sicherheits-Token bei der Authentifizierung oder im Bereich digitaler Werte. Dieser Artikel behandelt ausschließlich die Bedeutung im Kontext von Sprachmodellen.

Grundprinzip

Sprachmodelle verarbeiten keine Buchstaben und keine Wörter, sondern Token. Der Vorgang der Zerlegung wird als Tokenisierung bezeichnet und folgt einem im Training erlernten Vokabular, das aus häufigen Zeichenfolgen besteht.

Häufige Wörter bilden dabei meist ein einziges Token, während seltene oder zusammengesetzte Wörter in mehrere Bestandteile zerfallen. Auch Leerzeichen, Satzzeichen und Zeilenumbrüche zählen als Token oder Teil davon.

Als grobe Faustregel gilt für englische Texte, dass ein Token etwa vier Zeichen beziehungsweise rund drei Vierteln eines Wortes entspricht. Für das Deutsche liegt der Wert ungünstiger: Umlaute, lange Komposita und Flexionsendungen führen dazu, dass derselbe Inhalt spürbar mehr Token benötigt als in englischer Sprache. Ein Wort wie “Reputationsmanagement” wird in mehrere Token zerlegt, während sein englisches Pendant oft mit weniger auskommt.

Funktion im Modell

Die Textgenerierung eines Sprachmodells erfolgt Token für Token: Das Modell berechnet für jede Position, welches Token am wahrscheinlichsten folgt, wählt eines aus und wiederholt den Vorgang. Was als flüssiger Text erscheint, entsteht damit als Kette einzelner Vorhersagen.

Jedes Token wird dabei über ein Embedding als Vektor dargestellt, sodass das Modell mit Bedeutungsrepräsentationen statt mit Zeichenfolgen arbeitet.

Kontextfenster

Das Kontextfenster bezeichnet die maximale Anzahl an Token, die ein Modell in einer Anfrage gleichzeitig berücksichtigen kann. Es umfasst sowohl die Eingabe als auch die erzeugte Ausgabe sowie – bei Chatverläufen – die bisherige Konversation und bei RAG-Systemen die abgerufenen Textabschnitte.

Aktuelle Modelle reichen je nach Anbieter von einigen Hunderttausend bis zu mehreren Millionen Token. Wird die Grenze überschritten, fallen ältere Teile des Verlaufs weg oder die Anfrage wird abgewiesen. In der Praxis erklärt dies, warum Modelle in sehr langen Gesprächen frühere Angaben scheinbar “vergessen”.

Zu beachten ist, dass ein großes Kontextfenster nicht bedeutet, dass alle darin enthaltenen Informationen gleich zuverlässig genutzt werden. Angaben in der Mitte sehr langer Eingaben werden erfahrungsgemäß schwächer berücksichtigt als solche am Anfang oder Ende.

Abrechnung und Kosten

Bei der Nutzung von Sprachmodellen über Schnittstellen erfolgt die Abrechnung in aller Regel nach Token, wobei Eingabe- und Ausgabe-Token unterschiedlich bepreist werden – Ausgabe-Token sind meist deutlich teurer.

Für Unternehmen ergeben sich daraus praktische Konsequenzen:

  • Sprachwahl wirkt auf die Kosten – deutschsprachige Verarbeitung benötigt bei gleichem Inhalt mehr Token als englischsprachige
  • Kontextumfang steuern – nicht der gesamte verfügbare Kontext sollte gefüllt werden, wenn ein kleinerer Ausschnitt genügt
  • Verlaufslänge begrenzen – in Chatanwendungen wächst der Verlauf mit jeder Runde und damit auch der Tokenverbrauch je Anfrage
  • Ausgabelänge vorgeben – klare Längenvorgaben im Prompt begrenzen die teureren Ausgabe-Token

Bedeutung für die Praxis

Für die inhaltliche Arbeit ist die Tokenlogik vor allem mittelbar relevant:

  • Prägnanz zahlt sich aus – knappe, informationsdichte Formulierungen benötigen weniger Token und werden in RAG-Systemen eher vollständig in den Kontext übernommen
  • Abschnittslänge – sehr lange Absätze erschweren die saubere Zerlegung in Chunks und deren Übergabe an das Modell
  • Keine Optimierung auf Tokenebene – anders als bei Keywords ergibt es keinen Sinn, Texte auf einzelne Token hin zu gestalten; Token sind eine technische Verarbeitungseinheit, keine Steuerungsgröße für Inhalte

Grenzen und typische Effekte

Aus der Tokenisierung erklären sich mehrere bekannte Schwächen von Sprachmodellen:

  • Zeichenoperationen – Aufgaben wie das Zählen von Buchstaben in einem Wort fallen Modellen schwer, weil sie das Wort nicht als Buchstabenfolge, sondern als Token sehen
  • Rechtschreibung und Silbentrennung – aus demselben Grund sind Aufgaben auf Zeichenebene fehleranfällig
  • Zahlen – längere Zahlen werden in mehrere Token zerlegt, was Rechenfehler begünstigt
  • Sprachliche Ungleichbehandlung – Sprachen, die im Trainingsvokabular unterrepräsentiert sind, benötigen mehr Token und verursachen höhere Kosten bei gleichem Inhalt