Warum Modelle nicht in Wörtern rechnen
Ein Sprachmodell kann nicht mit beliebig vielen Wörtern umgehen. Es arbeitet mit einem festen Vokabular aus Textbausteinen – je nach Modell einige zehntausend bis über hunderttausend Einträge. Häufige Wörter wie „und“ oder „Meeting“ sind darin meist ein einziges Token. Seltene Wörter, Namen oder Fachbegriffe werden aus mehreren Bausteinen zusammengesetzt.
Wie ein Text zerlegt wird, entscheidet der Tokenizer, ein eigenes Programmteil vor dem eigentlichen Modell. Verbreitet sind Verfahren wie Byte-Pair-Encoding: Es beginnt mit einzelnen Zeichen und fasst die häufigsten Kombinationen schrittweise zu größeren Bausteinen zusammen. So kann ein Modell jedes beliebige Wort darstellen, auch eines, das es noch nie gesehen hat – notfalls Buchstabe für Buchstabe.
Intern wird jedes Token dann in eine Zahlenreihe übersetzt, mit der das Modell rechnet. Am Ende einer Antwort läuft der Weg rückwärts: Das Modell wählt Token für Token aus, und der Tokenizer setzt daraus wieder lesbaren Text zusammen.
Deutsch braucht oft mehr Tokens
Viele Tokenizer wurden mit Textsammlungen entwickelt, in denen Englisch überwiegt. Englische Wörter sind deshalb oft ein Token, deutsche häufiger zwei oder mehr. Besonders zusammengesetzte Wörter wie „Besprechungsprotokollvorlage“ oder „Datenschutzfolgenabschätzung“ zerfallen in mehrere Stücke.
Für dich als Nutzer heißt das: Derselbe Inhalt kann auf Deutsch mehr Tokens kosten als auf Englisch, und ins Kontextfenster passt etwas weniger Text. Wie groß der Unterschied ist, hängt vom jeweiligen Modell ab.
Auch Zahlen, Sonderzeichen und Emoji werden oft in mehrere Tokens zerlegt. Ein langer Zahlenwert oder eine Artikelnummer kann deshalb überraschend viele Tokens belegen – und ist einer der Gründe, warum Sprachmodelle beim exakten Rechnen und Zählen von Buchstaben manchmal danebenliegen: Sie sehen den Text nicht Zeichen für Zeichen, sondern in Bausteinen.
Wo Tokens eine Rolle spielen
Im Alltag mit Chat-Apps merkst du von Tokens wenig. Wichtig werden sie hier:
- Kontextlänge: Wie viel Text ein Modell auf einmal berücksichtigen kann, wird in Tokens angegeben.
- Kosten: Bei Programmierschnittstellen wird pro Token abgerechnet, meist getrennt nach Eingabe und Ausgabe – die Ausgabe ist oft teurer.
- Antwortlänge: Anwendungen legen eine Höchstzahl an Ausgabe-Tokens fest. Ist sie erreicht, bricht die Antwort mitten im Satz ab.
- Geschwindigkeit: Modelle erzeugen Antworten Token für Token. Lange Antworten dauern deshalb länger als kurze.
- Nutzungslimits: Auch die Kontingente von Chat-Abos beruhen im Hintergrund oft auf verarbeiteten Tokens.
Token ist nicht gleich Token
Das Wort hat in der IT mehrere Bedeutungen, die nichts miteinander zu tun haben. Ein Zugangstoken ist eine Art digitaler Ausweis, mit dem sich ein Programm bei einem Dienst anmeldet – etwa bei OAuth. Ein Krypto-Token ist eine digitale Werteinheit auf einer Blockchain. Und in der Sprachwissenschaft bezeichnet „Token“ jedes einzelne Vorkommen eines Wortes in einem Text.
Wenn im Zusammenhang mit Sprachmodellen von Tokens die Rede ist, sind immer die Textbausteine gemeint.
Satz: „Das Besprechungsprotokoll kommt morgen.“
Eine mögliche Zerlegung: „Das“ · „ Bes“ · „prechungs“ · „protokoll“ · „ kommt“ · „ morgen“ · „.“ – sieben Tokens für fünf Wörter und einen Punkt. Das Leerzeichen gehört dabei oft zum folgenden Token.
Die tatsächliche Zerlegung hängt vom Tokenizer des jeweiligen Modells ab. Manche Anbieter stellen Werkzeuge bereit, mit denen du sie für deinen eigenen Text ausprobieren kannst.
Dieser Eintrag dient der allgemeinen Information und ersetzt keine individuelle Beratung.