Was ist ein Token (KI)?
Token in der KI erklärt: wie Sprachmodelle Text in Stücke zerlegen, warum Deutsch mehr Token braucht und wie Token Kosten und Kontextfenster bestimmen.
Oleksandr Grygoriev · Aktualisiert:
- EingabeToken (KI)
- Wissen
- Sprachmodell
- Werkzeuge
- Ergebnis
Inhaltsverzeichnis
Ein Token ist die kleinste Texteinheit, mit der ein KI-Sprachmodell arbeitet. Das kann ein ganzes Wort sein, ein Wortteil, ein Satzzeichen oder ein Leerzeichen mit Buchstaben. Sprachmodelle lesen und schreiben ausschließlich in Token – und Anbieter berechnen danach sowohl die Kosten als auch die maximale Textmenge pro Anfrage.
Wer ein Angebot für einen KI-Dienst liest, stößt auf Preise „pro Million Token“. Wer ein langes Dokument hochlädt, bekommt vielleicht die Meldung, das Kontextlimit sei erreicht. Beides ergibt erst Sinn, wenn man weiß, was ein Token ist.
Wie ein Sprachmodell Text zerlegt
Bevor ein Sprachmodell einen Text verarbeitet, zerlegt ein Programm namens Tokenizer ihn in Stücke. Häufige Wörter bleiben am Stück, seltene werden in Teile gespalten. Aus „Die Lieferung kommt morgen“ werden vielleicht vier oder fünf Token, aus „Gewährleistungsausschluss“ mehrere, etwa „Gew“, „ähr“, „leistungs“, „aus“, „schluss“. Die genaue Aufteilung hängt vom Modell ab.
Jedes Token hat eine Nummer in einem festen Vokabular, das oft zehntausende bis über hunderttausend Einträge umfasst. Das Modell arbeitet mit diesen Nummern und übersetzt sie intern in Embeddings. Beim Antworten erzeugt es Token für Token – deshalb erscheint die Antwort im Chatfenster Stück für Stück.
Auch Zahlen werden zerlegt. Eine Artikelnummer wie „4711-0815-B“ besteht für das Modell aus mehreren Stücken, nicht aus einem Wert. Das ist einer der Gründe, warum Sprachmodelle beim Rechnen und beim exakten Abschreiben langer Nummern Fehler machen: Sie sehen keine Zahl, sondern eine Folge von Bruchstücken. Wo Nummern stimmen müssen, gehört deshalb eine Prüfung gegen die Quelle dazu.
Warum deutsche Texte mehr Token brauchen
Die Vokabulare der großen Modelle wurden überwiegend mit englischen Texten gebildet. Englische Wörter sind dort oft als Ganzes enthalten, deutsche Wörter seltener. Hinzu kommen Komposita wie „Nebenkostenabrechnung“ oder „Brandschutzverordnung“, die in mehrere Stücke zerfallen, sowie Umlaute und ß.
Die Folge: Ein deutscher Text braucht spürbar mehr Token als ein englischer mit gleichem Inhalt. Als grobe Faustregel entspricht ein Token im Englischen etwa vier Zeichen oder drei Vierteln eines Wortes; im Deutschen ist der Wert ungünstiger. Für Kostenschätzungen sollten Sie deshalb mit echten deutschen Beispieltexten rechnen, nicht mit englischen Richtwerten.
Token als Rechengröße für Kosten
KI-Dienste rechnen fast immer nach Token ab, getrennt nach Eingabe und Ausgabe:
- Eingabe-Token: alles, was Sie dem Modell schicken – die Frage, die Anweisung, beigefügte Dokumente, bei Chats auch der bisherige Verlauf.
- Ausgabe-Token: alles, was das Modell schreibt. Sie sind in der Regel deutlich teurer als Eingabe-Token.
- Zwischengespeicherte Token: Manche Anbieter berechnen wiederkehrende Textteile, etwa eine immer gleiche Anweisung, günstiger.
Für ein Unternehmen heißt das: Nicht die Zahl der Anfragen treibt die Kosten, sondern ihre Länge. Ein Assistent, der zu jeder Frage ein fünfzigseitiges Handbuch mitschickt, kostet ein Vielfaches eines Assistenten, der nur die drei passenden Absätze übergibt. Welche Posten bei einer Einführung außerdem anfallen, zeigt der Beitrag KI-Einführung: Kosten.
Token und Kontextfenster
Jedes Modell kann nur eine begrenzte Zahl Token gleichzeitig verarbeiten, das Kontextfenster. Es umfasst Eingabe und Ausgabe zusammen. Große aktuelle Modelle verarbeiten sehr umfangreiche Texte in einer Anfrage, kleinere Modelle deutlich weniger. Ist das Fenster voll, schneidet das System ältere Teile ab, oder die Anfrage scheitert.
Das erklärt ein bekanntes Phänomen: In sehr langen Chats „vergisst“ ein Assistent frühere Absprachen. Sie sind schlicht aus dem Fenster gefallen. Wie das Modell den Inhalt des Fensters verarbeitet, beschreibt der Artikel zum Transformer-Modell.
Andere Bedeutungen von „Token“
Das Wort ist in der IT mehrfach belegt. Nicht verwechseln sollten Sie den KI-Token mit:
- Zugangs-Token: ein digitaler Schlüssel, mit dem sich ein Programm bei einer Schnittstelle anmeldet, etwa bei OAuth.
- Sicherheits-Token: ein Gerät oder eine App, die Einmalcodes für die Anmeldung erzeugt.
- Krypto-Token: ein digitaler Wert auf einer Blockchain.
Token sparen, ohne an Qualität zu verlieren
- Nur die relevanten Textstellen mitgeben statt ganzer Dokumente, zum Beispiel per RAG.
- Lange Chatverläufe zusammenfassen, statt sie vollständig mitzuschicken.
- Kurze, klare Anweisungen formulieren; wiederkehrende Anweisungen zwischenspeichern lassen.
- Die gewünschte Antwortlänge vorgeben – „in drei Sätzen“ spart teure Ausgabe-Token.
- Einfache Aufgaben an kleinere, günstigere Modelle geben.
In der Praxis: Kosten planbar machen
Bevor wir bei der KI-Implementierung ein System in Betrieb nehmen, messen wir den Tokenverbrauch mit Ihren echten Texten und rechnen hoch, was der laufende Betrieb kostet. Im Betrieb zeigt eine Auswertung, welcher Ablauf wie viele Token verbraucht, damit Ausreißer auffallen. Wer die Grundlagen im Team verankern möchte, findet in der KI-Akademie eine Schulung an eigenen Aufgaben.
Häufige Fragen
Wie viele Wörter sind 1.000 Token?
Im Englischen grob 750 Wörter, im Deutschen meist weniger. Der genaue Wert hängt vom Modell und vom Text ab; Fachsprache mit langen Komposita verbraucht mehr Token.
Zählen Leerzeichen und Satzzeichen als Token?
Satzzeichen meist ja. Leerzeichen werden in der Regel mit dem folgenden Wort zu einem Token verbunden. Auch Zeilenumbrüche und Formatierungen verbrauchen Token.
Warum kosten Ausgabe-Token mehr als Eingabe-Token?
Weil das Modell jedes Ausgabe-Token einzeln berechnen muss, während es die Eingabe in einem Durchgang verarbeitet. Das kostet mehr Rechenzeit.
Kann ich den Tokenverbrauch vorher prüfen?
Ja. Die meisten Anbieter stellen Werkzeuge bereit, die einen Text in Token zerlegen und zählen. Für eine Kostenschätzung genügt ein Test mit einigen typischen Dokumenten.
Brauchen Sie Unterstützung?
Unsere Experten helfen Ihnen, die richtigen SEO- und Digitalstrategien für Ihr Unternehmen umzusetzen.
Erstgespräch vereinbarenWeitere Artikel im Wiki-Lexikon
Was ist ein LLM (Large Language Model)?
LLM einfach erklärt: wie große Sprachmodelle Text erzeugen, was Tokens und Kontext sind, warum sie halluzinieren und was das für Ihr Unternehmen heißt.
Begriff öffnenWas ist Deep Learning?
Deep Learning verständlich erklärt: wie tiefe neuronale Netze lernen, wofür sie sich eignen, was sie kosten und wann klassisches Machine Learning reicht.
Begriff öffnenWas ist ein Small Language Model?
Small Language Model erklärt: was kleine Sprachmodelle können, wann sie großen LLMs vorzuziehen sind und wie Unternehmen sie auf eigenen Servern nutzen.
Begriff öffnenWas ist ein Transformer-Modell?
Transformer-Modell verständlich erklärt: Self-Attention, Kontextfenster, Encoder und Decoder – und was die Architektur für KI im Unternehmen bedeutet.
Begriff öffnen