Wer ChatGPT oder eine andere textbasierte künstliche Intelligenz benutzt, begegnet früher oder später dem Begriff „Token“. Dabei handelt es sich weder um ein Passwort noch um eine digitale Münze. Tokens sind kleine Textbausteine, in welche die KI Eingaben und Antworten zerlegt.
Menschen lesen Wörter und Sätze. Ein KI-Modell verarbeitet dagegen Tokens. Ihre Anzahl bestimmt unter anderem, wie viel Text gleichzeitig berücksichtigt werden kann, wie lang eine Antwort ausfallen darf und welche Kosten bei der Nutzung einer Programmierschnittstelle entstehen.
Ein Token ist nicht automatisch ein Wort
Ein Token kann ein vollständiges Wort, ein Wortteil, eine Zahl oder ein Satzzeichen sein. Kurze und häufig verwendete Wörter bestehen oft aus nur einem Token. Lange deutsche Begriffe werden dagegen meist in mehrere Bestandteile zerlegt.
Das Wort „Einkaufswagenchiphalterung“ kann beispielsweise mehrere Tokens benötigen. Auch Zahlen, Leerzeichen, Sonderzeichen und die Schreibweise beeinflussen die Aufteilung.
Der Satz:
„Ich drucke einen Einkaufswagenchip aus PETG.“
besteht deshalb nicht zwingend aus sieben Tokens. Die genaue Aufteilung übernimmt ein sogenannter Tokenizer. Welches Ergebnis entsteht, hängt vom verwendeten KI-Modell ab.
Wie viele Zeichen entsprechen einem Token?
Als grobe Faustregel werden bei englischen Texten etwa vier Zeichen pro Token genannt. Bei deutschen Texten kann der Verbrauch höher sein, weil die Sprache viele lange zusammengesetzte Wörter enthält.
Zur Orientierung:
- 1.000 Tokens entsprechen ungefähr 3.000 bis 4.000 Zeichen.
- 1.000 Tokens entsprechen häufig etwa 600 bis 750 deutschen Wörtern.
- Programmcode, Zahlenkolonnen und Sonderzeichen können mehr Tokens benötigen.
- Lange Fachbegriffe werden häufig in mehrere Tokens zerlegt.
Diese Werte sind nur Schätzungen. Eine genaue Tokenzahl lässt sich nur mit dem Tokenizer des jeweiligen Modells oder einem offiziellen Zählverfahren bestimmen.
Eingabe-Tokens und Ausgabe-Tokens
Bei der Nutzung einer KI entstehen verschiedene Tokenarten.
Eingabe-Tokens
Eingabe-Tokens umfassen alles, was dem Modell zur Bearbeitung übergeben wird. Dazu können gehören:
- die aktuelle Frage,
- frühere Nachrichten des Gesprächs,
- hochgeladene Texte und Dokumente,
- Systemanweisungen,
- Werkzeugbeschreibungen,
- zusätzliche Hintergrundinformationen.
Eine kurze Frage kann deshalb Bestandteil einer wesentlich größeren Eingabe sein. Der sichtbare Text im Eingabefeld entspricht nicht immer dem gesamten Inhalt, den das Modell verarbeitet.
Ausgabe-Tokens
Ausgabe-Tokens entstehen bei der Antwort der KI. Je ausführlicher die Antwort, desto mehr Tokens werden benötigt.
Bei der OpenAI-API werden Eingabe und Ausgabe getrennt erfasst und berechnet. Ausgabe-Tokens sind häufig teurer, da das Modell diese Schritt für Schritt erzeugt.
Reasoning-Tokens
Einige Modelle verwenden zusätzliche interne Verarbeitungsschritte. Diese werden häufig als Reasoning- oder Denktokens bezeichnet. Sie müssen nicht vollständig in der sichtbaren Antwort erscheinen, können aber dennoch Platz im Kontextfenster beanspruchen.
Die abgerechnete Tokenmenge kann deshalb größer sein als die Zahl der sichtbaren Wörter.
Was ist das Kontextfenster?
Jedes KI-Modell besitzt ein begrenztes Kontextfenster. Es beschreibt die Menge an Tokens, die das Modell innerhalb eines Arbeitsvorgangs gleichzeitig berücksichtigen kann.
In dieses Fenster müssen je nach Anwendung mehrere Bestandteile passen:
- die aktuelle Eingabe,
- relevante frühere Nachrichten,
- Dokumente und Bilder,
- Systemanweisungen,
- Werkzeugbeschreibungen,
- interne Verarbeitung,
- die erzeugte Antwort.
Besitzt ein Modell beispielsweise ein Kontextfenster von 100.000 Tokens, kann der Anwender nicht zwangsläufig einen Text mit genau 100.000 Tokens eingeben. Es muss noch Platz für die Antwort und mögliche Verarbeitungsschritte bleiben.
Wer eine ausführliche Antwort benötigt, sollte deshalb einen Teil der verfügbaren Kapazität reservieren.
Was passiert bei einer Überschreitung?
Wird das Kontextfenster zu stark gefüllt, können verschiedene Probleme auftreten:
- Die Eingabe wird wegen ihrer Größe abgelehnt.
- Die Antwort fällt kürzer aus als erwartet.
- Die Ausgabe wird abgeschnitten.
- Ältere Gesprächsinhalte werden nicht mehr vollständig berücksichtigt.
- Inhalte werden automatisch zusammengefasst.
- Wichtige Einzelheiten aus früheren Nachrichten gehen verloren.
Ein langer Chat besitzt daher nicht automatisch ein unbegrenztes Gedächtnis. Frühere Nachrichten können weiterhin sichtbar sein, ohne dass das Modell jede davon vollständig in die nächste Bearbeitung einbezieht.
ChatGPT und API sind nicht identisch
Bei Token-Grenzen muss zwischen ChatGPT und der OpenAI-API unterschieden werden.
Ein Modell kann über die API ein großes veröffentlichtes Kontextfenster besitzen. In ChatGPT können jedoch abhängig vom Tarif, Arbeitsmodus und verwendeten Werkzeug andere praktische Grenzen gelten.
Auch eine Websuche, hochgeladene Dateien oder angeschlossene Werkzeuge benötigen Platz. Die Modellbezeichnung allein sagt deshalb nicht immer aus, wie viel Text der Nutzer tatsächlich eingeben kann.
Kosten Tokens in ChatGPT Geld?
Bei einem normalen ChatGPT-Abonnement werden einzelne Nachrichten üblicherweise nicht nach jedem verbrauchten Token separat berechnet. Stattdessen gelten abhängig vom Tarif bestimmte Nutzungs-, Nachrichten- oder Modellgrenzen.
Anders funktioniert die OpenAI-API. Dort richtet sich der Preis normalerweise nach der Zahl der verarbeiteten Eingabe- und Ausgabe-Tokens. Die Kosten unterscheiden sich je nach Modell.
Wer eine eigene Software, ein WordPress-Plugin oder einen automatischen Textdienst mit der API betreibt, sollte die Tokenmenge deshalb überwachen. Wiederholt übertragene Dokumente und sehr lange Gesprächsverläufe können die Kosten deutlich erhöhen.
Verbrauchen Bilder und Dateien ebenfalls Tokens?
Nicht nur normaler Text beansprucht Modellkapazität. Auch Bilder, PDF-Dateien, Tabellen, Werkzeugdefinitionen und strukturierte Daten können angerechnet werden.
Bei Bildern hängt der Verbrauch unter anderem von Größe, Auflösung und Verarbeitungsart ab. Bei Dateien zählt nicht einfach nur die sichtbare Zeichenzahl. Das System muss den Inhalt zunächst aufbereiten und für das Modell verfügbar machen.
Eine Berechnung nach dem Muster „Zeichen geteilt durch vier“ reicht bei Bildern, Dateien oder Werkzeugen nicht aus.
Wie lässt sich die Tokenzahl berechnen?
Für eine schnelle Einschätzung genügt ein lokaler Token-Rechner. Dieser schätzt die Tokenmenge anhand von Zeichen, Wörtern, Zahlen und Sonderzeichen. Der Vorteil besteht darin, dass der Text den eigenen Browser oder Server nicht verlassen muss.
Eine exakte Zählung benötigt dagegen die zum Modell passende Tokenisierung. OpenAI stellt dafür einen eigenen API-Endpunkt zur Verfügung. Dieser kann neben Text auch Nachrichtenstrukturen, Dateien, Bilder und Werkzeugdefinitionen berücksichtigen.
Dabei ist der Datenschutz zu beachten: Für eine exakte Zählung über eine externe Schnittstelle muss der Inhalt an den Anbieter übertragen werden. Bei vertraulichen Texten kann eine lokale Schätzung die sicherere Lösung sein.
Wie kann man Tokens sparen?
Tokens lassen sich reduzieren, ohne wichtige Informationen zu verlieren:
- Wiederholungen entfernen.
- Das Ziel klar und direkt formulieren.
- Nur benötigte Dokumente hochladen.
- Lange Gespräche kompakt zusammenfassen.
- Große Dateien in passende Abschnitte aufteilen.
- Nicht mehr benötigte Informationen weglassen.
- Die gewünschte Antwortlänge festlegen.
- Wichtige Fakten nur einmal eindeutig nennen.
Eine möglichst kurze Eingabe ist allerdings nicht automatisch besser. Fehlen entscheidende Angaben, muss die KI nachfragen oder Annahmen treffen. Eine gute Eingabe ist deshalb vollständig und eindeutig, aber frei von unnötigen Wiederholungen.
Fazit
Tokens sind die Verarbeitungseinheiten einer textbasierten künstlichen Intelligenz. Sie entsprechen nicht exakt den sichtbaren Wörtern und können je nach Sprache, Schreibweise und Modell unterschiedlich aufgeteilt werden.
Die Tokenzahl bestimmt, wie viel Inhalt ein Modell gleichzeitig verarbeiten kann, wie lang die Antwort werden darf und welche Kosten bei einer API-Nutzung entstehen. Zum Kontext gehören außerdem nicht nur die aktuelle Frage, sondern möglicherweise auch frühere Nachrichten, Dateien, Bilder, Werkzeuge und interne Verarbeitungsschritte.
Für normale Texte reicht meistens eine ungefähre Berechnung. Bei umfangreichen Dokumenten, automatisierten Anwendungen oder kostenpflichtigen API-Anfragen ist eine modellgenaue Zählung sinnvoll.