Sprachmodelle teilen Text in Tokens auf, die kleinsten Einheiten, die sie verarbeiten. Dieses Werkzeug zeigt dir diese Aufteilung zusammen mit Textstatistiken.
1. Wähle oben den Modus: Sofort (Standard) oder Exakt.
2. Wähle im Modus Sofort die Kodierung / das Modell im Dropdown.
3. Schreibe oder füge deinen Text bei „Zu tokenisierender Text“ ein (oder klicke auf ein Beispiel: Kurz, Absatz oder Code).
4. Die Zählung aktualisiert sich automatisch, sobald du aufhörst zu schreiben; oben siehst du Tokens, Zeichen und Chars / Token.
5. Unten zeigt der Tab Visualisierung die Zerlegung, und Kosten und Kontext schätzt den Preis pro Modell. Alles geschieht in deinem Browser.
Es wird der GPT-2-Tokenizer (BPE) verwendet, ähnlich — aber nicht identisch — dem von GPT-4 oder Claude. Die Token-Zahlen können leicht abweichen.
Das Dropdown im Modus Sofort wählt, mit welcher Kodierung gezählt wird. Jede wird von mehreren Modellen geteilt und hat ihr eigenes Kontextfenster:
• o200k_base — GPT-4o / o1 — die neueste; verwendet von GPT-4o, GPT-4o-mini und o1. Kontext 128K Tokens. Das ist die Standardoption.
• cl100k_base — GPT-4 / GPT-3.5 — für GPT-4, GPT-3.5 Turbo und die Embedding-Modelle. Kontext 128K.
• p50k_base — Codex / davinci-002 — ältere Modelle: Codex und text-davinci-002/003. Kontext 8K.
• r50k_base — GPT-3 / GPT-2 — die ältesten: davinci (GPT-3) und GPT-2. Kontext 2K.
Wähle die, die zu deinem Modell passt: Derselbe Text ergibt je nach Kodierung eine etwas andere Anzahl an Tokens.
Über dem Text siehst du drei Werte:
• Tokens — die Zählung, die für Kontext und Kosten wirklich zählt. Es ist die tatsächliche Zahl, auch wenn die Visualisierung abgeschnitten wird.
• Zeichen — Länge des Textes in Zeichen (einschließlich Leerzeichen und Zeilenumbrüche).
• Chars / Token — durchschnittliche Zeichen pro Token. Je höher, desto „effizienter“ ist der Text (weniger Tokens pro Buchstabe); Code und Sprachen mit vielen Akzenten senken diesen Wert meist.
Jede Farbe steht für ein anderes Token. Schreibe oder füge Text ein, um zu sehen, wie er aufgeteilt wird.
Die gesamte Zerlegung und Zählung erfolgt in deinem Browser: Der Text verlässt niemals deinen Rechner. Im Modus Sofort wird nichts heruntergeladen; im Modus Exakt wird nur einmalig der GPT-2-Tokenizer (~5 MB) geladen und zwischengespeichert. Du kannst bedenkenlos Prompts oder Fragmente mit internen Daten einfügen.