Texte & documents
Nombres & calcul
Données & formats
Sécurité
Développement & DevOps
Intelligence artificielle
Finances
Santé et bien-être
Productivité
Jeux et divertissement
Multimédia & design
Entreprise
Guide d'utilisation
Que sont les tokens

Les modèles de langage divisent le texte en tokens, les plus petites unités qu'ils traitent. Cet outil vous montre ce découpage ainsi que des statistiques sur le texte.

Comment l'utiliser (étape par étape)

1. Choisissez le mode en haut : Instantané (par défaut) ou Exact.
2. En mode Instantané, choisissez l'encodage / modèle dans le menu déroulant.
3. Écrivez ou collez votre texte dans « Texte à tokeniser » (ou cliquez sur un Exemple : Court, Paragraphe ou Code).
4. Le décompte se met à jour dès que vous arrêtez d'écrire ; en haut vous voyez Tokens, Caractères et Chars / token.
5. En bas, l'onglet Visualisation montre le découpage et Coûts et contexte estime le prix par modèle. Tout se passe dans votre navigateur.

Tokeniseur GPT-2

On utilise le tokeniseur GPT-2 (BPE), similaire —mais pas identique— à celui de GPT-4 ou Claude. Les décomptes de tokens peuvent varier légèrement.

Encodages et à quel modèle ils correspondent

Le menu déroulant du mode Instantané choisit avec quel encodage le comptage se fait. Chacun est partagé par plusieurs modèles et a sa propre fenêtre de contexte :

o200k_base — GPT-4o / o1 — le plus récent ; utilisé par GPT-4o, GPT-4o-mini et o1. Contexte 128K tokens. C'est l'option par défaut.
cl100k_base — GPT-4 / GPT-3.5 — pour GPT-4, GPT-3.5 Turbo et les modèles d'embeddings. Contexte 128K.
p50k_base — Codex / davinci-002 — anciens modèles : Codex et text-davinci-002/003. Contexte 8K.
r50k_base — GPT-3 / GPT-2 — les plus anciens : davinci (GPT-3) et GPT-2. Contexte 2K.

Choisissez celui qui correspond à votre modèle : un même texte donne un nombre de tokens légèrement différent selon l'encodage.

Comment lire le résultat

Sur le texte vous verrez trois chiffres :

Tokens — le décompte qui compte vraiment pour le contexte et le coût. C'est le nombre réel même si la visualisation est tronquée.
Caractères — longueur du texte en caractères (espaces et sauts de ligne inclus).
Chars / token — caractères par token en moyenne. Plus c'est élevé, plus le texte est « efficace » (moins de tokens par lettre) ; le code et les langues avec beaucoup d'accents ont tendance à faire baisser ce chiffre.

Visualisation

Chaque couleur représente un token distinct. Écrivez ou collez du texte pour voir comment il est découpé.

Confidentialité

Tout le découpage et le comptage se font dans votre navigateur : le texte ne quitte jamais votre appareil. En mode Instantané rien n'est téléchargé ; en mode Exact seul le tokenizer GPT-2 (~5 Mo) est téléchargé une fois et mis en cache. Vous pouvez coller sans crainte des prompts ou fragments contenant des données internes.

TokeniseurVisualisez les tokens, comparez les modèles, estimez les coûts
Tokeniseur visuelVois comment les LLM découpent le texte · Estime les coûts · BPE instantané ou GPT-2 téléchargeable
Le vrai BPE de GPT à l'instant (bibliothèque gpt-tokenizer), rien à télécharger.
Ejemplos: