Un modèle de langage ne lit ni lettres ni mots : il divise d'abord le texte en tokens, de petits morceaux (un mot court, une partie d'un mot long, un signe, un espace…). Comme règle approximative, en anglais 1 token ≈ 4 caractères ≈ ¾ de mot ; en français et en code il y a généralement un peu plus de tokens par mot.
Compter les tokens compte pour deux raisons :
• Fenêtre de contexte — chaque modèle accepte un nombre maximal de tokens (entrée + sortie). Si tu dépasses, le texte est coupé ou la requête échoue.
• Coût — les API facturent par token, pas par mot. Savoir combien il y en a te dit combien tu paieras et si ça rentre.
1. Choisissez le mode en haut : Instantané (par défaut) ou Exact.
2. En mode Instantané, choisissez l'encodage / modèle dans le menu déroulant.
3. Écrivez ou collez votre texte dans « Texte à tokeniser » (ou cliquez sur un Exemple : Court, Paragraphe ou Code).
4. Le décompte se met à jour dès que vous arrêtez d'écrire ; en haut vous voyez Tokens, Caractères et Chars / token.
5. En bas, l'onglet Visualisation montre le découpage et Coûts et contexte estime le prix par modèle. Tout se passe dans votre navigateur.
Hay dos formas de trocear, ambas BPE (Byte Pair Encoding) y 100% locales:
• Instantáneo (por defecto) — usa la librería gpt-tokenizer con las codificaciones reales de OpenAI. No descarga nada y responde al momento. Es el conteo exacto para los modelos de OpenAI.
• Exacto (descargable) — baja el tokenizador real de GPT-2, Qwen3 (multilingüe) o SmolLM2 (sobre todo inglés): solo su vocabulario, de 2 a 10 MB, una vez y en caché. Sirve para comparar: el mismo texto en español sale en muchos más trozos con un tokenizador hecho para el inglés.
Ninguno es el de Claude ni el de Gemini, que no son públicos: para ellos el número es una estimación, no exacto.
Le menu déroulant du mode Instantané choisit avec quel encodage le comptage se fait. Chacun est partagé par plusieurs modèles et a sa propre fenêtre de contexte :
• o200k_base — GPT-4o / o1 — le plus récent ; utilisé par GPT-4o, GPT-4o-mini et o1. Contexte 128K tokens. C'est l'option par défaut.
• cl100k_base — GPT-4 / GPT-3.5 — pour GPT-4, GPT-3.5 Turbo et les modèles d'embeddings. Contexte 128K.
• p50k_base — Codex / davinci-002 — anciens modèles : Codex et text-davinci-002/003. Contexte 8K.
• r50k_base — GPT-3 / GPT-2 — les plus anciens : davinci (GPT-3) et GPT-2. Contexte 2K.
Choisissez celui qui correspond à votre modèle : un même texte donne un nombre de tokens légèrement différent selon l'encodage.
Sur le texte vous verrez trois chiffres :
• Tokens — le décompte qui compte vraiment pour le contexte et le coût. C'est le nombre réel même si la visualisation est tronquée.
• Caractères — longueur du texte en caractères (espaces et sauts de ligne inclus).
• Chars / token — caractères par token en moyenne. Plus c'est élevé, plus le texte est « efficace » (moins de tokens par lettre) ; le code et les langues avec beaucoup d'accents ont tendance à faire baisser ce chiffre.
Chaque case colorée est un token ; les couleurs alternent seulement pour distinguer les limites. Observe comme un mot long se divise en plusieurs morceaux et comme les espaces sont généralement collés au début du token suivant. Pour ne pas surcharger le navigateur, la vue affiche au maximum les 500 premiers tokens ; si ton texte est plus long, un avis apparaît, mais le décompte et le coût portent sur le texte complet.
Todo el troceado y el conteo ocurren en tu navegador: el texto nunca sale de tu equipo. En modo Instantáneo no se descarga nada; en modo Exacto solo se baja una vez el vocabulario del tokenizador que elijas, y queda en caché. Puedes pegar sin miedo prompts o fragmentos con datos internos.