Texto e documentos
Números e cálculo
Dados e formatos
Segurança
Desenvolvimento e DevOps
Inteligência Artificial
Finanças
Saúde & Bem-estar
Produtividade
Jogos & Entretenimento
Multimédia e design
Empresa
Guia de utilização
O que são os tokens

Os modelos de linguagem dividem o texto em tokens, as unidades mínimas que processam. Esta ferramenta mostra-te essa divisão juntamente com estatísticas do texto.

Como se usa (passo a passo)

1. Escolhe o modo acima: Instantâneo (por defeito) ou Exato.
2. No Instantâneo, escolhe a codificação / modelo no menu suspenso.
3. Escreve ou cola o teu texto em «Texto a tokenizar» (ou clica num Exemplo: Curto, Parágrafo ou Código).
4. A contagem atualiza-se só ao parares de escrever; em cima vês Tokens, Carateres e Chars / token.
5. Em baixo, o separador Visualização mostra o fracionamento e Custos e contexto estima o preço por modelo. Tudo acontece no teu navegador.

Tokenizador GPT-2

Usa-se o tokenizador GPT-2 (BPE), semelhante —mas não idêntico— ao do GPT-4 ou Claude. As contagens de tokens podem variar ligeiramente.

Codificações e a que modelo correspondem

O menu suspenso do modo Instantâneo escolhe com que codificação se conta. Cada uma é partilhada por vários modelos e tem a sua própria janela de contexto:

o200k_base — GPT-4o / o1 — a mais recente; usada pelo GPT-4o, GPT-4o-mini e o1. Contexto 128K tokens. É a opção por defeito.
cl100k_base — GPT-4 / GPT-3.5 — para GPT-4, GPT-3.5 Turbo e os modelos de embeddings. Contexto 128K.
p50k_base — Codex / davinci-002 — modelos antigos: Codex e text-davinci-002/003. Contexto 8K.
r50k_base — GPT-3 / GPT-2 — os mais antigos: davinci (GPT-3) e GPT-2. Contexto 2K.

Escolhe a que corresponde ao teu modelo: o mesmo texto dá um número de tokens algo diferente consoante a codificação.

Como ler o resultado

Sobre o texto verás três valores:

Tokens — a contagem que realmente importa para o contexto e o custo. É o número real ainda que a visualização se corte.
Carateres — comprimento do texto em carateres (inclui espaços e quebras de linha).
Chars / token — carateres por token em média. Quanto mais alto, mais «eficiente» é o texto (menos tokens por letra); o código e os idiomas com muitos acentos costumam baixar este valor.

Visualização

Cada cor representa um token distinto. Escreve ou cola texto para veres como é dividido.

Privacidade

Todo o fracionamento e a contagem ocorrem no teu navegador: o texto nunca sai do teu equipamento. No modo Instantâneo não se transfere nada; no modo Exato só se descarrega uma vez o tokenizador GPT-2 (~5 MB) e fica em cache. Podes colar sem receio prompts ou fragmentos com dados internos.

TokenizadorVisualiza tokens, compara modelos, estima custos
Tokenizador visualVê como os LLMs dividem o texto · Estima custos · BPE instantâneo ou GPT-2 descarregável
BPE real de GPT no momento (biblioteca gpt-tokenizer), sem descarregar nada.
Ejemplos: