Texto e documentos
Números e cálculo
Dados e formatos
Segurança
Desenvolvimento e DevOps
Inteligência Artificial
Finanças
Saúde & Bem-estar
Produtividade
Jogos & Entretenimento
Multimédia e design
Empresa
Guia de utilização
O que é e para que serve

Avalia um classificador binário (prevê sim/não, 1/0). O modelo não solta um veredicto, mas sim uma pontuação de 0 a 1 —a probabilidade de ser classe 1— e você decide onde cortar. Esta ferramenta gera dados de exemplo e mostra-lhe ao vivo como se avalia: histograma de pontuações, matriz de confusão, métricas e as curvas ROC e PR. Tudo é recalculado ao instante no seu navegador; não há nada para treinar.

Os controlos: um dataset de brincar

Os dados são sintéticos para que experimente sem trazer os seus:

Qualidade — o quão bom é o classificador: 0 = aleatório (as pontuações de positivos e negativos sobrepõem-se), 1 = quase perfeito (separam-se de forma limpa).
Equilíbrio — a fração de exemplos que são positivos; baixe-o para simular classes desequilibradas.
Amostras — quantos exemplos gerar (100–1000).
Regenerar — volta a sortear os dados com outra semente mantendo os ajustes, para ver a variabilidade.

O limiar decide tudo

O limiar é a linha de corte: pontuação ≥ limiar → prevê-se positivo. No histograma, as barras são as pontuações dos negativos (0) e dos positivos (1); a linha vertical é o seu limiar. Mova-a e observe: descê-la captura mais positivos reais (mais recall) mas deixa passar mais falsos alarmes (menos precisão); subi-la faz o contrário. Não existe um limiar perfeito: depende de que erro lhe custa mais caro.

A matriz de confusão, célula a célula

Cruza o real (linhas) com o previsto (colunas) no limiar atual:

TP (verdadeiro positivo) — era 1 e acertou 1: um positivo bem apanhado.
FN (falso negativo) — era 1 e disse 0: um positivo que lhe escapa.
FP (falso positivo) — era 0 e disse 1: um falso alarme.
TN (verdadeiro negativo) — era 0 e acertou 0: um negativo bem descartado.

A diagonal TP + TN (verde) são os acertos; fora dela FP + FN (vermelho) os erros. A cor intensifica-se com a contagem.

As métricas e o que significa cada uma

Calculam-se sobre as quatro células:

Exatidão = (TP+TN)/total — percentagem de acertos. Engana se as classes estiverem desequilibradas.
Precisão = TP/(TP+FP) — do que marca como positivo, quanto acerta.
Recall (TPR ou sensibilidade) = TP/(TP+FN) — dos positivos reais, quantos apanha.
Especificidade = TN/(TN+FP) — dos negativos reais, quantos descarta.
F1 = média harmónica de precisão e recall 2·P·R/(P+R) — um único número que premeia o equilíbrio entre ambas.

ROC e AUC

A curva ROC percorre TODOS os limiares em simultâneo, confrontando acertos (TPR = recall) contra falsos alarmes (FPR = FP/(FP+TN)). O ponto marcado é o seu limiar atual e a diagonal é o acaso. O AUC (área sob a curva) resume a qualidade sem depender do limiar: 1 = perfeito, 0.5 = acaso. Equivale à probabilidade de um positivo aleatório pontuar mais alto do que um negativo aleatório.

PR, AP e o desequilíbrio

A curva PR confronta precisão contra recall ao longo dos limiares; o seu resumo é o AP (precisão média). A linha de base horizontal é a fração de positivos: o que um classificador aleatório tiraria. Com classes muito desequilibradas essa linha afunda-se e superá-la de verdade custa —por isso a PR é mais honesta do que a exatidão quando há poucos positivos—. Baixe o «Equilíbrio» e comprove-o.

ROC ou PR? quando usar cada uma

• Use a ROC/AUC quando as classes estão equilibradas ou lhe importam por igual acertos e falsos alarmes; é robusta e fácil de comparar entre modelos.
• Use a PR/AP quando os positivos são raros (fraude, doença, spam) e o que lhe importa é acertar neles: a ROC pode parecer ótima enquanto a precisão real é fraca.

Truque: baixe a «Qualidade» e verá a ROC colar-se à diagonal; baixe o «Equilíbrio» e verá como a exatidão mente mas o AP não.

Matriz de confusão & ROCLimiar, precisão/recall, ROC/AUC, PR
Matriz de confusão, ROC e PRAvalia um classificador binário: move o limiar e observa métricas e curvas ao vivo
Qualidade
0.600
Balanço
50.0%
Amostras
500
Pontuações do modelo
Negativos (0)Positivos (1)Limiar 0.500 →
Matriz de confusão
Predição
Real10
1220TP26FN
029FP225TN
Exatidão89.0%
Precisão88.4%
Recall (TPR)89.4%
Especificidade88.6%
F10.889
ROC · AUC = 0.960
FPR (falsos alarmes)↑ TPR (acertos)
PR · AP = 0.959
Recall↑ Precisão

Escolher o limiar e ler estas curvas é o pão nosso de cada dia ao avaliar um modelo. Experimenta: baixa a «qualidade» e vê a ROC colar-se à diagonal; baixa o «equilíbrio» e observa como a exatidão mente mas o AP não. Relacionado: Teste de hipóteses e Rede neuronal.