MACHINE LEARNING · CLASSIFICAÇÃO

Transformar dados em categorias.

Classificação é uma tarefa de aprendizado supervisionado na qual o modelo recebe exemplos rotulados e aprende a atribuir uma ou mais classes a novas entradas.

Conhecer os tipos

PREVISÃO DE UMA IMAGEM

Gato72%
Cachorro21%
Coelho7%
Classe escolhidaGato

01 · IDEIA CENTRAL

Classificar não é estimar qualquer número.

O resultado representa uma categoria definida pelo problema.

Classificação

A saída pertence a um conjunto de classes: fraude ou legítima, espécie de flor, nível de risco ou assuntos presentes em um texto.

f(x) → classe, conjunto de classes ou nível

Regressão

A saída é uma quantidade contínua: preço, temperatura, consumo ou duração. Arredondar uma regressão não a transforma automaticamente em um bom classificador.

f(x) → valor numérico contínuo
1. Entradasx₁, x₂, …, xₙ descrevem cada exemplo.
2. EscoresO modelo calcula evidências para as classes.
3. DecisãoUma regra converte os escores em rótulo.
4. AvaliaçãoA previsão ŷ é comparada com o alvo y.

02 · FORMAS DE CLASSIFICAÇÃO

A pergunta determina o formato da saída.

Antes de escolher um algoritmo, verifique quantas classes podem ser atribuídas a cada amostra e se existe ordem entre elas.

01

Classificação binária

Cada amostra pertence a uma entre duas classes mutuamente exclusivas. Uma delas costuma ser chamada de positiva e a outra de negativa.

spamnão spam
Saída comum: um escore ou uma probabilidade da classe positiva, convertido em decisão por um limiar.
Exemploentrada: dados da transação
p(fraude) = 0,82
limiar = 0,60
ŷ = fraude
02

Classificação multiclasse

Existem três ou mais classes, mas cada amostra recebe somente uma delas. O modelo escolhe a classe de maior escore.

gatocachorrocoelho
Estratégias: alguns algoritmos tratam todas as classes diretamente; outros usam combinações um-contra-restante ou um-contra-um.
ExemploP = [0,72; 0,21; 0,07]
argmax(P) = índice 1
ŷ = gato
03

Classificação multirrótulo

Uma mesma amostra pode receber vários rótulos simultaneamente. Cada rótulo responde a uma pergunta própria: está presente ou não?

praiapessoapôr do sol
Não confunda: multiclasse escolhe uma classe; multirrótulo pode selecionar zero, uma ou várias.
ExemploP = [0,91; 0,78; 0,32]
limiar = 0,50
ŷ = [praia, pessoa]
04

Classificação ordinal

As classes são categorias, mas possuem uma ordem natural. Confundir “baixo” com “médio” costuma ser menos grave que confundir “baixo” com “alto”.

baixomédioaltocrítico
Atenção: atribuir números 1, 2, 3 e 4 não basta. O treinamento e a métrica precisam respeitar a ordem e a distância entre erros.
Exemploentrada: sinais clínicos
nível real = alto
ŷ = médio
erro de 1 nível
05

Uma classe · novidade e anomalia

O modelo aprende a região considerada normal e sinaliza entradas que se afastam dela. É útil quando exemplos da condição rara são poucos ou desconhecidos.

normalfora do padrão
Novidade: o treino contém dados normais limpos. Detecção de anomalias: o conjunto de treino pode já conter alguns pontos anormais.
Exemploperfil aprendido: operação normal
nova leitura: muito distante
ŷ = possível anomalia

03 · DA PONTUAÇÃO À CLASSE

O modelo calcula; o limiar decide.

Na classificação binária, um escore contínuo preserva mais informação que a resposta final 0 ou 1.

Exemplo com regressão logística

z = w₁x₁ + w₂x₂ + b
p = σ(z) = 1 ÷ (1 + e⁻ᶻ)

ŷ = 1, se p ≥ limiar
ŷ = 0, caso contrário

O treinamento ajusta os parâmetros. O limiar é uma decisão de operação e pode ser escolhido depois, de acordo com o custo dos erros.

Uma previsão de 0,72

Com limiar 0,50, a amostra é classificada como positiva.

limiar 0,50
0,72 ≥ 0,50 → classe positiva

Elevar o limiar tende a reduzir positivos previstos: normalmente diminui falsos positivos, mas aumenta falsos negativos.

04 · MATRIZ DE CONFUSÃO

Acertar e errar possuem quatro significados.

Considere 100 previsões: 48 casos eram realmente positivos e 52 eram negativos.

Real positivo
Real negativo
Prevê positivo
42VP · verdadeiro positivo
8FP · falso positivo
Prevê negativo
6FN · falso negativo
44VN · verdadeiro negativo
Acurácia(VP+VN) ÷ total86%
PrecisãoVP ÷ (VP+FP)84%
RecallVP ÷ (VP+FN)87,5%
F12·precisão·recall ÷ (precisão+recall)85,7%

05 · CLASSES DESBALANCEADAS

Acurácia alta pode esconder um modelo inútil.

1.000 transações990 legítimas e somente 10 fraudes
99% de acuráciase o modelo responder “legítima” em todas — mas detectar 0 fraudes

Como avaliar melhor: examine a matriz de confusão, precisão, recall, F1 e curvas precisão–recall. No treinamento, considere pesos de classe, reamostragem e coleta de mais exemplos raros — sempre aplicados apenas ao conjunto de treino para evitar vazamento.

06 · ALGORITMOS

Várias famílias podem produzir classificadores.

O tipo da saída, a natureza dos dados, a explicabilidade e o custo computacional orientam a escolha.

ModeloComo decide?Onde costuma funcionar bem?Tratamento importante
Regressão logísticaTransforma uma soma linear em probabilidade.Referência simples, rápida e explicável para dados tabulares.Escala, categorias codificadas e relações aproximadamente lineares na fronteira.
Árvore de decisãoAplica perguntas sucessivas “se/então”.Dados tabulares com limiares e interações.Controlar profundidade para reduzir sobreajuste.
Random Forest e BoostingCombinam várias árvores por média, votação ou correção sequencial.Problemas tabulares complexos.Ajustar complexidade, desbalanceamento e validação.
k-NNConsulta os rótulos dos vizinhos mais próximos.Bases menores com proximidade significativa.Padronizar escalas e escolher distância e k.
SVMProcura uma fronteira com margem ampla; kernels permitem curvas.Bases pequenas ou médias e espaços de muitas dimensões.Padronizar entradas e ajustar C e kernel.
Naïve BayesCombina probabilidades condicionais das características.Texto, spam e referências probabilísticas rápidas.Escolher a distribuição coerente com os dados.
Redes neuraisAprendem representações e fronteiras por várias camadas.Imagem, áudio, texto e grandes bases complexas.Arquitetura, ativação de saída, função de perda e regularização.

07 · ROTEIRO DE PROJETO

Defina a tarefa antes de treinar.

1. ClassesPodem coexistir? Possuem ordem?
2. DadosLimpe, represente e divida treino, validação e teste.
3. ModeloComece com uma referência simples.
4. MétricaEscolha conforme o custo de FP e FN.

IDEIA PARA LEVAR

Classificar é definir uma decisão e medir suas consequências.

O mesmo escore pode gerar decisões diferentes conforme o limiar; e a mesma acurácia pode esconder tipos de erro muito diferentes. Classes, métricas e custos precisam ser definidos em conjunto.

Ver algoritmos supervisionados