Classificação
A saída pertence a um conjunto de classes: fraude ou legítima, espécie de flor, nível de risco ou assuntos presentes em um texto.
MACHINE LEARNING · CLASSIFICAÇÃO
Classificação é uma tarefa de aprendizado supervisionado na qual o modelo recebe exemplos rotulados e aprende a atribuir uma ou mais classes a novas entradas.
Conhecer os tiposPREVISÃO DE UMA IMAGEM
01 · IDEIA CENTRAL
O resultado representa uma categoria definida pelo problema.
A saída pertence a um conjunto de classes: fraude ou legítima, espécie de flor, nível de risco ou assuntos presentes em um texto.
A saída é uma quantidade contínua: preço, temperatura, consumo ou duração. Arredondar uma regressão não a transforma automaticamente em um bom classificador.
02 · FORMAS DE CLASSIFICAÇÃO
Antes de escolher um algoritmo, verifique quantas classes podem ser atribuídas a cada amostra e se existe ordem entre elas.
Cada amostra pertence a uma entre duas classes mutuamente exclusivas. Uma delas costuma ser chamada de positiva e a outra de negativa.
entrada: dados da transação
p(fraude) = 0,82
limiar = 0,60
ŷ = fraudeExistem três ou mais classes, mas cada amostra recebe somente uma delas. O modelo escolhe a classe de maior escore.
P = [0,72; 0,21; 0,07]
argmax(P) = índice 1
ŷ = gatoUma mesma amostra pode receber vários rótulos simultaneamente. Cada rótulo responde a uma pergunta própria: está presente ou não?
P = [0,91; 0,78; 0,32]
limiar = 0,50
ŷ = [praia, pessoa]As classes são categorias, mas possuem uma ordem natural. Confundir “baixo” com “médio” costuma ser menos grave que confundir “baixo” com “alto”.
entrada: sinais clínicos
nível real = alto
ŷ = médio
erro de 1 nívelO modelo aprende a região considerada normal e sinaliza entradas que se afastam dela. É útil quando exemplos da condição rara são poucos ou desconhecidos.
perfil aprendido: operação normal
nova leitura: muito distante
ŷ = possível anomalia03 · DA PONTUAÇÃO À CLASSE
Na classificação binária, um escore contínuo preserva mais informação que a resposta final 0 ou 1.
O treinamento ajusta os parâmetros. O limiar é uma decisão de operação e pode ser escolhido depois, de acordo com o custo dos erros.
Com limiar 0,50, a amostra é classificada como positiva.
Elevar o limiar tende a reduzir positivos previstos: normalmente diminui falsos positivos, mas aumenta falsos negativos.
04 · MATRIZ DE CONFUSÃO
Considere 100 previsões: 48 casos eram realmente positivos e 52 eram negativos.
(VP+VN) ÷ total86%VP ÷ (VP+FP)84%VP ÷ (VP+FN)87,5%2·precisão·recall ÷ (precisão+recall)85,7%05 · CLASSES DESBALANCEADAS
Como avaliar melhor: examine a matriz de confusão, precisão, recall, F1 e curvas precisão–recall. No treinamento, considere pesos de classe, reamostragem e coleta de mais exemplos raros — sempre aplicados apenas ao conjunto de treino para evitar vazamento.
06 · ALGORITMOS
O tipo da saída, a natureza dos dados, a explicabilidade e o custo computacional orientam a escolha.
| Modelo | Como decide? | Onde costuma funcionar bem? | Tratamento importante |
|---|---|---|---|
| Regressão logística | Transforma uma soma linear em probabilidade. | Referência simples, rápida e explicável para dados tabulares. | Escala, categorias codificadas e relações aproximadamente lineares na fronteira. |
| Árvore de decisão | Aplica perguntas sucessivas “se/então”. | Dados tabulares com limiares e interações. | Controlar profundidade para reduzir sobreajuste. |
| Random Forest e Boosting | Combinam várias árvores por média, votação ou correção sequencial. | Problemas tabulares complexos. | Ajustar complexidade, desbalanceamento e validação. |
| k-NN | Consulta os rótulos dos vizinhos mais próximos. | Bases menores com proximidade significativa. | Padronizar escalas e escolher distância e k. |
| SVM | Procura uma fronteira com margem ampla; kernels permitem curvas. | Bases pequenas ou médias e espaços de muitas dimensões. | Padronizar entradas e ajustar C e kernel. |
| Naïve Bayes | Combina probabilidades condicionais das características. | Texto, spam e referências probabilísticas rápidas. | Escolher a distribuição coerente com os dados. |
| Redes neurais | Aprendem representações e fronteiras por várias camadas. | Imagem, áudio, texto e grandes bases complexas. | Arquitetura, ativação de saída, função de perda e regularização. |
07 · ROTEIRO DE PROJETO
IDEIA PARA LEVAR
O mesmo escore pode gerar decisões diferentes conforme o limiar; e a mesma acurácia pode esconder tipos de erro muito diferentes. Classes, métricas e custos precisam ser definidos em conjunto.
Ver algoritmos supervisionados