Min–max · normalização
Transporta mínimo e máximo para um intervalo, normalmente [0, 1]. O menor valor vira 0 e o maior vira 1. É sensível a valores extremos.
5.2 · PREPARAÇÃO DOS DADOS
Mudar a escala não altera o significado do atributo, mas torna suas magnitudes comparáveis. Isso é especialmente importante em modelos baseados em distância, gradiente, regularização e kernels.
DUAS TRANSFORMAÇÕES
Transporta mínimo e máximo para um intervalo, normalmente [0, 1]. O menor valor vira 0 e o maior vira 1. É sensível a valores extremos.
Centraliza a coluna na média e mede quantos desvios-padrão separam cada valor da média.
k-NN, k-means, SVM com RBF, PCA, regressões regularizadas e redes neurais são sensíveis à escala. Árvores costumam ser pouco afetadas por transformações monotônicas.
PARA QUE USAR Z-SCORE?
O z-score troca a unidade original — reais, anos ou quilômetros — por uma unidade comum: o número de desvios-padrão que separa o valor da média da coluna.
Depois da padronização, a média da coluna fica próxima de 0. Isso facilita a otimização de modelos treinados por gradiente.
O desvio-padrão passa a valer 1. Assim, renda, idade e distância podem participar de cálculos sem uma coluna dominar apenas pela unidade.
O sinal informa o lado da média e o módulo informa a distância: z negativo está abaixo; z positivo está acima.
| z-score | Leitura | Exemplo |
|---|---|---|
| z = 0 | Valor igual à média. | Renda exatamente igual à renda média do treino. |
| z = +1 | Um desvio-padrão acima da média. | Valor maior que o centro da coluna. |
| z = −2 | Dois desvios-padrão abaixo da média. | Valor consideravelmente abaixo do centro. |
| |z| elevado | Valor distante da maior parte da coluna. | Pode ser extremo, mas exige análise do domínio. |
k-NN, k-means, SVM, PCA, regressões linear e logística regularizadas, redes neurais e outros métodos baseados em distância ou gradiente.
Quando as colunas possuem unidades muito diferentes e queremos preservar quanto cada valor está distante da média, sem obrigá-lo a ficar entre 0 e 1.
Não transforma automaticamente os dados em uma distribuição normal, não limita valores extremos e não corrige viés, erros de coleta ou rótulos incorretos.
POR QUE NÚMEROS GRANDES ATRAPALHAM?
Uma coluna em milhares e outra entre 0 e 5 podem contribuir de forma muito diferente para os cálculos, mesmo quando a segunda é tão importante quanto a primeira.
Em k-NN, k-means e kernels, diferenças grandes pesam ao quadrado. Uma diferença de renda igual a 1.000 contribui com 1.000.000; uma diferença de idade igual a 10 contribui com apenas 100.
A superfície de custo pode ficar muito alongada. O gradiente desce em zigue-zague, exige taxa de aprendizado menor e pode demorar mais para convergir ou oscilar.
Quando as escalas são diferentes, o modelo precisa de pesos numericamente muito diferentes para compensá-las. Penalidades L1 e L2 passam a comparar coeficientes em escalas incompatíveis.
LABORATÓRIO INTERATIVO
A tabela possui cinco amostras e cinco atributos com escalas diferentes. Edite qualquer célula: mínimo, máximo, média, desvio-padrão, min–max, z-score e todas as contas serão atualizados imediatamente.
| Amostra | Idade anos | Renda R$ | Distância km | Compras unidades | Satisfação nota 1–5 |
|---|---|---|---|---|---|
| A | |||||
| B | |||||
| C | |||||
| D | |||||
| E |
O laboratório usa o desvio-padrão populacional didático: σ = √(Σ(xᵢ − μ)²/N), com N = 5.
| Atributo | Mínimo | Máximo | Média μ | Desvio σ |
|---|
Cada coluna passa a ocupar o intervalo de 0 a 1.
| Amostra | Idade | Renda | Distância | Compras | Satisfação |
|---|
Valores negativos estão abaixo da média; positivos estão acima; zero coincide com a média.
| Amostra | Idade | Renda | Distância | Compras | Satisfação |
|---|
As cinco caixas usam as estatísticas da respectiva coluna, nunca as estatísticas de outra variável.
Se todos os valores de uma coluna forem iguais, sua amplitude e seu desvio serão zero. Neste laboratório o resultado transformado será mostrado como 0 para evitar divisão por zero; na prática, uma coluna constante não acrescenta informação e pode ser removida.
DECISÃO PRÁTICA
Útil quando limites são conhecidos e estáveis e há poucos extremos. Um novo valor fora dos limites do treino pode produzir resultado menor que 0 ou maior que 1.
Boa escolha quando a distribuição é aproximadamente concentrada em torno da média. Não obriga os dados a terem distribuição normal.
Podem ajudar com caudas longas e extremos, mas precisam de justificativa, ajuste no treino e monitoramento em produção.
Transforme conhecimento do domínio em representações que facilitem o aprendizado.
Abrir engenharia de atributos →