PREPARAÇÃO DE DADOS · QUALIDADE

O modelo não separa sozinho sinal, erro e peso morto.

Tratar dados é torná-los adequados ao objetivo: corretos o bastante para representar o problema, relevantes para a previsão e eficientes para serem processados.

Precisãoaprender o sinal correto
Custoprocessar menos trabalho inútil
Equilíbriovalidar antes de remover

01 · O QUE É QUALIDADE?

Dado de qualidade é dado adequado ao uso.

Uma tabela pode estar completa e ainda ser ruim para uma previsão. Qualidade depende do problema, do momento da decisão e da população em que o modelo será usado.

Exatidão

O valor corresponde ao fato real?

idade = 32, não 320

Completude

Os campos necessários estão preenchidos?

renda ausente = 18%

Consistência

Formato, unidade e regras concordam?

kg ≠ libras

Validade

O valor respeita tipo, intervalo e domínio?

nota ∈ [0, 10]

Relevância

A variável ajuda o objetivo sem revelar o futuro?

prever aprovação ≠ ler resultado

Representatividade

O treino cobre os casos encontrados no uso real?

grupos, épocas e situações

02 · POR QUE TRATAR?

O tratamento atua na qualidade e no custo.

01

Evitar padrões falsos

Duplicatas, erros, vazamento do alvo e códigos tratados como medidas podem produzir uma validação enganosa.

02

Facilitar a otimização

Escalas coerentes e menos ruído tornam a superfície de erro mais fácil de percorrer por algoritmos de gradiente.

03

Reduzir processamento

Menos linhas redundantes, colunas inúteis e categorias desnecessárias significam matrizes menores.

04

Melhorar generalização

Selecionar sinais estáveis pode reduzir sobreajuste, mas a decisão deve ser confirmada em validação.

Custo simplificado do treinoC ≈ N × P × EN exemplos · P características após codificação · E épocas
Exemplo100.000 × 80 × 50= 400 milhões de valores processados
Após remoção validada80.000 × 45 × 50= 180 milhões · 55% menos

03 · VARIÁVEIS QUE ATRAPALHAM

Como suspeitar, testar e decidir.

Alguns problemas são detectáveis pela tabela; outros só aparecem quando comparamos o modelo em dados de validação que não participaram das decisões.

ProblemaComo detectarComo pode atrapalharAção possívelConfirmação
Coluna constantevariância = 0 ou um único valorOcupa memória e nunca separa exemplos.Remover.Regra direta.
ID quase únicovalores únicos ÷ linhas ≈ 100%Pode incentivar memorização e explodir um One-Hot.Remover, transformar ou investigar.Entender a semântica.
Muitos ausentesausentes ÷ linhas acima do limiteImputação pode dominar o sinal real.Coletar, imputar ou remover.Comparar pipeline em validação.
Redundância|correlação| próxima de 1 ou informação duplicadaAumenta custo e pode instabilizar coeficientes lineares.Manter uma, combinar ou regularizar.Ablation test.
Vazamento do alvocoluna criada depois da decisão ou derivada de yProduz desempenho irreal que desaparece em produção.Remover do conjunto de entradas.Linha do tempo e regra de negócio.
Ruído irrelevantepermutation importance, seleção univariada ou ablaçãoAumenta variância, tempo e risco de sobreajuste.Remover somente se a validação sustentar.Validação cruzada.
FiltroAnalisa propriedades da variável: variância, correlação, informação mútua.
WrapperTreina diferentes subconjuntos: seleção sequencial ou eliminação recursiva.
EmbutidoO próprio modelo seleciona: L1, árvores e importâncias.
AblaçãoRemove uma variável e mede a mudança em validação.

Variância

Se todos os valores são iguais, cada desvio em relação à média vale zero.

Var(x) = Σ(xᵢ − x̄)² ÷ N = 0

Permutation importance

Embaralhamos uma coluna. Se o desempenho cair muito, o modelo dependia dela.

Iⱼ = score_original − score_embaralhado

Ablação

Treinamos novamente sem a variável e comparamos usando a mesma validação.

Δ = score_completo − score_sem_xⱼ
Experimento didáticoAcurácia de validaçãoCusto relativoLeitura correta
Todas, incluindo resultado posterior100%100%Resultado suspeito: existe vazamento, não um modelo perfeito.
Sem vazamento83%87,5%Estimativa mais realista do que estará disponível em produção.
Sem constante e redundância, após ablação83%62,5%Mesma acurácia ilustrativa com uma entrada menor.
Sem uma variável realmente útil71%50%Ficou mais barato, mas perdeu sinal preditivo.

Valores ilustrativos para interpretar o método; não são resultados calculados pelo laboratório abaixo.

04 · LABORATÓRIO

Um inspetor de qualidade feito à mão.

Edite qualquer célula e clique em analisar. O JavaScript percorre a matriz sem biblioteca externa, calcula estatísticas e explica cada suspeita. “Aplicar sugestões seguras” exclui somente regras diretas; alertas dependentes do contexto continuam para decisão humana.

Alvo: aprovado
Linhas ativas
Entradas ativas
Células processadas
Economia estimada

Dataset editável

Vazio, “NA” e “?” contam como ausentes.

duplo clique não necessário

Clique em uma célula para alterar o valor. Colunas removidas ficam ocultas até restaurar.

Relatório por variável

Diagnóstico, evidência e ação sugerida.

JAVASCRIPT DIDÁTICO

A lógica central do inspetor.

O laboratório usa laços, arrays e funções pequenas. Este recorte mostra como detectar uma coluna constante e a proporção de valores ausentes.

qualidade-dados.jssem biblioteca de Machine Learning
// Conta quantas vezes um valor está ausente.
function calcularTaxaDeAusencia(coluna) {
  var ausentes = 0;

  for (var linha = 0; linha < coluna.length; linha++) {
    if (coluna[linha] === '' || coluna[linha] === 'NA' || coluna[linha] === '?') {
      ausentes = ausentes + 1;
    }
  }

  return ausentes / coluna.length;
}

// Uma coluna é constante quando todos os valores válidos são iguais.
function colunaEhConstante(coluna) {
  var primeiroValor = '';

  for (var linha = 0; linha < coluna.length; linha++) {
    if (coluna[linha] !== '') {
      if (primeiroValor === '') primeiroValor = coluna[linha];
      if (coluna[linha] !== primeiroValor) return false;
    }
  }

  return true;
}

05 · CHECKLIST DE PRODUÇÃO

O tratamento continua depois do treinamento.

AntesDefina o significado, origem, unidade, período e responsável por cada campo.
No treinoAjuste imputação, escala e seleção somente com os dados permitidos.
Na validaçãoCompare métrica, estabilidade, tempo, memória e desempenho por grupos.
Em produçãoMonitore ausências, categorias novas, mudança de distribuição e queda de desempenho.