← Todos os cursos

fundamentos / Profissional · Avançado

Fundamentos de Machine Learning

Formulação estatística, desenho de dados, generalização, calibração, avaliação por decisão e operação de pipelines de ML sob restrições reais de produção.

5 módulos + projeto24 h de dedicação estimadaLeitura aberta

Antes de começar

Python básico, médias, probabilidade condicional e leitura de tabelas.

Ao concluir, você saberá

Construir um baseline sem vazamento de dados e justificar um limiar de decisão pelo custo dos erros.

Uma entrega concreta

Pipeline de classificação com validação temporal.

Baixar roteiro de exercícios ↓

Módulo 1 / 5

Formulação estatística, leakage e desenho de distribuição

Um sistema de IA começa antes do modelo. Defina a variável-alvo, a unidade de decisão, o custo dos erros e a distribuição em que o sistema será usado. A mesma métrica pode parecer excelente em um conjunto de teste e falhar em produção se o conjunto não representar a operação real.

Separe correlação de utilidade causal. Em classificação, escolha limiar conforme custo de falso positivo e falso negativo. Em regressão, confirme se erro absoluto, quadrático ou relativo representa a decisão de negócio.

Exemplo resolvido · cenário didático

A informação existia no momento da decisão?

Uma compra ocorre às 10h e a contestação chega dois dias depois. Usar “contestação confirmada” como entrada para prever fraude às 10h revela o futuro. Use apenas dados com timestamp anterior à decisão e reserve um período posterior para teste.

Teste sua compreensão

Uma variável chega cinco minutos após a compra. Ela pode entrar em um detector que decide em um segundo?

Conferir o raciocínio

Não. Ela pode servir a uma análise posterior, mas está indisponível na decisão instantânea.

Leitura de referência: scikit-learn — erros comuns e vazamento de dados

Próximo módulo →

Módulo 2 / 5

Likelihood, otimização, regularização e generalização

Probabilidade fornece a linguagem para incerteza; otimização fornece o mecanismo de ajuste. A loss é uma função operacional, não uma medida universal de inteligência. Gradiente descendente move parâmetros na direção que reduz a loss localmente, enquanto regularização limita soluções que memorizam o treino.

Bias e variance aparecem quando o modelo é simples demais ou sensível demais aos dados. Generalização deve ser medida em dados não usados na seleção do modelo; usar o conjunto de teste repetidamente transforma-o, na prática, em parte do treino.

Exemplo resolvido · cenário didático

Uma atualização de gradiente

Para L(w)=(w−3)², o gradiente é 2(w−3). Com w=0 e taxa 0,1: w novo=0−0,1×(−6)=0,6. A perda cai de 9 para 5,76. Isso ilustra uma atualização, não uma garantia para qualquer taxa.

Teste sua compreensão

Repita com taxa 0,2.

Conferir o raciocínio

w novo=1,2 e a perda é 3,24. Neste passo melhora mais; taxas maiores não são sempre melhores.

Leitura de referência: scikit-learn — erros comuns e vazamento de dados

Próximo módulo →

Módulo 3 / 5

Inductive bias, ensembles e seleção sob restrições

Regressão linear, árvores, ensembles, k-NN e redes neurais impõem diferentes hipóteses sobre a estrutura do problema. Árvores lidam bem com interações e dados tabulares; modelos lineares são fáceis de auditar; redes neurais brilham quando representação precisa ser aprendida de dados de alta dimensão.

O melhor modelo não é o maior. Compare qualidade, latência, memória, interpretabilidade, volume de dados e custo de manutenção. Um baseline competitivo frequentemente revela que o gargalo está nos dados, não na arquitetura.

Exemplo resolvido · cenário didático

Escolher sob uma restrição de latência

Em um cenário hipotético, A tem recall 0,81 e latência p95 de 8 ms; B tem recall 0,84 e p95 de 70 ms. Com limite obrigatório de 20 ms, B é inviável. Compare candidatos dentro da restrição e registre o custo de falsos positivos.

Teste sua compreensão

C tem recall 0,82 e p95 de 15 ms. C domina A?

Conferir o raciocínio

Não: C melhora recall, mas piora latência. A escolha depende dos objetivos restantes.

Leitura de referência: scikit-learn — erros comuns e vazamento de dados

Próximo módulo →

Módulo 4 / 5

Sistemas de treinamento, lineage e reproducibilidade

Um pipeline reproduzível versiona dados, transformação, split, hiperparâmetros, seed e artefatos. Pré-processamento deve ser ajustado apenas no treino e aplicado depois à validação/teste, evitando vazamento estatístico.

Em produção, monitore drift de entrada, mudança de prevalência, qualidade por subgrupo e atraso entre predição e rótulo real. Sem observabilidade, um modelo pode degradar silenciosamente por semanas.

Exemplo resolvido · cenário didático

Normalização sem contaminação

O treino contém [0,2], com média 1. O teste contém [100]. Centralize o teste pela média do treino: 100−1=99. Recalcular a média usando o teste muda a transformação a partir de informação reservada à avaliação.

Teste sua compreensão

Onde ajustar o normalizador durante validação cruzada?

Conferir o raciocínio

Dentro de cada fold de treino. O fold de validação recebe apenas transform, nunca fit.

Leitura de referência: scikit-learn — erros comuns e vazamento de dados

Próximo módulo →

Módulo 5 / 5

Avaliação decision-aware, calibração e uncertainty

Accuracy sozinha é insuficiente em classes desbalanceadas. Precision e recall mudam com o limiar; AUROC mede ordenação global, enquanto AUPRC é mais informativa quando positivos são raros. Calibração pergunta se probabilidades previstas correspondem à frequência observada.

Faça análise de erros por fatias: geografia, dispositivo, faixa de valor, tempo e fontes de dados. Um número agregado pode esconder falhas graves em segmentos pequenos mas importantes.

Exemplo resolvido · cenário didático

Métrica ligada ao custo

Com TP=8, FP=2 e FN=4, precisão=8/10=0,80 e recall=8/12≈0,67. Se FP custa 1 unidade e FN custa 10, o custo total é 2×1+4×10=42. Esse custo ajuda a comparar limiares na validação.

Teste sua compreensão

Outro limiar produz FP=6 e FN=1. Qual custa menos?

Conferir o raciocínio

O segundo: 6+10=16. Confirme a escolha no teste reservado e registre possíveis mudanças de prevalência.

Leitura de referência: scikit-learn — erros comuns e vazamento de dados

Ir para o projeto →

Projeto aplicado

Pipeline de classificação com validação temporal

  1. Separe dados sintéticos em treino, validação e teste por tempo; registre as datas de corte.
  2. Compare uma regra simples e um modelo; ajuste transformações apenas no treino.
  3. Entregue matriz de confusão, custo por decisão e análise de dois subgrupos no teste reservado.

Critérios para revisar sua entrega

  • A execução pode ser reproduzida a partir das instruções e dos arquivos entregues.
  • O baseline, as condições e as métricas permitem conferir a comparação.
  • O relatório distingue resultado medido, simulação, hipótese e limitação.

Esta rubrica orienta a autoavaliação do projeto; a conclusão e a credencial seguem a avaliação do curso.

Continue com evidências.

Os exemplos numéricos são didáticos. Compare o raciocínio com a referência e registre o que você observou no seu próprio experimento.

scikit-learn — erros comuns e vazamento de dados ↗

Progresso e avaliação

A leitura e o roteiro de exercícios são abertos. Para registrar progresso e realizar a avaliação final do curso, entre na área de estudo.

Abrir minha área de estudo ↗