← Todos os cursos

fundamentos / Profissional · Avançado

Transformers e modelos de linguagem

Tokenização, attention, pré-treino, pós-treino e long context tratados como decisões de arquitetura, dados, otimização e serving, não como vocabulário de paper.

5 módulos + projeto32 h de dedicação estimadaLeitura aberta

Antes de começar

Álgebra linear, softmax, redes neurais e noções de treinamento.

Ao concluir, você saberá

Raciocinar sobre tokens, atenção e custo de contexto, e comparar adaptações com orçamento controlado.

Uma entrega concreta

Experimento de contexto e recuperação de informação.

Baixar roteiro de exercícios ↓

Módulo 1 / 5

Tokenização, eficiência multilingual e representação

Tokenizadores BPE/Unigram comprimem texto em unidades reutilizáveis. Vocabulário maior reduz comprimento médio, mas aumenta matriz de embeddings e pode piorar cobertura rara. Byte fallback evita tokens desconhecidos e é importante em código, nomes e idiomas menos representados.

A tokenização muda custo de contexto e fairness. Compare tokens por caractere entre idiomas e domínios; um modelo que usa o dobro de tokens para a mesma informação paga mais compute e perde janela efetiva.

Exemplo resolvido · cenário didático

Orçamento em tokens

Duas versões de uma mensagem podem ter o mesmo número de caracteres e contagens de tokens diferentes. Se a janela tem 4.096 tokens e você reserva 1.024 para a saída, restam no máximo 3.072 para instruções, histórico e documentos.

Teste sua compreensão

Se instruções e histórico consomem 1.200 tokens, quanto resta para documentos?

Conferir o raciocínio

1.872 tokens. Considere também a sobrecarga real do formato da API ao medir o pedido final.

Leitura de referência: Vaswani et al. — Attention Is All You Need

Próximo módulo →

Módulo 2 / 5

Attention, KV state e arquiteturas de contexto

Queries consultam keys e combinam values. O produto QKᵀ cria scores; softmax normaliza; causal mask impede olhar o futuro. Multi-head attention permite subespaços diferentes, mas KV cache cresce com sequência, camadas e número de heads KV.

GQA/MQA reduzem KV heads. MLA comprime estados latentes de key/value. Attention local ou linear reduz custo, mas pode sacrificar acesso exato de longo alcance. Não existe uma única variante melhor para todos os regimes.

Exemplo resolvido · cenário didático

Atenção como média ponderada

Com scores [0,0], softmax produz [0,5;0,5]. Se os valores são 2 e 6, a saída escalar é 4. Uma máscara causal remove posições futuras antes da normalização para impedir o acesso ao futuro.

Teste sua compreensão

Se só o primeiro valor é permitido, qual é a saída?

Conferir o raciocínio

2. O peso da posição mascarada é zero após normalização sobre as posições permitidas.

Leitura de referência: Vaswani et al. — Attention Is All You Need

Próximo módulo →

Módulo 3 / 5

Pré-treino, data mixtures e scaling sob compute fixo

Next-token prediction cria um sinal de treino denso e geral. Qualidade depende de mistura de dados, deduplicação, filtering, tokenizer, optimizer e schedule. Parâmetros sozinhos não definem capacidade; compute e dados vistos importam igualmente.

Scaling laws orientam alocação de compute, mas recipes reais precisam considerar limite de memória, largura de banda e tempo de wall-clock. Dados de baixa qualidade podem dominar o erro quando o modelo cresce.

Exemplo resolvido · cenário didático

Comparação com orçamento fixo

A configuração A vê 100 milhões de tokens; B vê 200 milhões. Uma melhora de B não isola o efeito da arquitetura. Controle tokens ou compute, descreva a mistura de dados e preserve uma avaliação separada.

Teste sua compreensão

Dobrar parâmetros mantendo tokens fixa necessariamente mantém compute?

Conferir o raciocínio

Não. O custo depende da arquitetura, das dimensões e das operações executadas.

Leitura de referência: Vaswani et al. — Attention Is All You Need

Próximo módulo →

Módulo 4 / 5

SFT, preference optimization e pós-treino mensurável

Supervised fine-tuning ensina formato e comportamento a partir de demonstrações. Preference optimization usa pares ou sinais de preferência para aumentar probabilidade de respostas desejadas. DPO é uma formulação direta; RL pode otimizar recompensas mais complexas, mas aumenta instabilidade e risco de reward hacking.

Pós-treino não cria conhecimento mágico. Ele reorganiza comportamento e pode melhorar raciocínio quando treino inclui tarefas e verificadores adequados, mas também pode degradar competências se a mistura for estreita.

Exemplo resolvido · cenário didático

Aprender o formato sem memorizar o teste

Um conjunto SFT contém exemplos de instrução e resposta. Separe famílias de tarefas antes de avaliar; paráfrases do mesmo problema em treino e teste podem superestimar transferência. Compare também tarefas fora do alvo para detectar regressões.

Teste sua compreensão

Treinar em respostas preferidas demonstra sozinho alinhamento em produção?

Conferir o raciocínio

Não. É necessário avaliar utilidade, erros, recusas e comportamento fora da distribuição usada no ajuste.

Leitura de referência: Vaswani et al. — Attention Is All You Need

Próximo módulo →

Módulo 5 / 5

Long context, posição, retrieval e memória

RoPE codifica posição por rotação em subespaços; extrapolação requer cuidado. Janelas longas elevam KV cache e podem sofrer lost-in-the-middle. Retrieval e memória externa são complementares ao contexto bruto, não simples substitutos.

Avalie long context com passkey, needle, multi-hop e tarefas que exigem integração real. Um modelo pode passar needle simples e falhar ao combinar fatos distantes.

Exemplo resolvido · cenário didático

Capacidade nominal e uso efetivo

Aceitar 32 mil tokens não demonstra recuperar um fato em qualquer posição. Mantenha pergunta e resposta fixas, mova a evidência pelo documento e acrescente distrações de forma controlada. Compare com recuperação que fornece apenas os trechos relevantes.

Teste sua compreensão

Qual comparação separa posição de comprimento?

Conferir o raciocínio

Fixe o comprimento total e varie só a posição da evidência. Em outro experimento, varie o comprimento.

Leitura de referência: Vaswani et al. — Attention Is All You Need

Ir para o projeto →

Projeto aplicado

Experimento de contexto e recuperação de informação

  1. Crie documentos sintéticos com uma informação verificável no início, meio e fim.
  2. Compare três comprimentos e registre o tokenizador e a contagem de tokens.
  3. Entregue acerto por posição, latência e exemplos de falha, sem concluir capacidade geral a partir de um caso.

Critérios para revisar sua entrega

  • A execução pode ser reproduzida a partir das instruções e dos arquivos entregues.
  • O baseline, as condições e as métricas permitem conferir a comparação.
  • O relatório distingue resultado medido, simulação, hipótese e limitação.

Esta rubrica orienta a autoavaliação do projeto; a conclusão e a credencial seguem a avaliação do curso.

Continue com evidências.

Os exemplos numéricos são didáticos. Compare o raciocínio com a referência e registre o que você observou no seu próprio experimento.

Vaswani et al. — Attention Is All You Need ↗

Progresso e avaliação

A leitura e o roteiro de exercícios são abertos. Para registrar progresso e realizar a avaliação final do curso, entre na área de estudo.

Abrir minha área de estudo ↗