Módulo 1 / 5
Tokenização, eficiência multilingual e representação
Tokenizadores BPE/Unigram comprimem texto em unidades reutilizáveis. Vocabulário maior reduz comprimento médio, mas aumenta matriz de embeddings e pode piorar cobertura rara. Byte fallback evita tokens desconhecidos e é importante em código, nomes e idiomas menos representados.
A tokenização muda custo de contexto e fairness. Compare tokens por caractere entre idiomas e domínios; um modelo que usa o dobro de tokens para a mesma informação paga mais compute e perde janela efetiva.
Exemplo resolvido · cenário didático
Orçamento em tokens
Duas versões de uma mensagem podem ter o mesmo número de caracteres e contagens de tokens diferentes. Se a janela tem 4.096 tokens e você reserva 1.024 para a saída, restam no máximo 3.072 para instruções, histórico e documentos.
Teste sua compreensão
Se instruções e histórico consomem 1.200 tokens, quanto resta para documentos?
Conferir o raciocínio
1.872 tokens. Considere também a sobrecarga real do formato da API ao medir o pedido final.
Leitura de referência: Vaswani et al. — Attention Is All You Need
Próximo módulo →Módulo 2 / 5
Attention, KV state e arquiteturas de contexto
Queries consultam keys e combinam values. O produto QKᵀ cria scores; softmax normaliza; causal mask impede olhar o futuro. Multi-head attention permite subespaços diferentes, mas KV cache cresce com sequência, camadas e número de heads KV.
GQA/MQA reduzem KV heads. MLA comprime estados latentes de key/value. Attention local ou linear reduz custo, mas pode sacrificar acesso exato de longo alcance. Não existe uma única variante melhor para todos os regimes.
Exemplo resolvido · cenário didático
Atenção como média ponderada
Com scores [0,0], softmax produz [0,5;0,5]. Se os valores são 2 e 6, a saída escalar é 4. Uma máscara causal remove posições futuras antes da normalização para impedir o acesso ao futuro.
Teste sua compreensão
Se só o primeiro valor é permitido, qual é a saída?
Conferir o raciocínio
2. O peso da posição mascarada é zero após normalização sobre as posições permitidas.
Leitura de referência: Vaswani et al. — Attention Is All You Need
Próximo módulo →Módulo 3 / 5
Pré-treino, data mixtures e scaling sob compute fixo
Next-token prediction cria um sinal de treino denso e geral. Qualidade depende de mistura de dados, deduplicação, filtering, tokenizer, optimizer e schedule. Parâmetros sozinhos não definem capacidade; compute e dados vistos importam igualmente.
Scaling laws orientam alocação de compute, mas recipes reais precisam considerar limite de memória, largura de banda e tempo de wall-clock. Dados de baixa qualidade podem dominar o erro quando o modelo cresce.
Exemplo resolvido · cenário didático
Comparação com orçamento fixo
A configuração A vê 100 milhões de tokens; B vê 200 milhões. Uma melhora de B não isola o efeito da arquitetura. Controle tokens ou compute, descreva a mistura de dados e preserve uma avaliação separada.
Teste sua compreensão
Dobrar parâmetros mantendo tokens fixa necessariamente mantém compute?
Conferir o raciocínio
Não. O custo depende da arquitetura, das dimensões e das operações executadas.
Leitura de referência: Vaswani et al. — Attention Is All You Need
Próximo módulo →Módulo 4 / 5
SFT, preference optimization e pós-treino mensurável
Supervised fine-tuning ensina formato e comportamento a partir de demonstrações. Preference optimization usa pares ou sinais de preferência para aumentar probabilidade de respostas desejadas. DPO é uma formulação direta; RL pode otimizar recompensas mais complexas, mas aumenta instabilidade e risco de reward hacking.
Pós-treino não cria conhecimento mágico. Ele reorganiza comportamento e pode melhorar raciocínio quando treino inclui tarefas e verificadores adequados, mas também pode degradar competências se a mistura for estreita.
Exemplo resolvido · cenário didático
Aprender o formato sem memorizar o teste
Um conjunto SFT contém exemplos de instrução e resposta. Separe famílias de tarefas antes de avaliar; paráfrases do mesmo problema em treino e teste podem superestimar transferência. Compare também tarefas fora do alvo para detectar regressões.
Teste sua compreensão
Treinar em respostas preferidas demonstra sozinho alinhamento em produção?
Conferir o raciocínio
Não. É necessário avaliar utilidade, erros, recusas e comportamento fora da distribuição usada no ajuste.
Leitura de referência: Vaswani et al. — Attention Is All You Need
Próximo módulo →Módulo 5 / 5
Long context, posição, retrieval e memória
RoPE codifica posição por rotação em subespaços; extrapolação requer cuidado. Janelas longas elevam KV cache e podem sofrer lost-in-the-middle. Retrieval e memória externa são complementares ao contexto bruto, não simples substitutos.
Avalie long context com passkey, needle, multi-hop e tarefas que exigem integração real. Um modelo pode passar needle simples e falhar ao combinar fatos distantes.
Exemplo resolvido · cenário didático
Capacidade nominal e uso efetivo
Aceitar 32 mil tokens não demonstra recuperar um fato em qualquer posição. Mantenha pergunta e resposta fixas, mova a evidência pelo documento e acrescente distrações de forma controlada. Compare com recuperação que fornece apenas os trechos relevantes.
Teste sua compreensão
Qual comparação separa posição de comprimento?
Conferir o raciocínio
Fixe o comprimento total e varie só a posição da evidência. Em outro experimento, varie o comprimento.
Leitura de referência: Vaswani et al. — Attention Is All You Need
Ir para o projeto →Projeto aplicado
Experimento de contexto e recuperação de informação
- Crie documentos sintéticos com uma informação verificável no início, meio e fim.
- Compare três comprimentos e registre o tokenizador e a contagem de tokens.
- Entregue acerto por posição, latência e exemplos de falha, sem concluir capacidade geral a partir de um caso.
Critérios para revisar sua entrega
- A execução pode ser reproduzida a partir das instruções e dos arquivos entregues.
- O baseline, as condições e as métricas permitem conferir a comparação.
- O relatório distingue resultado medido, simulação, hipótese e limitação.
Esta rubrica orienta a autoavaliação do projeto; a conclusão e a credencial seguem a avaliação do curso.
Continue com evidências.
Os exemplos numéricos são didáticos. Compare o raciocínio com a referência e registre o que você observou no seu próprio experimento.
Vaswani et al. — Attention Is All You Need ↗Progresso e avaliação
A leitura e o roteiro de exercícios são abertos. Para registrar progresso e realizar a avaliação final do curso, entre na área de estudo.
Abrir minha área de estudo ↗