# Transformers e modelos de linguagem

Giorgio Learn · Roteiro de exercícios

## Pré-requisitos
Álgebra linear, softmax, redes neurais e noções de treinamento.

## 1. Tokenização, eficiência multilingual e representação

Se instruções e histórico consomem 1.200 tokens, quanto resta para documentos?

Minha resposta:

Prática: Meça conceitualmente como um tokenizer enviesado pode reduzir contexto útil para um idioma sem mudar o limite nominal.

Evidências e limitações:

## 2. Attention, KV state e arquiteturas de contexto

Se só o primeiro valor é permitido, qual é a saída?

Minha resposta:

Prática: Estime qualitativamente o que acontece com KV cache ao dobrar contexto mantendo o resto fixo.

Evidências e limitações:

## 3. Pré-treino, data mixtures e scaling sob compute fixo

Dobrar parâmetros mantendo tokens fixa necessariamente mantém compute?

Minha resposta:

Prática: Defina três métricas para auditar uma mistura de pré-treino além do número total de tokens.

Evidências e limitações:

## 4. SFT, preference optimization e pós-treino mensurável

Treinar em respostas preferidas demonstra sozinho alinhamento em produção?

Minha resposta:

Prática: Compare quando você escolheria SFT, DPO e RL baseado em disponibilidade de dados e verificadores.

Evidências e limitações:

## 5. Long context, posição, retrieval e memória

Qual comparação separa posição de comprimento?

Minha resposta:

Prática: Crie um teste de long-context que exija combinar três fatos separados, evitando um simples lookup.

Evidências e limitações:

## Projeto: Experimento de contexto e recuperação de informação

- [ ] Crie documentos sintéticos com uma informação verificável no início, meio e fim.
- [ ] Compare três comprimentos e registre o tokenizador e a contagem de tokens.
- [ ] Entregue acerto por posição, latência e exemplos de falha, sem concluir capacidade geral a partir de um caso.

## Referência
https://arxiv.org/abs/1706.03762
