# Arquiteturas e pesquisa de modelos

Giorgio Learn · Roteiro de exercícios

## Pré-requisitos
Transformers, otimização, álgebra linear e desenho de experimentos.

## 1. Mixture of Experts: routing, capacity e load balance

Isso demonstra que a memória necessária é só de 200 milhões de parâmetros?

Minha resposta:

Prática: Desenhe uma métrica que detecte quando dois experts recebem 80% dos tokens mesmo com perplexity aparentemente boa.

Evidências e limitações:

## 2. Efficient attention, recurrent state e híbridos

Dobrar n com w fixo muda o termo n×w como?

Minha resposta:

Prática: Proponha um bloco híbrido que use três camadas eficientes para cada camada de attention exata e diga como ablar.

Evidências e limitações:

## 3. Neural/episodic memory, write policies e retrieval

Qual teste revela permanência indevida de informação revogada?

Minha resposta:

Prática: Crie um benchmark sintético onde a importância de um fato só é revelada milhares de tokens depois.

Evidências e limitações:

## 4. Adaptive compute, early exit e hardware efficiency

Uma média de quatro etapas garante que nenhuma tarefa ultrapasse quatro?

Minha resposta:

Prática: Desenhe um controller de três lanes e uma política para promover uma request de STANDARD para DEEP.

Evidências e limitações:

## 5. Do mecanismo à evidência: ablation ladders e scaling

Se a melhora é menor que a variação entre seeds, qual conclusão cabe?

Minha resposta:

Prática: Escreva um protocolo de experimento baseline → +memória → +MoE → +adaptive compute com critério explícito de sucesso.

Evidências e limitações:

## Projeto: Estudo de ablação em escala pequena

- [ ] Escreva uma hipótese e um baseline antes de executar o experimento.
- [ ] Mude um componente por vez mantendo dados e orçamento comparáveis.
- [ ] Reporte qualidade, memória, tempo, variabilidade entre execuções e um resultado negativo.

## Referência
https://arxiv.org/abs/2101.03961
