← Todos os cursos

pesquisa / Profissional · Research

Arquiteturas e pesquisa de modelos

Pesquisa de arquitetura com MoE, attention eficiente, memória e adaptive compute, sempre com baseline justo, ablations, profiling e análise Pareto antes de qualquer claim.

5 módulos + projeto34 h de dedicação estimadaLeitura aberta

Antes de começar

Transformers, otimização, álgebra linear e desenho de experimentos.

Ao concluir, você saberá

Avaliar uma mudança de arquitetura sem confundir mais recursos com melhor mecanismo.

Uma entrega concreta

Estudo de ablação em escala pequena.

Baixar roteiro de exercícios ↓

Módulo 1 / 5

Mixture of Experts: routing, capacity e load balance

MoE aumenta parâmetros totais sem ativar todos por token. Router escolhe top-k experts; capacidade por expert e balanceamento evitam overload. Shared experts preservam competências comuns enquanto routed experts especializam.

Load balancing excessivo pode impedir especialização; balanceamento fraco causa collapse. Avalie distribuição de tokens, expert entropy, dropped tokens e qualidade por domínio.

Exemplo resolvido · cenário didático

Parâmetros totais e ativos

Um sistema hipotético tem oito experts com 100 milhões de parâmetros cada e ativa dois por token. Ele mantém 800 milhões de parâmetros de experts, mas usa 200 milhões por token nessa parte. Componentes compartilhados e comunicação são adicionais.

Teste sua compreensão

Isso demonstra que a memória necessária é só de 200 milhões de parâmetros?

Conferir o raciocínio

Não. Experts inativos ainda precisam estar disponíveis conforme a estratégia de armazenamento e distribuição.

Leitura de referência: Fedus et al. — Switch Transformers

Próximo módulo →

Módulo 2 / 5

Efficient attention, recurrent state e híbridos

MLA comprime KV em representação latente. Linear/recurrent attention mantém estado compacto e custo melhor em sequência longa, mas pode perder recuperação exata. Arquiteturas híbridas usam attention exata ocasionalmente para recuperar detalhes e camadas eficientes para maior parte do processamento.

Avalie não só perplexity: teste passkey, multi-hop, long-context recall, cache bytes/token e throughput em diferentes contextos.

Exemplo resolvido · cenário didático

O que a janela local troca

Uma sequência de n posições com janela w reduz o número de pares locais para ordem n×w, em vez de n². Isso restringe ligações diretas longas; conectividade por camadas ou tokens globais precisa ser avaliada separadamente.

Teste sua compreensão

Dobrar n com w fixo muda o termo n×w como?

Conferir o raciocínio

Ele dobra. A qualidade não está determinada por essa conta de complexidade.

Leitura de referência: Fedus et al. — Switch Transformers

Próximo módulo →

Módulo 3 / 5

Neural/episodic memory, write policies e retrieval

Memória neural comprime experiência em estado aprendido; memory layers fazem lookup parametrizado; memória episódica preserva fatos/eventos identificáveis. A combinação pode separar gist semântico de detalhes exatos.

O problema central é write policy: guardar tudo explode custo; guardar cedo demais pode descartar algo que só fica importante depois. Mecanismos de probation e promoção retroativa são uma direção testável.

Exemplo resolvido · cenário didático

Escrita também precisa de avaliação

Uma memória recupera corretamente o que foi armazenado, mas armazena uma afirmação errada. Recall perfeito não resolve a qualidade da escrita. Meça origem, atualização, conflitos e remoção, além da recuperação.

Teste sua compreensão

Qual teste revela permanência indevida de informação revogada?

Conferir o raciocínio

Grave um fato, revogue-o e verifique recuperação e geração após a revogação em todas as camadas de cache.

Leitura de referência: Fedus et al. — Switch Transformers

Próximo módulo →

Módulo 4 / 5

Adaptive compute, early exit e hardware efficiency

Nem todo token ou request merece o mesmo compute. Adaptive depth, early exit e reasoning budgets tentam alocar mais processamento apenas quando necessário. Granularidade muito fina pode destruir eficiência de batching em GPU.

Compute lanes por request ou bloco preservam batching: FAST, STANDARD, DEEP. Controller deve usar sinais de dificuldade e verificação, não apenas confiança do modelo.

Exemplo resolvido · cenário didático

Economia média não basta

Metade das tarefas usa duas etapas e metade usa seis: a média é quatro. Para economizar sem perder qualidade, o critério de parada deve identificar tarefas que podem terminar cedo. Reporte erros por faixa de dificuldade.

Teste sua compreensão

Uma média de quatro etapas garante que nenhuma tarefa ultrapasse quatro?

Conferir o raciocínio

Não. A média esconde a distribuição; monitore cauda, limite máximo e falhas por grupo.

Leitura de referência: Fedus et al. — Switch Transformers

Próximo módulo →

Módulo 5 / 5

Do mecanismo à evidência: ablation ladders e scaling

Novidade arquitetural só conta quando o mecanismo é especificado, implementado e comparado contra baseline forte sob orçamento controlado. Comece em 100M–1B para iterar; escale depois de ablations claras.

Registre FLOPs, tokens vistos, parâmetros ativos, HBM, latency e qualidade. Uma melhoria que ganha score usando o dobro de compute pode ser útil, mas precisa ser descrita como tal.

Exemplo resolvido · cenário didático

Isolar a hipótese

A versão nova usa mais dados, outro otimizador e uma camada extra. Uma melhora não identifica qual mudança ajudou. Primeiro compare baseline e camada extra com os demais fatores fixos; depois investigue interações.

Teste sua compreensão

Se a melhora é menor que a variação entre seeds, qual conclusão cabe?

Conferir o raciocínio

Evidência inconclusiva sob esse protocolo. Amplie a avaliação ou reporte a incerteza, sem anunciar superioridade.

Leitura de referência: Fedus et al. — Switch Transformers

Ir para o projeto →

Projeto aplicado

Estudo de ablação em escala pequena

  1. Escreva uma hipótese e um baseline antes de executar o experimento.
  2. Mude um componente por vez mantendo dados e orçamento comparáveis.
  3. Reporte qualidade, memória, tempo, variabilidade entre execuções e um resultado negativo.

Critérios para revisar sua entrega

  • A execução pode ser reproduzida a partir das instruções e dos arquivos entregues.
  • O baseline, as condições e as métricas permitem conferir a comparação.
  • O relatório distingue resultado medido, simulação, hipótese e limitação.

Esta rubrica orienta a autoavaliação do projeto; a conclusão e a credencial seguem a avaliação do curso.

Continue com evidências.

Os exemplos numéricos são didáticos. Compare o raciocínio com a referência e registre o que você observou no seu próprio experimento.

Fedus et al. — Switch Transformers ↗

Progresso e avaliação

A leitura e o roteiro de exercícios são abertos. Para registrar progresso e realizar a avaliação final do curso, entre na área de estudo.

Abrir minha área de estudo ↗