Módulo 1 / 5
Mixture of Experts: routing, capacity e load balance
MoE aumenta parâmetros totais sem ativar todos por token. Router escolhe top-k experts; capacidade por expert e balanceamento evitam overload. Shared experts preservam competências comuns enquanto routed experts especializam.
Load balancing excessivo pode impedir especialização; balanceamento fraco causa collapse. Avalie distribuição de tokens, expert entropy, dropped tokens e qualidade por domínio.
Exemplo resolvido · cenário didático
Parâmetros totais e ativos
Um sistema hipotético tem oito experts com 100 milhões de parâmetros cada e ativa dois por token. Ele mantém 800 milhões de parâmetros de experts, mas usa 200 milhões por token nessa parte. Componentes compartilhados e comunicação são adicionais.
Teste sua compreensão
Isso demonstra que a memória necessária é só de 200 milhões de parâmetros?
Conferir o raciocínio
Não. Experts inativos ainda precisam estar disponíveis conforme a estratégia de armazenamento e distribuição.
Leitura de referência: Fedus et al. — Switch Transformers
Próximo módulo →Módulo 2 / 5
Efficient attention, recurrent state e híbridos
MLA comprime KV em representação latente. Linear/recurrent attention mantém estado compacto e custo melhor em sequência longa, mas pode perder recuperação exata. Arquiteturas híbridas usam attention exata ocasionalmente para recuperar detalhes e camadas eficientes para maior parte do processamento.
Avalie não só perplexity: teste passkey, multi-hop, long-context recall, cache bytes/token e throughput em diferentes contextos.
Exemplo resolvido · cenário didático
O que a janela local troca
Uma sequência de n posições com janela w reduz o número de pares locais para ordem n×w, em vez de n². Isso restringe ligações diretas longas; conectividade por camadas ou tokens globais precisa ser avaliada separadamente.
Teste sua compreensão
Dobrar n com w fixo muda o termo n×w como?
Conferir o raciocínio
Ele dobra. A qualidade não está determinada por essa conta de complexidade.
Leitura de referência: Fedus et al. — Switch Transformers
Próximo módulo →Módulo 3 / 5
Neural/episodic memory, write policies e retrieval
Memória neural comprime experiência em estado aprendido; memory layers fazem lookup parametrizado; memória episódica preserva fatos/eventos identificáveis. A combinação pode separar gist semântico de detalhes exatos.
O problema central é write policy: guardar tudo explode custo; guardar cedo demais pode descartar algo que só fica importante depois. Mecanismos de probation e promoção retroativa são uma direção testável.
Exemplo resolvido · cenário didático
Escrita também precisa de avaliação
Uma memória recupera corretamente o que foi armazenado, mas armazena uma afirmação errada. Recall perfeito não resolve a qualidade da escrita. Meça origem, atualização, conflitos e remoção, além da recuperação.
Teste sua compreensão
Qual teste revela permanência indevida de informação revogada?
Conferir o raciocínio
Grave um fato, revogue-o e verifique recuperação e geração após a revogação em todas as camadas de cache.
Leitura de referência: Fedus et al. — Switch Transformers
Próximo módulo →Módulo 4 / 5
Adaptive compute, early exit e hardware efficiency
Nem todo token ou request merece o mesmo compute. Adaptive depth, early exit e reasoning budgets tentam alocar mais processamento apenas quando necessário. Granularidade muito fina pode destruir eficiência de batching em GPU.
Compute lanes por request ou bloco preservam batching: FAST, STANDARD, DEEP. Controller deve usar sinais de dificuldade e verificação, não apenas confiança do modelo.
Exemplo resolvido · cenário didático
Economia média não basta
Metade das tarefas usa duas etapas e metade usa seis: a média é quatro. Para economizar sem perder qualidade, o critério de parada deve identificar tarefas que podem terminar cedo. Reporte erros por faixa de dificuldade.
Teste sua compreensão
Uma média de quatro etapas garante que nenhuma tarefa ultrapasse quatro?
Conferir o raciocínio
Não. A média esconde a distribuição; monitore cauda, limite máximo e falhas por grupo.
Leitura de referência: Fedus et al. — Switch Transformers
Próximo módulo →Módulo 5 / 5
Do mecanismo à evidência: ablation ladders e scaling
Novidade arquitetural só conta quando o mecanismo é especificado, implementado e comparado contra baseline forte sob orçamento controlado. Comece em 100M–1B para iterar; escale depois de ablations claras.
Registre FLOPs, tokens vistos, parâmetros ativos, HBM, latency e qualidade. Uma melhoria que ganha score usando o dobro de compute pode ser útil, mas precisa ser descrita como tal.
Exemplo resolvido · cenário didático
Isolar a hipótese
A versão nova usa mais dados, outro otimizador e uma camada extra. Uma melhora não identifica qual mudança ajudou. Primeiro compare baseline e camada extra com os demais fatores fixos; depois investigue interações.
Teste sua compreensão
Se a melhora é menor que a variação entre seeds, qual conclusão cabe?
Conferir o raciocínio
Evidência inconclusiva sob esse protocolo. Amplie a avaliação ou reporte a incerteza, sem anunciar superioridade.
Leitura de referência: Fedus et al. — Switch Transformers
Ir para o projeto →Projeto aplicado
Estudo de ablação em escala pequena
- Escreva uma hipótese e um baseline antes de executar o experimento.
- Mude um componente por vez mantendo dados e orçamento comparáveis.
- Reporte qualidade, memória, tempo, variabilidade entre execuções e um resultado negativo.
Critérios para revisar sua entrega
- A execução pode ser reproduzida a partir das instruções e dos arquivos entregues.
- O baseline, as condições e as métricas permitem conferir a comparação.
- O relatório distingue resultado medido, simulação, hipótese e limitação.
Esta rubrica orienta a autoavaliação do projeto; a conclusão e a credencial seguem a avaliação do curso.
Continue com evidências.
Os exemplos numéricos são didáticos. Compare o raciocínio com a referência e registre o que você observou no seu próprio experimento.
Fedus et al. — Switch Transformers ↗Progresso e avaliação
A leitura e o roteiro de exercícios são abertos. Para registrar progresso e realizar a avaliação final do curso, entre na área de estudo.
Abrir minha área de estudo ↗