# Inferência e desempenho de GPU

Giorgio Learn · Roteiro de exercícios

## Pré-requisitos
Memória de GPU, matrizes, latência e fundamentos de Transformers.

## 1. Roofline mental: compute, bandwidth, prefill e decode

Reduzir só TTFT a 100 ms muda o tempo total para quanto?

Minha resposta:

Prática: Dado um serviço com TTFT bom e ITL ruim, liste três gargalos plausíveis específicos de decode.

Evidências e limitações:

## 2. KV cache, paging, prefix reuse e eviction

Qual o valor para batch 4 nas mesmas condições?

Minha resposta:

Prática: Faça um orçamento de memória qualitativo para pesos + KV + workspace e explique por que deixar margem é necessário.

Evidências e limitações:

## 3. Quantização, FP8 e regressão de qualidade

Por que um modelo de 4 bits pode não ser mais rápido?

Minha resposta:

Prática: Projete uma ablation que compare pesos 4-bit com KV BF16 versus pesos 4-bit com KV FP8.

Evidências e limitações:

## 4. Continuous batching, scheduling e fairness

Qual métrica revela que pedidos curtos ficam presos atrás de longos?

Minha resposta:

Prática: Desenhe uma política de scheduler que preserve chat interativo enquanto aceita jobs longos em background.

Evidências e limitações:

## 5. TP/PP/EP, comunicação e speculative decoding

Com a parte paralela quatro vezes mais rápida, qual é o ganho?

Minha resposta:

Prática: Compare TP e EP para um MoE e diga qual comunicação acontece por token em cada caso.

Evidências e limitações:

## Projeto: Relatório de capacidade com carga controlada

- [ ] Registre hardware, precisão, modelo e distribuição dos tamanhos de entrada e saída.
- [ ] Compare ao menos duas concorrências com cache frio e quente separados.
- [ ] Reporte TTFT, tempo entre tokens, p95, throughput e falhas; admita resultados simulados quando não houver GPU.

## Referência
https://arxiv.org/abs/2309.06180
