# Plataformas de IA em produção

Giorgio Learn · Roteiro de exercícios

## Pré-requisitos
HTTP, filas, logs estruturados e operação básica de serviços.

## 1. API contracts, model registry e compatibility

É seguro remover um campo porque uma interface visível não o usa?

Minha resposta:

Prática: Defina um registry com cinco campos mínimos que permita trocar runtime sem quebrar cliente.

Evidências e limitações:

## 2. Prefix/semantic caching, invalidation e tenant isolation

Um cache semanticamente parecido pode ignorar diferenças de permissão?

Minha resposta:

Prática: Crie uma chave de cache segura para uma resposta que depende de modelo, versão e usuário.

Evidências e limitações:

## 3. Telemetria, tracing e token accounting

Se as mesmas 2 unidades produzem 50 conclusões?

Minha resposta:

Prática: Desenhe um evento de telemetry que seja útil para debugging sem guardar o prompt completo.

Evidências e limitações:

## 4. Backpressure, filas, retries e degraded modes

Três camadas independentes com três tentativas cada podem gerar quantas chamadas na pior combinação?

Minha resposta:

Prática: Projete um fluxo para request que excede o budget do minuto mas pode esperar 20 segundos.

Evidências e limitações:

## 5. SLOs, custo por tarefa e release engineering

E para 99,5% na mesma janela?

Minha resposta:

Prática: Monte um release gate com três métricas de qualidade e duas operacionais para um modelo de produção.

Evidências e limitações:

## Projeto: API simulada com falhas controladas

- [ ] Implemente contrato versionado, IDs de requisição e resposta estruturada de erro.
- [ ] Simule lentidão, 429 e timeout; limite fila, tentativas e prazo total.
- [ ] Documente SLO, custo por tarefa concluída e gatilhos de rollback.

## Referência
https://sre.google/sre-book/handling-overload/
