# Avaliação e segurança de IA

Giorgio Learn · Roteiro de exercícios

## Pré-requisitos
Probabilidade básica, construção de datasets e leitura de matrizes de confusão.

## 1. Construct validity, datasets e desenho de evals

Uma média de estilo e acerto pode esconder erros de data?

Minha resposta:

Prática: Especifique uma eval de instruction following com rubrica e um conjunto holdout que não possa entrar no desenvolvimento.

Evidências e limitações:

## 2. LLM-as-judge, verificadores e calibração humana

Consistência após a troca de ordem prova correção?

Minha resposta:

Prática: Projete um experimento A/B onde a ordem das respostas é randomizada para medir position bias do judge.

Evidências e limitações:

## 3. Benchmarks, incerteza, contaminação e error analysis

Por que guardar resultados por item?

Minha resposta:

Prática: Explique por que uma diferença de 0,4 ponto pode não ser evidência suficiente sem tamanho de amostra e variância.

Evidências e limitações:

## 4. Red teaming, prompt injection e tool safety

Filtrar só a frase “ignore o usuário” resolve o problema?

Minha resposta:

Prática: Crie três ataques contra um agente conectado a e-mail e três controles técnicos correspondentes.

Evidências e limitações:

## 5. Alignment, false refusal e trade-offs de utilidade

Qual taxa muda se reduzir bloqueios em casos permitidos?

Minha resposta:

Prática: Desenhe um painel de três métricas que impeça otimizar safety simplesmente recusando tudo.

Evidências e limitações:

## Projeto: Conjunto de avaliação com rubrica auditável

- [ ] Escreva 30 casos sintéticos: sucesso, limite e falha; preserve um subconjunto fora do ajuste.
- [ ] Defina rubrica antes de avaliar e registre discordâncias entre duas revisões.
- [ ] Apresente desempenho por fatia, falsos bloqueios e exemplos de erro do próprio avaliador.

## Referência
https://arxiv.org/abs/2306.05685
