Thesis 2.1: 120B resolve, 20B audita
A verificação cruzada usa modelos com perfis diferentes e orçamentos separados para procurar defeitos, sem duplicar o custo do solver principal em toda mensagem.
Independência útil, não consenso teatral
Pedir ao mesmo modelo para “revisar a própria resposta” pode detectar erros, mas também reproduz os mesmos atalhos. No 2.1, GPT-OSS 120B continua responsável pela solução e GPT-OSS 20B pode atuar como auditor independente. O verificador recebe a tarefa e a resposta como material não confiável, tenta resolver o passo decisivo por conta própria e procura contraexemplos, hipóteses escondidas e violações de contrato.
Quotas por modelo viram recurso de arquitetura
O governor acompanha orçamento por modelo. Isso permite gastar compute do 20B para verificação sem fingir que cada token do auditor pertence ao teto do 120B. A consequência prática é simples: o sistema pode obter uma segunda perspectiva quando ela vale a pena sem reduzir desnecessariamente a resposta principal.
O auditor não ganha direito de reescrever tudo
Um verificador probabilístico também erra. Por isso a arquitetura não aceita qualquer discordância como correção. O council distingue defeito menor de defeito material e exige confiança alta antes de substituir a conclusão. Se não houver falha concreta, mantém-se o resultado do solver. Essa assimetria evita que a verificação introduza regressões por preferência estilística.
Determinístico antes do LLM
Contagem exata de palavras, JSON válido, presença de fases, marcadores de loop e testes de código não precisam de julgamento semântico. Esses checks vêm antes. O auditor é reservado para propriedades que exigem interpretação: uma implicação circular, uma hipótese esquecida, um argumento espectral mal definido ou uma conclusão mais forte que as premissas.
Verificação é evidência, não certificado de verdade
Quando dois modelos concordam, a confiança operacional pode aumentar, mas a resposta não se torna matematicamente provada por votação. Thesis 2.1 registra verificação como uma classe de evidência e continua distinguindo resultado derivado, teste executado, fonte recuperada e julgamento de modelo. Essa separação é parte do produto porque evita que telemetria pareça mais forte do que realmente é.