Thesis 2.1: compute adaptativo virou parte da resposta
A versão 2.1 separa tarefas simples de problemas que realmente exigem prova, auditoria e verificação, sem transformar cada prompt em um ritual de múltiplos agentes.
O problema não era falta de tokens
Em testes difíceis, o gargalo aparecia antes da matemática: o roteador podia classificar uma prova extensa como tarefa de instrução ou aplicar esforço baixo justamente quando o prompt pedia auditoria recursiva. Thesis 2.1 muda a unidade de decisão. O sistema estima família, dificuldade, risco de erro e contrato de saída antes de escolher o nível de compute. A meta não é usar mais raciocínio sempre; é impedir que uma tarefa de alto risco receba o mesmo orçamento de uma resposta cotidiana.
Uma política de dificuldade, não um botão decorativo
Low continua existindo para respostas determinadas por contexto curto. Medium entra quando há várias restrições ou encadeamento lógico. High passa a ser obrigatório em provas, operator theory, matemática avançada, problemas abertos e solicitações explícitas de xhigh ou ultra. O usuário ainda pode pedir um esforço, mas o runtime não reduz uma tarefa classificada como difícil só porque uma heurística textual escolheu a rota errada.
Preflight barato antes do solver caro
Em instâncias difíceis, o Melos 2 pode atuar primeiro como crítico rápido. Ele não resolve a questão; extrai obrigações de formato, invariantes, pontos de circularidade e falhas que merecem inspeção. Esse mapa é entregue ao GPT-OSS 120B, que continua sendo o solver principal. A separação reduz um tipo comum de desperdício: usar o modelo maior para descobrir, tarde demais, que deixou passar uma condição explícita do prompt.
Verificação só quando compra informação
O 2.1 não transforma toda resposta em dois passes de 120B. Checks determinísticos vêm primeiro. Quando a tarefa é arriscada e ainda existe incerteza material, um segundo modelo pode auditar a conclusão. O ganho desejado é reduzir erros independentes e violações de contrato, não produzir uma resposta diferente por vaidade. Se o verificador não encontra defeito concreto, a resposta primária permanece.
O que 2.1 não promete
Mais compute não transforma um foundation model em oráculo. Thesis 2.1 não promete prova de problemas abertos, zero erro ou superioridade universal. A mudança é operacional: problemas difíceis recebem mais capacidade, saídas passam por contratos verificáveis e afirmações extraordinárias enfrentam guards explícitos. A versão deve ser julgada por regressões e benchmarks, não pelo número 2.1.