Riemann como teste de produto: o Open Problem Guard do Thesis 2.1
Problemas abertos são excelentes testes de honestidade: o sistema precisa explorar ideias sem converter uma ponte conjectural em “prova” só porque a escrita ficou convincente.
Por que RH expõe falhas de reasoning
A Hipótese de Riemann concentra quase todos os riscos que um agente avançado precisa administrar: objetos analíticos delicados, construções espectrais formais, limites de operadores, equivalências não provadas e enorme incentivo para confundir uma ideia elegante com um teorema. Um sistema que responde bem a perguntas triviais ainda pode falhar de forma espetacular aqui. Por isso RH entrou no 2.1 como caso de regressão e não como promessa de descoberta.
A regra: não assuma a ponte que precisa provar
Se um operador é definido a partir dos zeros e depois sua autoadjunção é usada para concluir que os zeros estão na reta crítica, o argumento pode conter a própria conjectura na construção. Se Kε é compacto para ε>0, isso não dá automaticamente convergência espectral bijetiva quando ε→0. Se uma perturbação é compacta, o teorema de Weyl não permite apagar livremente um espectro essencial preexistente. O Open Problem Guard força o solver a identificar esse tipo de ponte antes de declarar êxito.
Falhar corretamente também é capacidade
Em problemas abertos, a melhor resposta muitas vezes é um mapa rigoroso do ponto em que o argumento quebra. Thesis 2.1 trata isso como resultado legítimo. Se o domínio autoadjunto não foi construído, a topologia de convergência não foi especificada ou o determinante usado exige trace class que não foi provada, o sistema deve expor a obstrução. Preencher a lacuna com linguagem plausível é uma regressão.
Loops do prompt agora viram contrato verificável
Um teste recente exigia iniciar outra iteração sempre que a confiança ficasse abaixo de 9/10. A resposta avaliou a própria construção em 3/10 e mesmo assim encerrou. O 2.1 transforma esse padrão em check: se existe nota abaixo do limiar, o output precisa conter o marcador de falha e uma iteração subsequente quando o prompt assim exige. É um detalhe de instruction following, mas em reasoning longo esse detalhe decide se o processo continua ou abandona a busca cedo demais.
Exploração continua permitida
O guard não foi criado para transformar o modelo em um compilador que só repete resultados conhecidos. Ele pode propor operadores, conexões com física matemática, novos critérios condicionais e caminhos especulativos. A exigência é rotular corretamente o status lógico de cada ponte e separar conjectura, heurística e consequência demonstrada. Isso preserva criatividade sem vender imaginação como resolução.