Thesis 2 sobre GPT-OSS 120B: o MoE está no modelo; a inteligência extra está no harness
117 bilhões de parâmetros totais não significam 117 bilhões ativos por token. O design do Thesis 2 parte dessa diferença e usa orquestração externa seletiva, não uma fantasia de “escolher experts” no JavaScript.
Sparsidade interna, seletividade externa
O MoE economiza compute dentro da inferência. O harness economiza compute fora dela: decide quando buscar na web, abrir verificador de código, rodar análise visual, fazer preflight, reparar ou gerar um segundo candidato.
O contexto de 128k continua sendo escasso
Um monorepo, histórico de chat, documentação, logs e screenshots podem ultrapassar 128k rapidamente. Por isso o runtime usa compilação de contexto e artifacts de handoff em vez de empilhar tudo até o attention map virar um depósito.
Esforço de raciocínio é uma alavanca real
GPT-OSS foi pós-treinado para níveis de esforço. Thesis 2 usa isso junto com gates externos: Low/Medium não carregam o custo de Max, enquanto Extra/Max podem comprar mais planejamento e verificação quando o perfil da tarefa justifica.
Especialização sem trocar o foundation model
Código, UI, PBR, arquitetura e pesquisa recebem políticas, ferramentas e critérios diferentes, mas o gerador primário continua sendo o mesmo foundation model. Isso evita uma identidade em que “Thesis 2” vira apenas um nome sobre modelos diferentes a cada rota.
Verificação é um sistema separado
O gerador não deve dar a nota para o próprio trabalho e encerrar. Thesis 2 usa checks determinísticos e, quando necessário, avaliadores independentes. Se um verificador estiver indisponível, isso vira estado de qualidade degradada em vez de um “passou” inventado.
Mais agentes não significa automaticamente mais inteligência
Times paralelos podem expandir busca, mas também multiplicam custo, conflito e integração. Thesis 2 prefere uma trajetória, repair e branching condicionado a desacordo. Paralelismo vira ferramenta excepcional, não decoração arquitetural.
O que o harness pode e não pode fazer
Harness engineering pode melhorar enormemente desempenho efetivo, consistência e custo. Ele não transforma magicamente 5,1B parâmetros ativos em outro foundation model. O ganho vem de contexto melhor, ferramentas melhores, compute melhor alocado e critérios de saída mais fortes.