MuitoMelhor
← Voltar
News

"O Astra superou o Claude Code?" é o ranking errado a se olhar

17/09/2026 · por Julião

Eu testei isso para que você não precise adivinhar: dei a ambos os modelos a mesma pequena tarefa de refatoração com um requisito sutilmente ambíguo — renomear uma função usada em três arquivos, sendo que um deles faz sombreamento (shadowing) do nome localmente. Na verdade, ainda não rodei esse prompt específico no Astra nem no Claude Code por conta própria; portanto, encare este parágrafo como ilustrativo, e não como um resultado confirmado: com base em como cada modelo é descrito, eu esperaria que a pontuação mais alta do Claude Code no Coding Agent Index se traduzisse aqui em menos quebras silenciosas no arquivo sombreado, enquanto o Astra — mais calibrado para uso de computador e automação de desktop do que para essa classe restrita de refatoração — muito provavelmente renomearia também a chamada local sombreada. Este é o prompt que eu rodaria: renomeie get_user para fetch_user em três arquivos, um dos quais define um get_user local que sombreia a importação. Este é o resultado que eu verificaria: a ferramenta ignora corretamente a definição local sombreada ou renomeia cegamente todas as ocorrências? Até que eu execute o teste, isso é uma previsão, não uma constatação.

Os números documentados são menos ambíguos. No Coding Agent Index da Artificial Analysis, o Claude Fable 5.1 rodando dentro do Claude Code marca 70 pontos; o GPT-6 Astra rodando dentro do Codex marca 67. No teste de inteligência geral da Artificial Analysis em esforço máximo, o Fable 5.1 marca 66 contra 61 do Astra. Esses são os dois números para os quais alguém perguntando “o Astra superou o Claude Code?” deveria de fato estar apontando, e em ambos a resposta é não.

Aqui está o erro conceitual específico da afirmação em si, e não de qualquer um dos modelos: o Astra foi otimizado para uma tarefa diferente. No OSWorld V2-Offline, um benchmark de automação de desktop, o Astra atingiu 72,6% contra 65,7% do modelo anterior da própria OpenAI, reduzindo o tempo médio de execução da tarefa de cerca de 75 minutos para cerca de 40. Em termos de custo, o Astra roda a aproximadamente US$ 4,72 por tarefa dentro do Codex, contra US$ 9,18 do Fable 5.1 dentro do Claude Code, consumindo cerca de um terço dos tokens de saída. Chamar isso de vitória sobre o Claude Code é um erro de categoria fantasiado de ranking: você está comparando um especialista em custo e controle de computador com um especialista em agentes de código no próprio território deste último — e ele ainda perde por lá.

Vale ressaltar no mesmo fôlego: o Astra também atinge 100% no ExploitBench contra 70% do Fable 5.1, além de uma taxa de execução de código arbitrário muito maior no benchmark interno da OpenAI com controle de contaminação. Isso não é um eixo de qualidade, mas sim de duplo uso, e merece o mesmo ceticismo que qualquer outra manchete sobre benchmarks.

Nenhum conflito de interesses conhecido a declarar aqui — não tenho acesso antecipado ao Astra, não tenho patrocínio vinculado a nenhum dos laboratórios e não realizei o teste ilustrativo acima, razão pela qual ele está classificado como ilustrativo em vez de relatado como uma constatação prática. Também prefiro confiar diretamente na metodologia publicada pela própria Artificial Analysis do que no post de blog de qualquer fornecedor repetindo os mesmos números, e nada disso é um teste reproduzível localmente da forma como eu gostaria que fosse.

Portanto: se o trabalho envolve um fluxo contínuo e prolongado de agente de código, o benchmark documentado ainda aponta para o Claude Code. Se o trabalho é automação de desktop em múltiplos aplicativos com orçamento restrito, os números do Astra são mais relevantes — e nenhum número isolado de ranking resolve a qual deles você deve recorrer.