OpenAI lança GPT-6 Astra para programação e automação de computador com pontuação recorde

5 min
OpenAI lança GPT-6 Astra para programação e automação de computador com pontuação recorde

A OpenAI lançou o GPT-6 Astra, modelo focado em programação, uso de computador, fluxos profissionais e cibersegurança, com pontuações recordes em benchmarks e disponibilidade inicial para organizações selecionadas.

A OpenAI lançou o GPT-6 Astra, um modelo focado em uso de computador, programação, fluxos de trabalho profissionais, ciência e cibersegurança. O modelo alcançou 72,6% no OSWorld 2.0 e 57,9% no Terminal-Bench 4.0, com disponibilidade inicial para organizações selecionadas.

Benchmarks que definem o gpt-6 astra

O benchmark OSWorld 2.0 avalia a capacidade de um agente operar um sistema operacional real, executando tarefas como arrastar arquivos, editar documentos e interagir com aplicativos. O Astra alcançou 72,6%, contra 65,7% do GPT-5.6 Sol.

Em programação, o Terminal-Bench 4.0 mede a proficiência em interações de terminal, incluindo comandos, scripts e depuração. O Astra marcou 57,9%. Já o DeepSWE v1.1, focado em resolver issues reais de engenharia de software, registrou 74,1%.

O destaque em contexto longo aparece nas avaliações MRCR da OpenAI. O modelo pontuou 96,3% no intervalo de 512 mil a 1 milhão de tokens, o que habilita tarefas prolongadas de programação com referência a requisitos anteriores.

Mas como o mecanismo experimental de contexto funciona na prática? O Codex agora permite que o agente mantenha notas entre janelas de contexto, em vez de depender apenas de compactação. Janelas anteriores permanecem pesquisáveis, permitindo recuperar requisitos, resultados de testes e saídas de ferramentas durante tarefas longas.

  • OSWorld 2.0: 72,6% (Astra) vs 65,7% (GPT-5.6 Sol)

  • Terminal-Bench 4.0: 57,9% para o Astra

  • DeepSWE v1.1: 74,1% em engenharia de software

  • MRCR: 96,3% para contexto de 512 mil a 1 milhão de tokens

Cibersegurança no nível crítico

O Astra representa uma mudança significativa no perfil de risco dos modelos da OpenAI. Em testes sem as salvaguardas de produção, o modelo descobriu e usou duas vulnerabilidades previamente desconhecidas e demonstrou capacidade de desenvolver exploits contra navegadores e sistemas operacionais endurecidos.

Por causa desse potencial, a versão de produção restringe tarefas ofensivas avançadas. A OpenAI planeja fornecer capacidades defensivas mais amplas por meio do programa Daybreak, dedicado a cibersegurança com IA.

A redução de alucinações é expressiva: 4,2% no Astra, contra 12,2% no GPT-5.6 Sol, em avaliação interna da OpenAI. Menos alucinação e mais capacidade ofensiva formam um parâmetro duplo que equipes de segurança e compliance precisam acompanhar.

E qual é o risco real para empresas que adotarem o Astra? A OpenAI afirma que o raciocínio escrito do Astra é mais difícil de monitorar que o do antecessor. A melhoria dessa monitorabilidade permanece uma área ativa de pesquisa, o que é um ponto crítico para governança de agentes de IA em produção.

Reação da comunidade e implicações para o mercado

O CEO da Nvidia, Jensen Huang, destacou a infraestrutura usada no treinamento: cerca de 100 mil GPUs NVIDIA Grace Blackwell NVLink72. Ele escreveu que de ChatGPT a o1 a Astra em 4 anos, AGI chegou, e anunciou que 400 mil GPUs adicionais estão entrando em operação.

O comentarista Alex Finn também focou no enquadramento de AGI, com a frase Bem-vindo à AGI. ChatGPT 6 Astra acaba de ser lançado.

Na visão do Mercado de TI, a declaração de Huang sobre AGI é uma opinião de um executivo com interesse direto na venda de GPUs, não um consenso técnico. O que os números da OpenAI mostram é um avanço mensurável em tarefas específicas, não uma inteligência geral.

Para profissionais brasileiros que trabalham com desenvolvimento de software, o Astra sinaliza que agentes capazes de interagir com interfaces e manter contexto prolongado se tornarão parte do fluxo de trabalho em IA. A capacidade de recuperar requisitos e resultados de testes entre janelas reduz a perda de contexto em tarefas longas.

O receio central continua sendo a monitorabilidade. Se o raciocínio do modelo se torna mais opaco, aumenta a dificuldade de auditoria em setores regulados, como o financeiro e o de saúde no Brasil. O Astra é o início de uma geração em que a potência dos agentes supera a transparência dos processos que eles executam.

  • Jensen Huang confirmou treinamento com cerca de 100 mil GPUs NVIDIA Grace Blackwell NVLink72

  • Anúncio de 400 mil GPUs adicionais entrando em operação

  • Comunidade foca no enquadramento de AGI, mas técnicos apontam avanços específicos em benchmarks

  • Para o Brasil, o impacto vem na automação de fluxos de trabalho que exigem interação com interfaces

Comparativo de pontuações reportadas pela OpenAI para o GPT-6 Astra e GPT-5.6 Sol
BenchmarkGPT-6 AstraGPT-5.6 Sol
OSWorld 2.072,6%65,7%
Terminal-Bench 4.057,9%Não divulgado
DeepSWE v1.174,1%Não divulgado
Alucinação (avaliação interna)4,2%12,2%

Arraste para o lado para ver toda a tabela.

Fonte: Infoq

COMPARTILHAR