A OpenAI lançou o GPT-6 Astra, um modelo focado em uso de computador, programação, fluxos de trabalho profissionais, ciência e cibersegurança. O modelo alcançou 72,6% no OSWorld 2.0 e 57,9% no Terminal-Bench 4.0, com disponibilidade inicial para organizações selecionadas.
GPT-6 Astra alcança 72,6% no OSWorld 2.0, superando os 65,7% do GPT-5.6 Sol em uso de computador
Modelo é o primeiro da OpenAI classificado como crítico em cibersegurança no Preparedness Framework
Leia também
OpenAI lança gpt-6 astra com 100% no exploitbench, mas rollout falha e altman pede desculpas
Mecanismo experimental no Codex permite manter notas entre janelas de contexto sem depender de compactação
Suporte a contexto longo de até um milhão de tokens com 96,3% no MRCR
Alucinações caem de 12,2% (GPT-5.6 Sol) para 4,2% (Astra), mas monitorabilidade do raciocínio piora
Benchmarks que definem o gpt-6 astra
O benchmark OSWorld 2.0 avalia a capacidade de um agente operar um sistema operacional real, executando tarefas como arrastar arquivos, editar documentos e interagir com aplicativos. O Astra alcançou 72,6%, contra 65,7% do GPT-5.6 Sol.
Em programação, o Terminal-Bench 4.0 mede a proficiência em interações de terminal, incluindo comandos, scripts e depuração. O Astra marcou 57,9%. Já o DeepSWE v1.1, focado em resolver issues reais de engenharia de software, registrou 74,1%.
O destaque em contexto longo aparece nas avaliações MRCR da OpenAI. O modelo pontuou 96,3% no intervalo de 512 mil a 1 milhão de tokens, o que habilita tarefas prolongadas de programação com referência a requisitos anteriores.
Mas como o mecanismo experimental de contexto funciona na prática? O Codex agora permite que o agente mantenha notas entre janelas de contexto, em vez de depender apenas de compactação. Janelas anteriores permanecem pesquisáveis, permitindo recuperar requisitos, resultados de testes e saídas de ferramentas durante tarefas longas.
OSWorld 2.0: 72,6% (Astra) vs 65,7% (GPT-5.6 Sol)
Terminal-Bench 4.0: 57,9% para o Astra
DeepSWE v1.1: 74,1% em engenharia de software
MRCR: 96,3% para contexto de 512 mil a 1 milhão de tokens
Cibersegurança no nível crítico
O Astra representa uma mudança significativa no perfil de risco dos modelos da OpenAI. Em testes sem as salvaguardas de produção, o modelo descobriu e usou duas vulnerabilidades previamente desconhecidas e demonstrou capacidade de desenvolver exploits contra navegadores e sistemas operacionais endurecidos.
Por causa desse potencial, a versão de produção restringe tarefas ofensivas avançadas. A OpenAI planeja fornecer capacidades defensivas mais amplas por meio do programa Daybreak, dedicado a cibersegurança com IA.
A redução de alucinações é expressiva: 4,2% no Astra, contra 12,2% no GPT-5.6 Sol, em avaliação interna da OpenAI. Menos alucinação e mais capacidade ofensiva formam um parâmetro duplo que equipes de segurança e compliance precisam acompanhar.
E qual é o risco real para empresas que adotarem o Astra? A OpenAI afirma que o raciocínio escrito do Astra é mais difícil de monitorar que o do antecessor. A melhoria dessa monitorabilidade permanece uma área ativa de pesquisa, o que é um ponto crítico para governança de agentes de IA em produção.
Reação da comunidade e implicações para o mercado
O CEO da Nvidia, Jensen Huang, destacou a infraestrutura usada no treinamento: cerca de 100 mil GPUs NVIDIA Grace Blackwell NVLink72. Ele escreveu que de ChatGPT a o1 a Astra em 4 anos, AGI chegou, e anunciou que 400 mil GPUs adicionais estão entrando em operação.
O comentarista Alex Finn também focou no enquadramento de AGI, com a frase Bem-vindo à AGI. ChatGPT 6 Astra acaba de ser lançado.
Na visão do Mercado de TI, a declaração de Huang sobre AGI é uma opinião de um executivo com interesse direto na venda de GPUs, não um consenso técnico. O que os números da OpenAI mostram é um avanço mensurável em tarefas específicas, não uma inteligência geral.
Para profissionais brasileiros que trabalham com desenvolvimento de software, o Astra sinaliza que agentes capazes de interagir com interfaces e manter contexto prolongado se tornarão parte do fluxo de trabalho em IA. A capacidade de recuperar requisitos e resultados de testes entre janelas reduz a perda de contexto em tarefas longas.
O receio central continua sendo a monitorabilidade. Se o raciocínio do modelo se torna mais opaco, aumenta a dificuldade de auditoria em setores regulados, como o financeiro e o de saúde no Brasil. O Astra é o início de uma geração em que a potência dos agentes supera a transparência dos processos que eles executam.
Jensen Huang confirmou treinamento com cerca de 100 mil GPUs NVIDIA Grace Blackwell NVLink72
Anúncio de 400 mil GPUs adicionais entrando em operação
Comunidade foca no enquadramento de AGI, mas técnicos apontam avanços específicos em benchmarks
Para o Brasil, o impacto vem na automação de fluxos de trabalho que exigem interação com interfaces
| Benchmark | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| OSWorld 2.0 | 72,6% | 65,7% |
| Terminal-Bench 4.0 | 57,9% | Não divulgado |
| DeepSWE v1.1 | 74,1% | Não divulgado |
| Alucinação (avaliação interna) | 4,2% | 12,2% |
Arraste para o lado para ver toda a tabela.
Fonte: Infoq