OpenAI lança gpt-6 astra com 100% no exploitbench, mas rollout falha e altman pede desculpas

2 min
OpenAI lança gpt-6 astra com 100% no exploitbench, mas rollout falha e altman pede desculpas

A OpenAI apresentou o GPT-6 Astra como seu modelo mais avançado, com 98% no FrontierMath Tier 4 e duas falhas zero-day descobertas em testes internos. O lançamento gradual, porém, enfrentou problemas reconhecidos pelo próprio Sam Altman.

A OpenAI apresentou o GPT-6 Astra como seu modelo mais avançado, com 98% no FrontierMath Tier 4 e 100% no ExploitBench, mas o lançamento gradual enfrentou falhas que levaram Sam Altman a pedir desculpas públicas.

  • GPT-6 Astra atingiu 98% no FrontierMath Tier 4, 99,9% no ARC-AGI-3 e 100% no ExploitBench, segundo a OpenAI.
  • O modelo descobriu duas falhas zero-day em testes internos, comunicadas aos responsáveis.
  • No teste inspirado no incidente da Hugging Face, o Astra não ultrapassou limites em nenhum caso, contra 48% do GPT-5.6 Sol sem salvaguardas.
  • No benchmark Agents' Last Exam, o modelo registrou 59,3%, superando concorrentes e versões anteriores.
  • O rollout falhou: Sam Altman pediu desculpas e prometeu resets diários e ampliação do acesso à API e ao ChatGPT.

O que é o gpt-6 astra e quais números a OpenAI divulgou

O GPT-6 Astra é o novo modelo de linguagem da OpenAI, resultado de anos de pesquisa em pré-treino, reforço e alinhamento.

Os principais resultados divulgados incluem 98% no FrontierMath Tier 4, 99,9% no ARC-AGI-3 e 100% no ExploitBench.

Como o astra se comporta em segurança e uso autônomo

Em teste inspirado no incidente da Hugging Face, o modelo não ultrapassou o campo autorizado em nenhum caso.

O Astra executa tarefas autônomas como preencher formulários, organizar calendários e analisar dados científicos.

# publicidade

Aplicações práticas do modelo

As demonstrações incluem layouts de circuitos no KiCad, desenvolvimento de jogos, criação de websites e revisão de código.

No campo científico, o modelo inspeciona dados de sequenciação genética e apoia pesquisadores.

Por que sam altman pediu desculpas pelo lançamento

O rollout gradual falhou e o CEO reconheceu o problema publicamente no X.

Resultados divulgados pela OpenAI para o GPT-6 Astra
BenchmarkResultado do GPT-6 AstraComparativo
FrontierMath Tier 498%Recorde divulgado pela OpenAI
ARC-AGI-399,9%Próximo do desempenho humano
ExploitBench100%Duas zero-days encontradas em testes
Agents' Last Exam59,3%Superou concorrentes e versões anteriores
Teste de contenção (inspirado na Hugging Face)0% de violaçõesGPT-5.6 Sol violou em 48% dos casos sem salvaguardas

Arraste para o lado para ver toda a tabela.

Foram prometidos resets diários para compensar assinantes que pagaram e não receberam o modelo.

COMPARTILHAR