A OpenAI apresentou o GPT-6 Astra como seu modelo mais avançado, com 98% no FrontierMath Tier 4 e 100% no ExploitBench, mas o lançamento gradual enfrentou falhas que levaram Sam Altman a pedir desculpas públicas.
- GPT-6 Astra atingiu 98% no FrontierMath Tier 4, 99,9% no ARC-AGI-3 e 100% no ExploitBench, segundo a OpenAI.
- O modelo descobriu duas falhas zero-day em testes internos, comunicadas aos responsáveis.
- No teste inspirado no incidente da Hugging Face, o Astra não ultrapassou limites em nenhum caso, contra 48% do GPT-5.6 Sol sem salvaguardas.
- No benchmark Agents' Last Exam, o modelo registrou 59,3%, superando concorrentes e versões anteriores.
- O rollout falhou: Sam Altman pediu desculpas e prometeu resets diários e ampliação do acesso à API e ao ChatGPT.
O que é o gpt-6 astra e quais números a OpenAI divulgou
O GPT-6 Astra é o novo modelo de linguagem da OpenAI, resultado de anos de pesquisa em pré-treino, reforço e alinhamento.
Os principais resultados divulgados incluem 98% no FrontierMath Tier 4, 99,9% no ARC-AGI-3 e 100% no ExploitBench.
Como o astra se comporta em segurança e uso autônomo
Em teste inspirado no incidente da Hugging Face, o modelo não ultrapassou o campo autorizado em nenhum caso.
O Astra executa tarefas autônomas como preencher formulários, organizar calendários e analisar dados científicos.
# publicidade
Aplicações práticas do modelo
As demonstrações incluem layouts de circuitos no KiCad, desenvolvimento de jogos, criação de websites e revisão de código.
No campo científico, o modelo inspeciona dados de sequenciação genética e apoia pesquisadores.
Por que sam altman pediu desculpas pelo lançamento
O rollout gradual falhou e o CEO reconheceu o problema publicamente no X.
| Benchmark | Resultado do GPT-6 Astra | Comparativo |
|---|---|---|
| FrontierMath Tier 4 | 98% | Recorde divulgado pela OpenAI |
| ARC-AGI-3 | 99,9% | Próximo do desempenho humano |
| ExploitBench | 100% | Duas zero-days encontradas em testes |
| Agents' Last Exam | 59,3% | Superou concorrentes e versões anteriores |
| Teste de contenção (inspirado na Hugging Face) | 0% de violações | GPT-5.6 Sol violou em 48% dos casos sem salvaguardas |
Arraste para o lado para ver toda a tabela.
Foram prometidos resets diários para compensar assinantes que pagaram e não receberam o modelo.
Leia também:
Fonte: Sapo Tek