A OpenAI divulgou os primeiros testes do processador Jalapeño, revelando um ganho de eficiência energética de até 1,9 vezes por watt em relação a soluções de mercado, consolidando sua estratégia de desenvolver hardware próprio para reduzir custos operacionais.
O Jalapeño é focado exclusivamente em inferência, visando custos de operação menores.
O chip apresentou superioridade em latência e eficiência energética em testes internos contra o GB300 da Nvidia.
A parceria com a Broadcom é estratégica para a autonomia tecnológica da OpenAI.
Resultados não contemplam a nova linha Vera Rubin da Nvidia.
O impacto do Jalapeño na infraestrutura da OpenAI
O processador Jalapeño foi projetado especificamente para acelerar a inferência, fase em que o modelo já treinado processa dados e gera respostas, permitindo que a OpenAI reduza sua dependência de hardwares de terceiros. A estratégia visa mitigar os elevados custos operacionais de seus centros de dados, onde o consumo energético representa uma despesa crítica para a escala atual da empresa.
Mas por que focar em inferência em vez de treinamento? Diferente do treinamento de modelos, que exige clusters massivos e alta largura de banda, a inferência é a carga de trabalho diária de plataformas como o ChatGPT. O Jalapeño otimiza o custo por consulta, tornando a IA mais viável financeiramente em larga escala.
Desempenho comparado e limitações dos testes
Os testes, realizados pela própria OpenAI, utilizaram o sistema de benchmarking InferenceX para comparar o Jalapeño com o processador GB300 da Nvidia. Os resultados indicaram que, operando com um consumo de 700 watts, o novo chip superou a concorrência em latência, com melhorias entre 1,7 e 3,6 vezes em tempos de resposta de ponta a ponta.
É fundamental observar que os dados fornecidos pela empresa excluem a geração mais recente de chips Vera Rubin da Nvidia, que começaram a ser comercializados recentemente. Além disso, o foco exclusivo em inferência delimita o uso do chip, deixando o treinamento de modelos, área onde a Nvidia domina, fora do escopo inicial de aplicação deste hardware.
Próximos passos e estratégia de escala
A OpenAI confirmou que já trabalha em futuras gerações do Jalapeño para atender modelos cada vez mais complexos, como as iterações do GPT. A integração com a Broadcom é o alicerce para uma plataforma de computação que a empresa pretende tornar mais acessível e rápida para seus clientes corporativos e usuários finais.
| Critério | Jalapeño (OpenAI) | GB300 (Nvidia) |
|---|---|---|
| Foco principal | Inferência | Treino e inferência |
| Eficiência (processamento por watt) | 1,5x a 1,9x superior | Referência |
| Redução de latência | 1,7x a 3,6x | Referência |
Arraste para o lado para ver toda a tabela.
A transição para hardware customizado não é um evento isolado, mas uma tendência entre empresas que operam modelos de IA em escala global. O desafio para a OpenAI será equilibrar o desenvolvimento técnico com a cadeia de suprimentos necessária para viabilizar esse hardware em nível global, reduzindo a fricção e os custos de infraestrutura no médio prazo.