
Neste artigo (4)
OpenAI Chip Jalapeno: A Aposta em Inferência com Silício Personalizado
Principais conclusões
- A economia de custos de ~50% do Jalapeno em relação às GPUs, citada pelo CEO da Broadcom Hock Tan, é o argumento central de negócio para a OpenAI possuir seu próprio silício de inferência em vez de alugar computação de uso geral.
- ASICs trocam flexibilidade por eficiência; o Jalapeno é ajustado especificamente para inferência de LLM, o que significa que vence em custo em escala, mas não consegue se adaptar facilmente caso os padrões de inferência mudem.
- A parceria OpenAI-Broadcom-Celestica divide o design do chip, a implementação do silício e os sistemas de produção entre três especialistas — um modelo que vale ser estudado por qualquer pessoa que esteja construindo infraestrutura de IA em escala.
Jalapeno, o primeiro ASIC de inferência personalizado da OpenAI, desenvolvido em parceria com a Broadcom, troca flexibilidade por custo e controle na escala de LLMs.
Jalapeño, o primeiro ASIC de inferência personalizado da OpenAI desenvolvido com a Broadcom, troca flexibilidade por custo e controle na escala de LLMs.
Os H100s da Nvidia são para a infraestrutura de IA o que o tema padrão do WordPress é para o design de sites: perfeitamente funcionais, amplamente utilizados, e um sinal de que alguém ainda não pensou muito sobre suas restrições específicas. A OpenAI, que pensou bastante sobre suas restrições específicas, acaba de anunciar que tem um plano diferente. Conheça o Jalapeno, o primeiro chip de inferência personalizado da OpenAI, desenvolvido com a Broadcom e otimizado do zero para inferência de modelos de linguagem de grande escala.
O Que é
o Jalapeno, de Fato O Jalapeno é um ASIC, um circuito integrado de aplicação específica, o que significa que ele deliberadamente não é um acelerador de propósito geral. Enquanto uma GPU é um canivete suíço que lida com treinamento, inferência, gráficos e qualquer outra coisa que você jogar nela, um ASIC é uma lâmina única e muito afiada. De acordo com o anúncio oficial da OpenAI, o chip foi projetado a partir do profundo entendimento da OpenAI sobre os fundamentos de LLMs, informado pelo seu roadmap de modelos, kernels, sistemas de serviço e necessidades de produto. Essa última parte merece atenção: este chip é moldado pela mesma equipe que decide quais modelos são construídos e como são servidos. O ciclo de feedback arquitetural é extremamente curto. Segundo reportagem da DBTA, amostras de engenharia do Jalapeno já estão executando cargas de trabalho de ML no laboratório na frequência e potência-alvo de produção, incluindo o GPT-5.3-Codex-Spark — o que é tanto um sinal encorajador de progresso real quanto um detalhe muito específico escolhido para deixar investidores confortáveis. Provavelmente os dois. Segundo o Tom's Hardware, o chip foi do conceito ao tape-out em nove meses, um ritmo que o relatório descreve como ultrarrápido para um ASIC do tamanho de um reticle. Os próprios modelos de IA da OpenAI supostamente aceleraram o design e a otimização do chip durante esse período, o que significa que o Jalapeno é, de forma agradavelmente recursiva, um produto de IA que foi parcialmente projetado por IA.
O Argumento de Custo é
o Argumento Inteiro Histórias de silício personalizado costumam vir vestidas com benchmarks de desempenho e diagramas arquiteturais, mas o argumento real é quase sempre econômico. Segundo o AI Weekly, o CEO da Broadcom, Hock Tan, citou publicamente uma economia de aproximadamente 50% em comparação com GPUs de IA típicas, tornando esse o primeiro número concreto de custo divulgado por qualquer uma das empresas. Para um negócio que executa inferência na escala em que a OpenAI opera, uma redução de 50% no custo de computação não é uma nota de rodapé; é o argumento de negócio inteiro que justifica o sprint de nove meses, a parceria de vários anos e a sobrecarga organizacional de se tornar, na prática, uma empresa de chips. O trade-off do ASIC é real e vale a pena nomear claramente. GPUs de propósito geral justificam seu preço premium em parte pela flexibilidade: você pode retreinar, ajustar, experimentar e mudar cargas de trabalho sem redesenhar o silício. Um ASIC aposta que seus padrões de inferência são estáveis o suficiente para que a especialização valha a pena. A OpenAI está fazendo essa aposta explicitamente, e o AI Weekly observa que o Jalapeno é ajustado de forma restrita para inferência de LLM, trocando adaptabilidade por custo e eficiência em escala. Se os padrões de serviço de LLM mudarem drasticamente, o chip não muda junto. Esse é o risco embutido no número de economia.
A Estrutura da Parceria por Trás do Chip O Jalapeno não é um projeto solo.
Segundo a DBTA, a OpenAI projetou o chip do zero com base em seus fundamentos de LLM, enquanto a Broadcom e a Celestica cuidaram da implementação do chip, da integração de sistemas de placa e rack, de redes de alto desempenho e de sistemas de produção escaláveis. Essa divisão de trabalho importa: a OpenAI traz o conhecimento de modelos e os requisitos de inferência; a Broadcom traz a experiência em execução de silício; a Celestica industrializa a pilha física. É uma separação clara do que cada parte realmente faz bem, o que é mais raro em parcerias tecnológicas do que os press releases deixam transparecer. A colaboração estratégica antecede este anúncio do chip em vários meses. De acordo com o próprio anúncio da OpenAI de outubro de 2025, as empresas já haviam se comprometido a implantar 10 gigawatts de aceleradores de IA projetados pela OpenAI como parte de uma parceria de vários anos cobrindo aceleradores e sistemas de rede para clusters de IA de próxima geração. O Jalapeno é o primeiro produto que se materializa desse compromisso, não um anúncio isolado. É a geração um de uma plataforma de computação de múltiplas gerações declarada, conforme o comunicado para investidores da Broadcom.
O Que os Desenvolvedores Devem Realmente Observar Para quem está pensando em
infraestrutura de IA além do projeto imediato à frente, o anúncio do Jalapeno carrega um sinal estrutural que vale acompanhar. A OpenAI está apostando explicitamente que possuir a camada de inferência — não apenas alugar tempo de GPU — é como você controla custo e latência em escala. Essa lógica não exige que você construa seu próprio chip; exige que você pense sobre para onde vão seus custos de inferência conforme o uso escala, e se o prêmio de flexibilidade que você está pagando por hardware de propósito geral está, de fato, comprando algo útil. A meta de implantação de 10 gigawatts do anúncio de colaboração de outubro de 2025 sugere que a OpenAI não está tratando o Jalapeno como uma aposta de cobertura. É uma direção de infraestrutura primária. Para o restante do ecossistema de desenvolvedores de IA, a questão interessante a jusante é se a experiência da Broadcom em co-projetar esta plataforma eventualmente produzirá opções de silício de inferência que não sejam exclusivas da OpenAI. Isso não foi anunciado. Mas os padrões de design, o processo de tape-out de nove meses supostamente acelerado por modelos de IA e o modelo de parceria em camadas entre proprietário de modelo, designer de chip e integrador de sistemas são todos aspectos que valem ser acompanhados à medida que outros grandes operadores de inferência enfrentam a mesma matemática de custos.