A Nvidia anunciou nesta segunda-feira (24) que seu rack Groq 3 LPX entrou em produção plena, marcando a comercialização da tecnologia oriunda da maior aquisição de sua história. Os sistemas devem entrar em operação ainda em 2026. O rack será implantado em conjunto com os processadores centrais Vera e os processadores gráficos Rubin na nuvem da provedora Nebius, conforme informou o diretor sênior da companhia, Dion Harris, em entrevista a jornalistas.
O movimento posiciona a arquitetura adquirida junto à startup Groq como um componente complementar ao portfólio principal de computação acelerada da empresa, com foco específico em cargas de trabalho de inferência que demandam resposta em tempo real.
Contexto de Mercado & Capacidades da Solução
A relevância do anúncio está associada à crescente demanda por inferência de baixa latência, etapa do processamento de modelos de inteligência artificial determinante para a responsividade de agentes autônomos, em especial em aplicações de codificação e geração de código assistida. Nessa fase, a velocidade de entrega de cada token impacta diretamente a experiência do usuário e a viabilidade de fluxos de trabalho interativos.
A arquitetura Groq 3 diferencia-se pela integração de 500 megabytes de memória estática de acesso aleatório (SRAM) diretamente no die do chip, abordagem projetada para reduzir gargalos de movimentação de dados entre memória e processamento. Os chips Groq são fabricados pela Samsung, enquanto as unidades de processamento gráfico da Nvidia permanecem sob produção da Taiwan Semiconductor Manufacturing (TSMC).
Segundo a empresa, os chips de baixa latência não substituem as GPUs, que continuam como processadores centrais das aplicações de IA por sua capacidade de executar tanto o treinamento quanto a inferência com flexibilidade para adaptação a novos modelos e arquiteturas. O foco da tecnologia Groq está na fase de "decodificação" da execução dos modelos. Como observou Dion Harris, "não se trata de substituir GPUs. Trata-se de usar o processador certo, ao preço certo, para a parte certa da carga de trabalho".
Para provedores de nuvem, a capacidade de oferecer inferência com latência reduzida cria a possibilidade de estruturação de níveis de serviço diferenciados. "Para quem presta serviço de tokens, isso abre a possibilidade de oferecer níveis premium de serviço para os usuários e clientes que exigem os acordos mais sensíveis à latência", afirmou Harris.
Considerações Estratégicas para Lideranças
Para lideranças de tecnologia e operações, a avaliação dessa categoria de infraestrutura requer análise de arquitetura heterogênea e de orquestração de cargas de trabalho. A adoção de sistemas especializados em decodificação implica critérios de governança relacionados à integração entre processadores Vera, Rubin e Groq 3, à compatibilidade de software e à gestão de latência em acordos de nível de serviço (SLAs).
A decisão envolve também a definição de quais parcelas das cargas de trabalho se beneficiam de aceleração dedicada à inferência, a interoperabilidade com plataformas de nuvem como a da Nebius e a estratégia de alocação de recursos em data centers. A abordagem apresentada pela Nvidia, de destinar parte da infraestrutura para codificação a chips especializados e manter o restante com a plataforma Vera Rubin, ilustra um modelo de composição de data center baseado em especialização funcional.
Aspectos de cadeia de suprimentos, com fabricação distribuída entre Samsung e TSMC, e de evolução de modelos também devem compor a análise de risco e planejamento de capacidade de longo prazo.
Eficiência Operacional & Métricas
Cada rack Groq 3 LPX reúne 256 chips Groq 3 individuais. De acordo com benchmark da Artificial Analysis, o sistema entrega 3.400 tokens por segundo, métrica central para inferência de baixa latência.
O segmento apresenta concorrência ativa. No início de 2026, a Advanced Micro Devices (AMD) anunciou a integração de seus sistemas em escala de rack com chips da Cerebras, empresa que realizou recentemente abertura de capital e que também atua com foco em inferência de baixa latência. O modo Ultrafast da OpenAI, lançado recentemente, promete 750 tokens por segundo e é descrito pela empresa como "alimentado pela Cerebras".
A aquisição dos ativos da Groq pela Nvidia, concluída em dezembro de 2025 por US$ 20 bilhões, representa a maior transação da história da companhia e fundamenta a atual fase de produção em escala do rack LPX.
No âmbito de seu portfólio principal, a Nvidia também acelera os embarques dos sistemas Vera Rubin, que entraram em produção no início de 2026. Em apresentação conjunta dos sistemas Vera Rubin e do rack Groq 3 LPX realizada em março, o presidente-executivo da Nvidia, Jensen Huang, projetou US$ 1 trilhão em vendas acumuladas entre os chips da geração atual Blackwell e os novos sistemas Vera Rubin até 2027.
Próximos Passos & Evolução do Mercado
A entrada em operação dos racks Groq 3 LPX na nuvem Nebius ao longo de 2026 servirá como referência inicial para a adoção de arquiteturas híbridas que combinam GPUs de propósito geral e aceleradores dedicados à decodificação. A expectativa é de que provedores de nuvem avaliem modelos de precificação e oferta de serviços baseados em diferentes patamares de latência.
Jensen Huang indicou que destinará um quarto do espaço de seus data centers voltados para aplicações de codificação aos chips Groq, afirmando que "o restante do meu data center é 100% Vera Rubin", o que sinaliza uma estratégia de coexistência entre plataformas.
A evolução do mercado deverá ser acompanhada pelos próximos desdobramentos de roteiro de produtos e pelos resultados financeiros da Nvidia, com divulgação prevista para a quarta-feira (26), que poderão oferecer maior visibilidade sobre a demanda, a escala de produção e a integração comercial da nova linha de sistemas.
