31.8 C
Uberlândia
segunda-feira, agosto 24, 2026

Nvidia inicia produção dos racks Groq 3 LPX para reduzir latência em inferência de IA

A Nvidia colocou em produção os racks Groq 3 LPX e planeja torná-los operacionais ainda este ano na neocloud Nebius. A tecnologia passou a integrar a empresa após a aquisição de ativos da Groq por US$ 20 bilhões (aproximadamente R$ 103 bilhões), o maior negócio já realizado pela Nvidia.

Os chips Groq têm foco na inferência de baixa latência, ou seja, em reduzir o tempo entre a solicitação do usuário e a resposta gerada por um sistema de inteligência artificial. Esse nível de desempenho é particularmente importante em aplicações de programação, onde atrasos na geração de respostas são rapidamente percebidos.

Integração com processadores e GPUs

Na Nebius, os racks Groq 3 LPX serão instalados ao lado dos processadores Vera e das GPUs Rubin. Segundo Dion Harris, diretor sênior da Nvidia, os equipamentos estarão disponíveis ainda neste ano.

A arquitetura dos chips inclui 500 MB de memória SRAM de alta velocidade integrada ao próprio circuito, com o objetivo de reduzir gargalos de acesso à memória durante a execução dos modelos. Cada rack reúne 256 chips Groq 3 e, de acordo com a Nvidia, o conjunto atingiu 3.400 tokens por segundo em um benchmark da Artificial Analysis.

Divisão de tarefas entre Groq e GPUs

A tecnologia Groq foi desenhada para uma função mais específica dentro do fluxo de inferência, concentrando-se principalmente na etapa de “decode”, responsável pela geração dos tokens que compõem a resposta do modelo. Já as GPUs permanecem em uso para treinamento, inferência mais abrangente e para prover maior flexibilidade frente a diferentes modelos e arquiteturas.

Dion Harris afirmou à CNBC que a adoção dos chips Groq não tem a intenção de substituir as GPUs, mas sim empregar o processador e o custo adequados para cada parte da carga de trabalho.

Com essa estratégia, a Nvidia reservou um quarto do espaço de seus data centers dedicado a aplicações de programação para os racks Groq; o restante do espaço será ocupado pelos sistemas Vera Rubin. Em março, durante a apresentação dos sistemas Vera Rubin e Groq 3 LPX, o CEO Jensen Huang já havia indicado a mesma divisão, afirmando que o restante dos data centers seria “100% Vera Rubin”.

Concorrência por inferência ultrarrápida

A disputa pela aceleração de respostas de IA inclui outros movimentos do mercado. A AMD anunciou planos para integrar seus sistemas em escala de rack com chips da Cerebras, empresa que abriu capital recentemente. A OpenAI também entrou na disputa com o modo Ultrafast, que promete alcançar 750 tokens por segundo e é descrito como “alimentado pela Cerebras”.

Enquanto amplia a produção e os envios dos sistemas Vera Rubin, a Nvidia passa a oferecer uma alternativa específica para acelerar etapas críticas da inferência, mantendo as GPUs como base para cargas de trabalho mais amplas.

Fonte: Uberlandianofoco

Evaldo Ribeiro
Evaldo Ribeirohttp://portalemdestaque.com.br
Evaldo Ribeiro é produtor de conteúdo digital e responsável pelo portal Reporter Marechal, atuando na criação, apuração e divulgação de conteúdos informativos de interesse público, com foco regional e relevância para a comunidade.
Últimas Notícias
Veja também