Bitget App
Trading inteligente
Comprar criptoMercadosTradingFuturosRendaAICentralMais
Focando no mercado de inferência de IA de baixa latência, Nvidia (NVDA.US) Groq 3 LPX entra em produção em massa total; os primeiros sistemas serão implantados na NEBIUS (NBIS.US)

Focando no mercado de inferência de IA de baixa latência, Nvidia (NVDA.US) Groq 3 LPX entra em produção em massa total; os primeiros sistemas serão implantados na NEBIUS (NBIS.US)

智通财经智通财经2026/08/25 01:06
Mostrar original
Por:智通财经

A Nvidia anunciou na segunda-feira que o sistema em rack Groq 3 LPX entrou em plena produção em massa, marcando que, após a aquisição de ativos relacionados à Groq por cerca de 20 bilhões de dólares no ano passado, essa tecnologia de inferência de IA de baixa latência entrou oficialmente na fase de comercialização.

A Mídia Financeira Zhihui informa que a Nvidia (NVDA.US) anunciou nesta segunda-feira que o sistema Groq 3 LPX em nível de rack entrou em plena produção em massa, marcando a fase de comercialização desta tecnologia de inferência de IA de baixa latência após a aquisição, no ano passado, de ativos da Groq por cerca de 20 bilhões de dólares. Os primeiros sistemas serão implantados no provedor de serviços de computação em nuvem de IA, NEBIUS (NBIS.US), e deverão entrar em operação ainda este ano.

O diretor sênior da Nvidia, Dion Harris, afirmou à imprensa que o Groq 3 LPX será implementado juntamente com os processadores centrais Vera e as GPUs Rubin da Nvidia nos data centers da Nebius.

A rápida produção em massa do produto Groq reflete a tendência de que, à medida que as aplicações de IA passam do treinamento de modelos para a implantação real, a inferência de IA de baixa latência está se tornando um novo mercado-chave para a Nvidia. Especialmente em aplicações como agentes de IA e programação de IA, modelos precisam gerar conteúdo continuamente a uma velocidade maior, reduzindo o tempo de espera do usuário.

No final de dezembro do ano passado, a Nvidia gastou cerca de 20 bilhões de dólares para adquirir ativos relacionados à startup de chips de IA, Groq, que tornou-se a maior aquisição da história da empresa.

Uma característica marcante da arquitetura do chip Groq é a integração de 500MB de SRAM de alta velocidade dentro do próprio chip, para reduzir possíveis gargalos de transferência de dados causados por acessos à memória tradicional, aumentando assim a velocidade de resposta durante a inferência de modelos de IA.

Diferente das GPUs principais da Nvidia, fabricadas pela TSMC (TSM.US), os chips Groq são produzidos pela Samsung.

Atualmente, a Nvidia integra 256 chips Groq 3 em um rack LPX. Segundo dados de benchmark citados pela Nvidia do Artificial Analysis, o sistema Groq 3 LPX consegue gerar cerca de 3.400 tokens por segundo.

Para IA generativa, um token pode ser entendido como a unidade básica que o modelo processa e gera em texto. Uma taxa superior de tokens gerados por segundo significa que a IA pode responder mais rapidamente às solicitações dos usuários, o que é especialmente importante para aplicações sensíveis à latência como IA para programação e agentes em tempo real.

Harris afirmou que, para empresas de computação em nuvem que oferecem serviços de inferência de IA, menor latência significa que elas podem oferecer serviços premium de maior preço para clientes que exigem respostas mais rápidas.

No entanto, os chips Groq não foram projetados para substituir as GPUs tradicionais da Nvidia.

As GPUs ainda são o núcleo da infraestrutura de computação de IA atualmente, capazes de tanto treinar modelos de IA quanto executar tarefas de inferência, além de oferecerem maior versatilidade para diferentes modelos e arquiteturas tecnológicas.

Chips como os da Groq, com baixa latência, são mais focados em etapas específicas do processo de inferência, especialmente na fase de “decodificação” durante a geração de conteúdo pelo modelo.

Harris acrescentou: "Não se trata de substituir as GPUs, mas sim de usar o processador com o melhor preço e desempenho para cada parte da carga de trabalho."

Isso significa que a Nvidia está buscando estabelecer uma arquitetura de computação de IA mais segmentada: as CPUs Vera e as GPUs Rubin continuam realizando tarefas de computação de IA mais amplas, enquanto os chips Groq são otimizados para cargas de trabalho de inferência altamente sensíveis à latência.

À medida que o setor de IA avança da fase de treinamento de modelos em grande escala para uma rápida expansão da demanda de inferência, a competição no mercado de inferência de baixa latência está se intensificando.

A AMD (AMD.US) anunciou, no início deste ano, que iria integrar seus sistemas de IA em rack com os chips da Cerebras (CBRS.US), também com foco em inferência de IA de baixa latência.

A importância desse segmento está aumentando com a popularização de aplicações como programação de IA. De acordo com a reportagem, o modo Ultrafast recém-anunciado pela OpenAI promete até 750 tokens por segundo, sendo a capacidade de processamento fornecida pela Cerebras.

Em comparação, dados de benchmark citados pela Nvidia mostram que o Groq 3 LPX pode atingir 3.400 tokens por segundo. No entanto, as condições de teste e os cenários de aplicação dos diferentes sistemas podem variar, portanto esses números não devem ser considerados como uma comparação direta de desempenho.

Ao mesmo tempo, a Nvidia está acelerando as entregas de seus sistemas Vera Rubin, que já entraram em produção no início deste ano.

O CEO da Nvidia, Jensen Huang, estimou durante o lançamento dos sistemas Vera Rubin e Groq 3 LPX em março deste ano que, do atual chip Blackwell até a nova geração Vera Rubin, as vendas acumuladas poderiam atingir 1 trilhão de dólares até 2027.

Jensen Huang também revelou na época que, nos espaços de data centers dedicados a aplicações de programação de IA, planeja alocar cerca de um quarto para chips Groq e o restante para sistemas Vera Rubin.

Essa proporção de alocação mostra ainda mais o foco da Nvidia no mercado de inferência de baixa latência. À medida que agentes de IA, programação de IA e aplicações de IA generativa em tempo real se desenvolvem rapidamente, a velocidade de inferência está se tornando um importante diferencial competitivo para empresas de computação em nuvem e desenvolvedores de IA.

O início da produção em massa do Groq 3 LPX também indica que a Nvidia está expandindo seu papel de fornecedora de chips de IA centrados em GPUs para oferecer arquiteturas computacionais dedicadas para diferentes cargas de trabalho de IA.

O mercado agora acompanha de perto os mais recentes resultados da Nvidia. A empresa divulgará seu balanço nesta quarta-feira, e além da demanda por Blackwell e Vera Rubin, os avanços nos negócios de inferência de IA e a comercialização do Groq também podem se tornar novos destaques para os investidores.

0
0

Aviso Legal: o conteúdo deste artigo reflete exclusivamente a opinião do autor e não representa a plataforma. Este artigo não deve servir como referência para a tomada de decisões de investimento.

PoolX: bloqueie e ganhe!
Até 10% de APR - Quanto mais você bloquear, mais poderá ganhar.
Bloquear agora!

Talvez também goste

A guerra pelo capital de capacidade de IA se intensifica! “Nova nuvem” Lambda, vinculada à Nvidia, planeja levantar US$ 3 bilhões para expandir sua presença em computação e preparar um IPO.

O provedor de serviços de computação em nuvem com IA, Lambda, está em negociações para uma rodada de financiamento de até US$ 3 bilhões, preparando-se para uma possível oferta pública inicial (IPO) no próximo ano.

智通财经2026/08/25 13:31
A guerra pelo capital de capacidade de IA se intensifica! “Nova nuvem” Lambda, vinculada à Nvidia, planeja levantar US$ 3 bilhões para expandir sua presença em computação e preparar um IPO.

Queda no lucro não ofusca o impulso central! Banco de Montreal (BMO.US) supera expectativas no lucro ajustado do terceiro trimestre e planeja recompra de até 25 milhões de ações

Prejudicado por fatores pontuais como a venda dos negócios de transporte e financiamento de fornecedores, o lucro líquido do Banco de Montreal no terceiro trimestre apresentou queda em relação ao ano anterior. No entanto, o lucro por ação ajustado e a receita superaram as expectativas do mercado, e o lucro antes de provisão e impostos de todos os segmentos atingiu recordes. Ao mesmo tempo, o banco anunciou planos de iniciar um programa de recompra de até 25 milhões de ações no terceiro trimestre.

智通财经2026/08/25 13:11
Queda no lucro não ofusca o impulso central! Banco de Montreal (BMO.US) supera expectativas no lucro ajustado do terceiro trimestre e planeja recompra de até 25 milhões de ações

A reunião de Jackson Hole se torna o momento de "caminhar na corda bamba" para Waller: precisa rebater críticas e, ao mesmo tempo, esconder pistas sobre políticas.

O primeiro discurso importante do presidente do Federal Reserve, Kevin Walsh, será um teste para seu estilo de comunicação mais conciso, já que ele foi criticado por não ser franco o suficiente em questões econômicas.

智通财经2026/08/25 13:01
A reunião de Jackson Hole se torna o momento de "caminhar na corda bamba" para Waller: precisa rebater críticas e, ao mesmo tempo, esconder pistas sobre políticas.

Mudança drástica na direção dos investimentos de Wall Street! Enquanto os rendimentos dos títulos de longo prazo disparam, grandes saídas dos investidores de tecnologia; bancos, ouro e mineração de cobre disputam a liderança.

Na semana passada, o setor de tecnologia da informação foi o tema de investimento com o maior volume líquido de vendas no mercado de ações dos Estados Unidos, superando de longe outros setores. Além disso, essa grande venda foi quase completamente impulsionada por forças compradoras adotando posições de venda.

智通财经2026/08/25 12:46
Mudança drástica na direção dos investimentos de Wall Street! Enquanto os rendimentos dos títulos de longo prazo disparam, grandes saídas dos investidores de tecnologia; bancos, ouro e mineração de cobre disputam a liderança.