Apuntando al mercado de inferencia de IA de baja latencia, Nvidia (NVDA.US) Groq 3 LPX entra en producción masiva; los primeros sistemas se desplegarán en NEBIUS (NBIS.US).
Nvidia anunció el lunes que el sistema a nivel de rack Groq 3 LPX ya ha entrado en la fase de producción en masa, lo que marca que, tras la adquisición de activos relacionados con Groq por aproximadamente 20 mil millones de dólares el año pasado, esta tecnología de inferencia de IA de baja latencia entra oficialmente en la etapa de comercialización.
Según reporta la app financiera Zhìtōng Caijing, NVIDIA (NVDA.US) anunció el lunes que el sistema Groq 3 LPX a nivel rack ha entrado en etapa de producción masiva, marcando la comercialización de esta tecnología de inferencia de IA de baja latencia tras la adquisición, el año pasado, de activos relacionados a Groq por aproximadamente 20 mil millones de dólares. Los primeros sistemas serán implementados por el proveedor de servicios de cómputo en la nube de IA, NEBIUS (NBIS.US), y se prevé su lanzamiento para finales de este año.
Dion Harris, director sénior de NVIDIA, declaró a los medios que Groq 3 LPX será implementado junto a los procesadores centrales Vera y los procesadores gráficos Rubin de NVIDIA en los centros de datos de Nebius.
La rápida producción en masa de los productos Groq demuestra que, conforme las aplicaciones de IA pasan del entrenamiento de modelos a su despliegue real, la inferencia de IA de baja latencia se convierte en un nuevo mercado clave en el que NVIDIA compite agresivamente. Esto es especialmente relevante en aplicaciones como agentes inteligentes de IA y programación asistida por IA, donde los modelos deben generar contenido de manera continua y veloz, reduciendo el tiempo de espera para el usuario.
En diciembre del año pasado, NVIDIA gastó alrededor de 20 mil millones de dólares para adquirir activos de la startup de chips de IA Groq, en la mayor adquisición de su historia.
Una de las principales características de la arquitectura de los chips Groq es la integración interna de 500MB de SRAM de alta velocidad, lo que reduce los cuellos de botella en la transferencia de datos por el acceso a memoria tradicional, incrementando así la velocidad de respuesta en los procesos de inferencia de modelos de IA.
A diferencia de los principales chips GPU de NVIDIA, que son fabricados por TSMC (TSM.US), los chips Groq son fabricados por Samsung.
Actualmente, NVIDIA integra 256 chips Groq 3 en un solo rack LPX. Según datos de pruebas de referencia de Artificial Analysis citados por NVIDIA, el sistema Groq 3 LPX puede generar aproximadamente 3400 tokens por segundo.
En el caso de la IA generativa, un token puede entenderse como la unidad básica de procesamiento y generación de texto por un modelo. Una mayor velocidad de generación de tokens por segundo significa que la IA puede responder más rápidamente a las solicitudes de los usuarios, lo cual es fundamental en aplicaciones sensibles a la latencia como la programación asistida por IA y los agentes inteligentes en tiempo real.
Harris señaló que, para las empresas de cómputo en la nube que ofrecen servicios de inferencia de IA, una menor latencia se traduce en la posibilidad de brindar servicios premium a clientes con mayores exigencias de velocidad de respuesta.
Sin embargo, los chips Groq no están diseñados para reemplazar las GPU tradicionales de NVIDIA.
Las GPU siguen siendo el núcleo de la infraestructura de cómputo de IA en la actualidad: no solo permiten entrenar modelos de IA, sino también ejecutar tareas de inferencia, ofreciendo además gran versatilidad para adaptarse a diferentes modelos y arquitecturas técnicas.
Los chips de baja latencia como Groq, en cambio, se enfocan en tareas específicas del proceso de inferencia de IA, especialmente en la etapa de “decodificación” durante la generación de contenido por parte del modelo.
Harris comentó: “Esto no se trata de reemplazar las GPU, sino de utilizar el procesador más adecuado en precio y rendimiento para cada parte de la carga de trabajo”.
Esto implica que NVIDIA está buscando crear una arquitectura computacional de IA más segmentada: las CPU Vera y GPU Rubin seguirán gestionando tareas de IA de uso general, mientras que los chips Groq estarán optimizados para cargas de inferencia altamente sensibles a la latencia.
A medida que la industria de la IA pasa del entrenamiento a gran escala de modelos hacia una rápida expansión de la demanda de inferencia, la competencia en el mercado de inferencia de baja latencia está en aumento.
AMD (AMD.US) anunció, a principios de este año, que integrará sus sistemas de IA a nivel rack con los chips de Cerebras (CBRS.US), enfocándose también en la inferencia de IA de baja latencia.
La relevancia de este sector crece a medida que se popularizan aplicaciones como la programación asistida por IA. Según el informe, el nuevo modo Ultrafast anunciado por OpenAI promete alcanzar hasta 750 tokens por segundo, con soporte de cómputo de fondo provisto por Cerebras.
Por comparación, los datos de referencia citados por NVIDIA muestran que Groq 3 LPX puede alcanzar los 3400 tokens por segundo. Sin embargo, diferentes sistemas pueden haber sido testeados bajo condiciones y escenarios distintos, por lo que estas cifras no siempre permiten comparar el rendimiento de manera directa.
Mientras tanto, NVIDIA está acelerando las entregas del sistema Vera Rubin, el cual entró en fase de producción a principios de este año.
En marzo, el CEO de NVIDIA, Jensen Huang, al presentar Vera Rubin y Groq 3 LPX, estimó que las ventas acumuladas desde los actuales chips Blackwell hasta la nueva generación de sistemas Vera Rubin podrían llegar a un billón de dólares para 2027.
Huang también reveló que, en los espacios de centro de datos dedicados a aplicaciones de programación de IA, planea asignar aproximadamente una cuarta parte a chips Groq, destinando el resto a sistemas Vera Rubin.
Esta proporción pone de manifiesto la importancia estratégica que NVIDIA otorga al mercado de inferencia de baja latencia. Con el auge de agentes inteligentes de IA, programación asistida y aplicaciones generativas en tiempo real, la velocidad de inferencia se vuelve un indicador clave en la competencia entre empresas de cloud computing y desarrolladores de IA.
La entrada en producción masiva de Groq 3 LPX marca el paso de NVIDIA de ser un proveedor de chips de IA enfocado principalmente en GPU a expandir su presencia hacia arquitecturas específicas para diferentes cargas de trabajo de IA.
El mercado ahora prestará atención al desempeño financiero más reciente de NVIDIA. La empresa publicará su informe de resultados este miércoles, y además de la demanda por Blackwell y Vera Rubin, el progreso comercial de la inferencia de IA y Groq podría captar la atención de nuevos inversores.
Descargo de responsabilidad: El contenido de este artículo refleja únicamente la opinión del autor y no representa en modo alguno a la plataforma. Este artículo no se pretende servir de referencia para tomar decisiones de inversión.
También te puede gustar
¡La batalla de capital por la potencia de cómputo en IA se intensifica! La "nueva nube" Lambda, respaldada por Nvidia, planea recaudar 3.000 millones de dólares para expandir su red de cómputo y preparar su salida a bolsa.
El proveedor de servicios de computación en la nube con inteligencia artificial, Lambda, está negociando una ronda de financiamiento de hasta 3.000 millones de dólares para prepararse para una posible oferta pública inicial el próximo año.

¡La caída de las ganancias netas no puede ocultar el impulso central! El Banco de Montreal (BMO.US) supera las expectativas de ganancias ajustadas en el tercer trimestre y planea iniciar un programa de recompra de hasta 25 millones de acciones
Debido al impacto negativo de la venta de negocios de transporte y financiamiento a proveedores, el beneficio neto del Banco de Montreal en el tercer trimestre registró una caída interanual. Sin embargo, las ganancias ajustadas por acción y los ingresos superaron las expectativas del mercado, y las utilidades antes de provisiones e impuestos de todos los segmentos alcanzaron niveles récord. Al mismo tiempo, el banco anunció que planea iniciar un programa de recompra de hasta 25 millones de acciones durante el tercer trimestre.

La reunión de Jackson Hole se convierte en el momento de "caminar por la cuerda floja" para Waller: debe refutar las críticas pero también ocultar las pistas sobre las políticas.
El primer discurso importante del presidente de la Reserva Federal, Kevin Walsh, es una prueba para su estilo de comunicación conciso, ya que ha sido criticado por no ser lo suficientemente directo al abordar temas económicos.

¡El rumbo de las inversiones en Wall Street cambia drásticamente! Mientras los rendimientos de los bonos a largo plazo aumentan, los alcistas tecnológicos hacen una "gran retirada" y bancos, oro y minas de cobre compiten por el protagonismo.
La semana pasada, el sector de tecnología de la información fue el tema de inversión con el mayor volumen neto de ventas en el mercado de acciones estadounidense, superando ampliamente a otros subsectores, y esta venta masiva fue impulsada casi en su totalidad por la presión vendedora de los tenedores largos.

