Nvidia: desde los modelos grandes de "entrenamiento único" hacia los agentes de "mejora post-entrenamiento", la demanda de potencia de cómputo está cambiando
Nvidia está revolucionando la lógica de monetización de la computación. Su nueva plataforma Vera Rubin introduce por primera vez el indicador de "inteligencia por dólar", apostando al auge de la inteligencia artificial con agentes inteligentes. La demanda de entrenamiento post-modelo se convierte en una necesidad constante, y el consumo de GPU solo representa un cuarto del de la generación anterior. Los grandes actores ya están en fila para migrar, abriendo una nueva ola de crecimiento en el mercado de la computación.
Nvidia está ampliando la propuesta de valor central de su próxima generación de la plataforma Vera Rubin desde el costo de inferencia hasta la eficiencia en el entrenamiento de modelos, apostando por el indicador "inteligencia por dólar", que prevé que la demanda de cómputo para el post-entrenamiento se convertirá en el núcleo en la era de la AI de agentes.
Nvidia explica en su blog oficial que, con el auge de la Agentic AI, el post-entrenamiento de modelos ha evolucionado de ser una etapa final única a convertirse en una carga de trabajo central en constante ciclo. A diferencia de los modelos generativos tradicionales, los modelos de agentes requieren planificar, utilizar herramientas y corregirse de manera autónoma durante su ejecución, en ambientes que pueden cambiar cada semana; esto hace que la demanda de cómputo para el post-entrenamiento se acumule continuamente. Nvidia afirma que la plataforma Vera Rubin fue diseñada específicamente para esta carga de trabajo colaborativa, permitiendo entrenar modelos de máxima escala con solo una cuarta parte de la cantidad de GPUs que requiere la generación Blackwell.
Esta declaración se relaciona directamente con la lógica de ventas de cómputo de Nvidia: el ciclo de post-entrenamiento nunca termina, lo que significa que la necesidad de clústeres de GPU por parte de los clientes pasará de ser por proyecto a transformarse en un requerimiento constante, ampliando el tamaño potencial del mercado. Empresas como Prime Intellect, Perplexity y Together AI, entre otras, que ya operan cargas de post-entrenamiento en plataformas de Nvidia, han anunciado planes de migrar o expandirse hacia Vera Rubin.
El post-entrenamiento se convierte en el motor clave de cómputo en la era de los agentes
Nvidia expone sistemáticamente en su blog la importancia estratégica del post-entrenamiento. La fase de pre-entrenamiento otorga al modelo fluidez lingüística, mientras que la verdadera "inteligencia"—incluyendo escribir código, planificar tareas multietapas, usar herramientas de búsqueda y recuperarse de errores—se forma durante el post-entrenamiento.

El post-entrenamiento utiliza técnicas de aprendizaje por refuerzo (RL): el modelo genera intentos para tareas (propagación hacia adelante), estos intentos reciben una puntuación y luego se actualizan los pesos del modelo (propagación hacia atrás), mejorando gradualmente tras millones de iteraciones. Según Nvidia, este proceso requiere un consumo masivo de cómputo, generando miles de rollouts en ambientes paralelos mientras mantiene aceleradores funcionando a plena carga.
Nvidia posiciona la "inteligencia por dólar" como un indicador superior al "costo por token": el primero mide la eficiencia operativa en fábricas de inferencia, el segundo evalúa si la inversión necesaria para construir y mantener un modelo digno de ser desplegado es rentable. Ambos se relacionan—reducir el costo por token disminuye también el costo de construir la inteligencia del modelo, mientras que mayor inteligencia de modelo eleva el valor de servicio por cada token.
Nemotron Ultra ofrece benchmark verificable de post-entrenamiento
Para respaldar lo anterior, Nvidia reveló detalles del post-entrenamiento para su modelo de pesos abiertos Nemotron 3 Ultra. Este modelo cuenta con 550 mil millones de parámetros, arquitectura de mezclas de expertos (MoE) y realiza su post-entrenamiento en el marco NeMo RL.
En la benchmark de programación real SWE-bench Verified, Nemotron 3 Ultra logró una puntuación de 71,7%; es decir, en defectos presentes en proyectos open source, siete de cada diez puede generar soluciones de reparación válidas que superan las pruebas internas del proyecto. Nvidia señala que este resultado es verificable y el esquema de post-entrenamiento se encuentra totalmente abierto.

Nvidia también indica que la plataforma Blackwell ya ha hecho viable económicamente el post-entrenamiento frecuente requerido en la era de agentes gracias a la reducción de costos por ejecución, y que Vera Rubin llevará la tendencia aún más lejos—permitiendo más rollouts, ambientes paralelos y ciclos de post-entrenamiento ininterrumpidos.
Clientes destacados validan la capacidad de la plataforma y la migración empieza a tomar forma
Varias empresas que ya operan cargas de post-entrenamiento en la plataforma Nvidia han divulgado especificaciones técnicas, junto con intenciones de migrar a Vera Rubin.
Prime Intellect mantiene el post-entrenamiento de modelos open source punta en la plataforma Blackwell y utiliza NVIDIA Dynamo para la orquestación de inferencia. La empresa ya integró infraestructura sandbox con CPUs NVIDIA Vera, y en pruebas comparativas con arquitecturas x86, el throughput promedio de Vera CPU fue un 30% superior en cargas de trabajo RL sandbox reales. Prime Intellect planea expandir el entorno RL y acelerar el ciclo de entrenamiento a inferencia con Vera Rubin.
La pila de post-entrenamiento RL de Perplexity corre asincrónicamente en cientos de GPUs Nvidia; su motor de transferencia de pesos basado en RDMA permite sincronizar modelos de billones de parámetros entre nodos de entrenamiento e inferencia en solo dos segundos. El modelo Qwen3 235B post-entrenado luego fue desplegado en el sistema NVIDIA GB200 NVL72.
Together AI ofrece capacidades de post-entrenamiento como servicio, abarcando fine-tuning supervisado, aprendizaje por refuerzo y optimización directa de preferencia, entregados vía API y SDK; actualmente corre en la plataforma Nvidia y señala estar explorando la integración con Vera Rubin.
Descargo de responsabilidad: El contenido de este artículo refleja únicamente la opinión del autor y no representa en modo alguno a la plataforma. Este artículo no se pretende servir de referencia para tomar decisiones de inversión.
También te puede gustar
¿El gran bajista está perdiendo la paciencia? Burry critica ferozmente la financiación de 500 mil millones de Nvidia, calificándola de "ingeniería financiera de 2008", mientras el mercado respalda con dinero real la demanda de capacidad de cómputo de la IA.
¿Son realmente 500 mil millones de dólares un “truco financiero” o el financiamiento de una revolución industrial impulsada por la IA? Con la disminución de los diferenciales de crédito y el vertiginoso ascenso de Neocloud, el capital, por ahora, elige confiar en Jensen Huang.

¿Las ganancias excesivas se convierten en "veneno"? La bolsa estadounidense muestra una paradoja de crecimiento, y Wall Street advierte que las valoraciones en máximos podrían repercutir en el mercado en cualquier momento.
Para el mercado de acciones de Estados Unidos, la última tormenta invisible proviene de una razón bastante inesperada: el crecimiento de las ganancias es, de hecho, demasiado fuerte.

La inflación subyacente de EE.UU. en julio iguala el nivel más bajo en más de cinco años; la alerta de alza de tasas de la Reserva Federal se disipa por ahora, pero la guerra de precios del petróleo y la caída de los salarios están gestando la próxima tormenta.
El índice de precios al consumidor (CPI) de Estados Unidos en julio mostró un desempeño moderado y la tasa de inflación subyacente cayó a su nivel más bajo en más de cinco años, lo que en cierta medida alivió la urgencia de que la Reserva Federal suba las tasas de interés en la reunión de septiembre. Sin embargo, cabe destacar que los datos salariales publicados en el mismo período mostraron que el poder adquisitivo real de los trabajadores sigue disminuyendo. Sumado a esto, los conflictos geopolíticos en Medio Oriente continúan elevando los precios de la energía, por lo que las perspectivas de inflación en Estados Unidos siguen siendo inciertas.

Ondo tomó una decisión

