Detrás de la reducción de Rubin, el mito de CUDA de Nvidia está perdiendo fuerza
Dos noticias aparentemente desconectadas se concretaron en la última semana de junio.
El 25 de junio, OpenAI lanzó su primer chip de inferencia de IA desarrollado internamente, Jalapeño, realizado junto a Broadcom en solo 9 meses desde el diseño hasta la producción de prototipos—el mayor comprador global de GPU empezó a fabricar sus propios chips.
El 30 de junio, el instituto de investigación de semiconductores SemiAnalysis anunció públicamente en plataformas sociales: la versión original de 4 chips de Rubin Ultra de Nvidia fue cancelada apenas tres meses después de su lanzamiento en GTC 2026. La nueva versión tiene casi la mitad de rendimiento. "Todo esto ocurre en el contexto de", agregó la entidad, "la cuota de mercado de Nvidia está siendo erosionada".
Y ya el año pasado, los medios reportaron que el ingreso anualizado de Anthropic se acercaba a 7.000 millones de dólares, y su Claude Code generó 500 millones en ingresos anualizados en solo dos meses tras su presentación. El soporte de cómputo que impulsa todo esto ya no es solo de Nvidia—Google TPU se encarga del entrenamiento, Amazon Trainium de la inferencia, y las GPU de Nvidia quedan como la tercera opción para "exploración de investigación".
Tres noticias, apuntando a una sola cuestión: el foso de CUDA—la barrera competitiva más fuerte y mitificada de Nvidia—está empezando a mostrar grietas.
Del 87% al 75%, la "insustituibilidad" de Nvidia se desmorona
Veamos algunos números.
Según estimaciones de Silicon Analysts basadas en los estados financieros de Nvidia/AMD y datos de asignación de capacidad de TSMC, el trayecto de cuota de mercado de Nvidia en el sector de aceleradores de IA (por ingreso) es el siguiente:

Se observa que los ingresos de Nvidia siguen creciendo—de 15.000 millones a 150.000 millones, diez veces en cuatro años. Pero la cuota cayó del pico del 87% al 75%, lo que implica que cada vez una porción más grande del mercado incremental está siendo capturada por otros.
Quienes se llevan esa porción no son competidores individuales, sino una competencia multifocal: Google TPU, Amazon Trainium, Microsoft Maia, Meta MTIA, la XPU personalizada de Broadcom—y el recién llegado OpenAI.
El CEO de Broadcom, Chen Fuyang, reveló en la llamada de resultados del primer trimestre fiscal de 2026 una cifra no divulgada previamente: el ingreso anualizado de semiconductores de IA de Broadcom llegó a 8.400 millones, un crecimiento anual del 106%, y la meta anual apunta a entre 40.000 y 50.000 millones. La empresa ya firmó contratos con seis clientes de gran escala para personalizar chips de IA, siendo OpenAI el sexto.
Es decir, las principales empresas globales de computación en la nube y de IA están eligiendo el mismo camino: fabricar sus propios chips.
La elección de Anthropic
Si los datos de cuota de mercado son solo estadísticas frías, el caso de Anthropic es un "manual vivo" de la desinvidiazación.
Anthropic es una de las IA más dinámicas del mundo. Su ingreso anualizado ronda los 7.000 millones de dólares (solo 1.000 millones el mismo periodo de 2025), prestando servicios a más de 300.000 clientes empresariales y acumulando un crecimiento de 7 veces entre grandes clientes. Claude Code, en solo dos meses, generó 500 millones en ingresos anualizados, catalogado por Anthropic como "el producto de más rápido crecimiento de la historia".
Todo esto se sostiene sobre una base de cómputo descrita por el CFO de Anthropic, Krishna Rao, como una "estrategia de computación única" en tres plataformas:

Fijate en la última columna. Las GPU de Nvidia quedan en tercer lugar, no empatan ni son una "opción alternativa", sino la más pequeña de las tres alternativas.
No se trata de una compañía pequeña con falta de recursos que usa alternativas baratas por necesidad. Es la segunda IA más grande del mundo, utilizando chips no-Nvidia para impulsar su producto de más rápido crecimiento, en ambiente de producción.
SemiAnalysis resaltó este punto en su publicación del 30 de junio: "Una parte sustancial de la inferencia de Claude Code corre en Trainium y el entrenamiento en TPU. Hace solo un año, la escala alcanzada por TPU y Trainium, y que el foso de CUDA fuera lentamente erosionado, parecía inimaginable".
¿Por qué Anthropic elige esto? No es que TPU y Trainium sean superiores al H100—en rendimiento absoluto aún hay diferencias. Pero para ciertos escenarios, los chips personalizados ofrecen mucho mejor relación costo-beneficio que las GPU genéricas. TPU para entrenamiento, porque Google ofrece contratos multimillonarios y el compromiso de entregar cien millones de chips. Trainium para inferencia, porque AWS es su proveedor principal y ya invirtió 8.000 millones, y el clúster Rainier corre completamente sobre Trainium 2, sin sobreprecio de GPU.
Amazon apuesta fuerte por Trainium. Según su balance del primer trimestre fiscal 2026, la línea Trainium ya tiene compromisos de ingreso superiores a 225.000 millones de dólares, con clientes como OpenAI y Anthropic. Los ingresos de IA de AWS superan los 15.000 millones, y la mayoría de los servicios de inferencia Bedrock corren sobre Trainium.
La palabra clave aquí no es "performance", sino "costo". Realizar inferencia quema dinero cada día. Cada respuesta de ChatGPT, cada devolución de un API, todo es un GPU ejecutándose y consumiendo electricidad. Anthropic usa Trainium para inferencia no para correr más rápido, sino para hacer más operaciones por cada dólar gastado.
Tres vías de erosión: ¿por dónde se rompe el foso de CUDA?
El foso de CUDA es visto como la defensa más sólida de Nvidia porque construyó un ecosistema cerrado "hardware-software-desarrolladores":
- Acumulación de 20 años, más de 4 millones de desarrolladores
- Todos los frameworks de ML optimizan primero para CUDA
- Librerías como cuDNN, TensorRT, NCCL, generan fuerte dependencia
- El costo de cambiar se mide en años y cientos de millones de dólares
Pero la competencia de chips de IA en 2026 ya no es "hacer un GPU 10% más rápido que H100"—ese ataque frontal no lo gana nadie. La erosión llega desde tres frentes:
Vía de erosión uno: ASIC propios—no atacan todo el campo, solo la parte más rentable de la inferencia
Este es el camino más letal. La lógica no es "hacerlo mejor que Nvidia", sino "no necesito todo lo que ofrece una GPU, solo quiero inferencia".
Un H100 de Nvidia hace: render gráfico, cálculo científico, entrenamiento de IA, inferencia de IA, codificación de video... Un Jalapeño solo: ejecutar los modelos de OpenAI para inferencia. El primero es una navaja suiza, el segundo un hacha para un tipo específico de madera—en tareas concretas, el hacha es mucho mejor y mucho más barata.
La orientación de OpenAI Jalapeño es muy precisa: no compite con Nvidia en versatilidad, sino que se especializa en inferencia—el escenario que consume miles de millones de APIs diarias y quema cientos de millones de dólares al año—y lo lleva al extremo. OpenAI tiene como objetivo reducir el costo de inferencia entre un 30% y 50%. En un contexto que gasta millones diarios en inferencia, esto implica ahorros de cientos de millones anuales en pura ganancia.
Y OpenAI no es el primero. Microsoft Maia 200 (presentado en enero 2026), Google TPU Ironwood (séptima generación, primer enfoque en inferencia), Amazon Trainium 3—las cuatro grandes de la nube presentan chips de inferencia propios. Se suman Meta MTIA y los chips personalizados de Apple, de las siete tech más grandes solo una sigue comprando pero no fabricando—y está en camino.
Vía de erosión dos: AMD—de "existente" a "reemplazo confiable"
Los ingresos por GPU de IA de AMD pasaron de menos de 1.000 millones en 2022 a más de 15.000 millones estimados para 2026, más de 15 veces en cuatro años.
El punto de inflexión fue la serie MI400. Basada en arquitectura CDNA5, memoria HBM4 de 432GB, 19.6 TB/s de ancho de banda, se espera producción masiva para el segundo semestre 2026. S&P Global estima que MI400 aportará 7.200 millones en ingresos, el 25% de la división de data center de AMD.
Aún más importante es el mensaje de los clientes. Meta firmó un compromiso de compra de hasta 6 gigavatios con AMD—el mayor orden de chips de IA en su historia y señal de que los grandes clientes apuestan por varios proveedores.
Las limitaciones de AMD quedan claras: solo alrededor del 11% de la capacidad CoWoS de TSMC, mientras Nvidia concentra más del 60%. La limitación de capacidad impide que AMD compita en volumen con Nvidia a corto plazo. Pero ser "el segundo proveedor confiable" ya desmonta la narrativa de "No hay alternativa a Nvidia".
Vía de erosión tres: desacoplamiento del software—Triton, JAX y el futuro "CUDA-Free"
Este camino suele pasar desapercibido, pero es el más peligroso a largo plazo.
La dependencia de CUDA se basa en un hecho simple: los investigadores de IA programan en PyTorch, que corre sobre CUDA. Pero, ¿y si PyTorch deja de depender de CUDA?
Esto ya está sucediendo. El equipo de PyTorch comprobó que usando el compilador Triton se puede lograr inferencia "CUDA-Free"—corriendo el modelo Llama 3 en H100 y A100, la velocidad de tokens generados por Triton rivaliza con CUDA. En febrero de 2026, Triton lanzó soporte multi-backend, permitiendo compilar un mismo código para distintos hardwares—GPU de AMD, Intel e incluso ASICs varios.
El framework JAX de Google va más allá. Desde su diseño es independiente del hardware—el mismo código corre en TPU, GPU y hasta CPU. Anthropic eligió TPU para entrenamiento, en buena medida porque JAX permite migrar de plataforma sin reescribir código de modelos.
¿Qué implica el desacoplamiento del software? Que la nueva generación de investigadores de IA podrá entrenar modelados de vanguardia sin escribir una sola línea de código CUDA. Cuando los desarrolladores ya no están atados al ecosistema CUDA, el "tengo que comprar Nvidia" se convierte en "puedo elegir Nvidia".
Cancelación de Rubin Ultra: el punto de inflexión de los límites físicos
Volvamos a la noticia inicial. Rubin Ultra de cuatro chips fue cancelado a los tres meses de su lanzamiento, según SemiAnalysis "los problemas de ejecución en manufactura están causando pérdida de mercado".
La razón técnica no es complicada. El Rubin Ultra original planeaba integrar 4 chips de cómputo y 16 módulos de memoria HBM4E en un solo encapsulado, usando el proceso CoWoS-L de TSMC. Pero Global Semi Research reporta que la configuración de 4 chips genera curvatura en el sustrato de encapsulamiento—el sustrato se doblaba de múltiples formas y los chips no lograban contacto completo. La transmisión de señales falla y el chip no funciona.
La alternativa técnica de TSMC, CoPoS (encapsulado a nivel de panel), estará disponible recién a fines de 2028. Nvidia no puede esperar—por eso el nuevo Rubin Ultra volvió a diseño de 2 chips, con casi la mitad de rendimiento.
El impacto de esto es más simbólico que real en el negocio.
Nvidia seguirá vendiendo todo Rubin Ultra que pueda fabricar. Pero "retroceder de 4 a 2 chips" revela un problema más profundo: la velocidad de iteración de productos de Nvidia está chocando contra límites físicos. Chips más grandes→ encapsulados más complejos→ mayor tasa de defectos→ más demora o menor rendimiento. Es una curva que no se puede estirar indefinidamente.
Al mismo tiempo, los competidores están sorteando esta pared física de otro modo: no hacen chips más grandes, hacen chips más especializados.
Grieta en el poder de precios
La verdadera parte inamovible del foso de Nvidia no es el ecosistema CUDA sino la manufactura. Tiene el 60% de la capacidad avanzada de encapsulado CoWoS de TSMC. Es una barrera física, no de software. Los competidores pueden escribir mejores frameworks o diseñar ASICs más eficientes, pero para igualar el volumen de Nvidia tienen que pasar la barrera de capacidad de TSMC.
Pero ahí está el problema: la barrera de manufactura depende de una fundición de chips externa. No es un activo que Nvidia controla directamente.
Y el 88% de margen bruto de Nvidia—el costo de H100 es de $3.320, el precio de venta $28.000—se basa en el supuesto de que los clientes no pueden irse. Si ese supuesto pasa de "no pueden irse" a "la opción más coste/beneficio", el poder de precios deja de ser absoluto.
Anthropic demuestra otra vía: no busca el mejor chip, sino el más adecuado. TPU para entrenamiento en vez de GPU, no porque sea más rápido, sino porque Google ofrece suficiente cantidad y buen precio. Trainium para inferencia en vez de GPU, no porque sea más potente, sino porque AWS es accionista estratégico y Project Rainier elude el sobreprecio de GPU genérico.
Cuando la segunda mayor IA del mundo reduce la GPU a ser la menor de las tres plataformas de cómputo, "hay que comprar Nvidia" ya no es ley escrita.
Nvidia sigue siendo lo mejor. Ninguna IA líder la abandona completamente—Anthropic mantiene GPU para "exploración de frontera", Jalapeño de OpenAI solo hace inferencia, Meta MTIA cubre solo recomendación y moderación de contenido.
Pero pasar de "solo Nvidia" a "Nvidia es lo más caro, voy primero con lo barato" marca la pérdida de poder de precios.
El mercado ya empieza a recalcular ese escenario posible. Cada informe bajista de SemiAnalysis este año movió drásticamente el sector: la noticia de recorte de SOCAMM en junio hizo que Micron cayera 13% en un día, la disputa por la demora de CPO el 10 de junio obligó a directivos de Nvidia a aclarar, la cancelación de Rubin Ultra el 30 de junio volvió a encender la discusión.
Detrás de estas fluctuaciones, el mercado intenta responder una pregunta que antes no hacía falta: si CUDA deja de ser insustituible, ¿cuánto vale Nvidia?
Descargo de responsabilidad: El contenido de este artículo refleja únicamente la opinión del autor y no representa en modo alguno a la plataforma. Este artículo no se pretende servir de referencia para tomar decisiones de inversión.
También te puede gustar



¿La intervención conjunta de Estados Unidos y Japón sólo duró un día? Las declaraciones de Kazuo Ueda con tono agresivo no lograron calmar el mercado y el yen perdió impulso de recuperación, regresando al nivel de 160.
El Banco de Japón mantuvo sin cambios las tasas de interés y el gobernador Kazuo Ueda tampoco ofreció un nuevo respaldo para el yen, lo que provocó que la cotización del yen fluctuara entre subidas y bajadas.

