Mientras Rubin es muy esperado, Nvidia sigue optimizando Blackwell y la eficiencia energética del GB200 se cuadruplicó en tres meses.
Nvidia está extendiendo la vida útil de la plataforma Blackwell mediante optimización continua de la pila de software, mientras prepara el despliegue a gran escala de la próxima arquitectura Rubin.
En el contexto de la rápida implementación de la nueva plataforma Rubin, Nvidia reveló que en tan solo tres meses, multiplicó por cuatro el rendimiento computacional por megavatio (TPS/MW) del GB200 NVL72 al ejecutar el modelo DeepSeek R1 0528. Este logro es el resultado de 38 optimizaciones importantes completadas en cuatro meses, respaldadas por más de 250 mil pruebas de configuración simulada y un total de 1,4 millones de horas de GPU de validación.
Asimismo, la plataforma GB300 "Blackwell Ultra" sigue batiendo récords en benchmarks de entrenamiento de IA. Con 256 tarjetas, el GB300 NVL72 logró un récord histórico de 1648 TFLOPs por GPU en la tarea de preentrenamiento del modelo DeepSeek-V3 671B, lo que representa un aumento de aproximadamente tres veces respecto a los 606 TFLOPs del GB200; además, este indicador ha aumentado 1,5 veces en los últimos seis meses.
Gran salto en eficiencia energética del GB200, optimización aplicable al 90% de los modelos
Nvidia indicó que las optimizaciones realizadas sobre la plataforma GB200 NVL72 permitieron cuadruplicar el rendimiento computacional por megavatio en tres meses al ejecutar DeepSeek R1 0528 (configuración 1K entrada/1K salida).

Este incremento fue posible gracias a 38 iteraciones de optimización completadas en cuatro meses, evaluadas mediante más de 250 mil pruebas simuladas y 1,4 millones de horas de GPU de pruebas reales. Nvidia destacó que más del 90% de las mejoras pueden reutilizarse en distintos modelos de su portafolio de productos de IA, y no están hechas a medida para una tarea específica.
Esto significa que los clientes de centros de datos actuales pueden obtener importantes beneficios en eficiencia energética solo actualizando el software, sin necesidad de cambiar hardware—lo cual tiene gran valor económico directo para empresas y proveedores de nube a gran escala, sensibles al costo computacional.
GB300 marca nuevos récords de entrenamiento, mejora de 1,5 veces en seis meses
En el entrenamiento de IA, el GB300 NVL72 también muestra una performance contundente. Con 256 tarjetas y utilizando Megatron Core para preentrenar el modelo DeepSeek-V3 671B, el GB300 NVL72 alcanzó 1648 TFLOPs por GPU, triplicando el rendimiento del GB200 y estableciendo el mayor récord global en esta tarea.

Lo notable es que este resultado no representa un límite fijo de hardware. Bajo el marco Megatron Core, el rendimiento del GB300 NVL72 creció de 1088 TFLOPs/GPU en noviembre de 2025 a 1648 TFLOPs/GPU en junio de 2026, mejorando 1,5 veces en seis meses.

En la optimización colaborativa de frameworks AI líderes, la alianza de Nvidia con las comunidades PyTorch y JAX produjo importantes mejoras. En TorchTitan (stack de entrenamiento nativo de PyTorch), el GB300 NVL72 multiplicó por seis el rendimiento de entrenamiento para DeepSeek-V3 671B comparado con la configuración base sin optimizar, pasando de 199 TFLOPs/GPU a 1197 TFLOPs/GPU. En JAX, el salto fue aún mayor: en julio de 2026, el rendimiento alcanzó 4082 Tokens/s por GPU, equivalentes a 1025 TFLOPs/GPU, multiplicando por diez la cifra de enero de 2026 (418 Tokens/s).

Eficiencia de escalabilidad cercana al límite teórico, la red de 800 Gb/s es clave
La eficiencia de escalabilidad en entornos de entrenamiento masivo es uno de los factores centrales para la utilidad de la infraestructura AI. Nvidia reveló que, entre 256 y 1024 tarjetas, el GB300 NVL72 mantiene eficiencia de escalabilidad casi al límite teórico en los tres principales frameworks: Megatron Core alcanza 98,5%, TorchTitan y JAX llegan al 97%.
Nvidia atribuye este desempeño a los chips de red Scale-Out de 800 Gb/s integrados en los racks NVL72. La interconexión de alta velocidad es crucial para reducir los costos de comunicación en entrenamientos distribuidos, y constituye la base fundamental para la alta eficiencia mencionada en todos los frameworks.

Despliegue acelerado de la plataforma Rubin, las optimizaciones de Blackwell continúan
Mientras se anuncian estos avances, la próxima generación Vera Rubin de Nvidia ya está siendo desplegada globalmente. Según informes, Vera Rubin NVL72 mejora el rendimiento de tokens en casi diez veces respecto a Blackwell: mientras el GB200 NVL72 procesa unos 80.000 Tokens/s, el Vera Rubin NVL72 alcanza 800.000 Tokens/s bajo el mismo consumo de 150MW.
No obstante, la plataforma Blackwell ya está instalada en numerosos centros de datos alrededor del mundo. Nvidia sigue la misma estrategia que con la generación Hopper—impulsando el nuevo hardware, pero optimizando continuamente el software para maximizar el potencial de los equipos ya desplegados. Esto no solo extiende el ciclo de retorno de inversión para los clientes actuales, sino también refuerza la fidelidad de la plataforma de Nvidia en el ecosistema de infraestructura AI. En términos de mercado, con avances paralelos en Blackwell y Rubin, Nvidia está construyendo un canal de defensa software difícil de superar por la competencia en el corto plazo.
Descargo de responsabilidad: El contenido de este artículo refleja únicamente la opinión del autor y no representa en modo alguno a la plataforma. Este artículo no se pretende servir de referencia para tomar decisiones de inversión.
También te puede gustar
Tras la calma en los índices de acciones estadounidenses, se esconden tensiones: un socio de Goldman Sachs revela cuatro factores que impulsan el mercado
Bobby Molavi, socio de Goldman Sachs, señaló que la incertidumbre regulatoria sobre la inteligencia artificial, el precio del petróleo superando los 100 dólares, el rendimiento de los bonos del Tesoro estadounidense sobrepasando el 5% y el aumento de las discrepancias en la política de la Reserva Federal están elevando los riesgos de inflación y tasas de interés. Esto ha ejercido presión sobre las operaciones de inteligencia artificial y momentum que antes dominaban el mercado, llevando a que los fondos se trasladen hacia los sectores de software, defensivo y energético, acelerando la reevaluación interna del mercado.
La Cámara de Representantes de Estados Unidos votará el miércoles sobre una nueva regulación del uso de electricidad: exige que los data centers asuman el costo incremental de energía, apuntando a los gigantes tecnológicos que transfieren gastos de electricidad.
Se espera que la Cámara de Representantes de Estados Unidos vote tan pronto como el miércoles sobre una legislación bipartidista destinada a frenar el aumento de los costos eléctricos relacionados con la expansión de centros de datos que apoyan la inteligencia artificial.

Pronóstico de acciones estadounidenses | Los tres principales futuros de índices bursátiles suben, el precio del petróleo baja y la decisión clave de tasas de la Reserva Federal llegará esta noche
El 16 de septiembre (miércoles), antes de la apertura del mercado estadounidense, los futuros de los tres principales índices bursátiles de EE. UU. subieron juntos.

¡Las acciones coreanas se estancan tras desvanecerse el fervor de los inversores! El volumen de operaciones cae a su nivel más bajo del año y el umbral de los 7.000 puntos sigue siendo inestable.
Debido a que el entusiasmo de los inversores se está desvaneciendo, el volumen de negociación en el mercado bursátil de Corea del Sur ha caído a su nivel más bajo de este año, lo que indica que el mercado liderado por la inteligencia artificial (IA) podría tener dificultades para volver a alcanzar sus máximos anteriores.

