El rendimiento por vatio: la métrica definitiva para la eficiencia en infraestructuras de IA
Why Performance per Watt Is the Ultimate Metric for AI Infrastructure Efficiency
En el mundo de la inteligencia artificial (IA), el consumo energético es una restricción ineludible. La capacidad de una ‘fábrica de IA’ para generar tokens dentro de un presupuesto energético fijo determina su rentabilidad. Por esta razón, el rendimiento por vatio se ha convertido en la base de estas fábricas de IA, ya que es una métrica que solo se puede obtener a través de resultados reales.
La demanda de tokens impulsada por la IA agentic está en aumento, y las decisiones de infraestructura que las organizaciones tomen hoy determinarán quién escalará y quién no en un mundo con restricciones energéticas. Actualmente, casi todos los modelos de IA de vanguardia utilizan una arquitectura de mezcla de expertos (MoE). Para servir eficientemente a estos modelos a gran escala, el tamaño del dominio de la GPU —es decir, el número de GPUs conectadas a través de una interconexión ultrarrápida— es crucial, y cuanto más grande, mejor.
La generación Hopper de NVIDIA estableció el estándar con un dominio de ocho GPUs, pero la escala de la IA de frontera actual lo ha superado. Servir a MoE con un dominio de 72 GPUs requiere un codiseño completo de la pila y una profundidad operativa que se obtiene al ejecutar estos modelos bajo carga de producción real.
Con la plataforma NVIDIA Blackwell NVL72, esa base ya está construida y probada, ofreciendo el mayor rendimiento por vatio para maximizar los ingresos y el menor costo por token para maximizar los márgenes de beneficio. Esta es la base sobre la que la plataforma NVIDIA Vera Rubin se construye para elevar aún más la eficiencia energética a escala de rack.
Cada nueva generación de modelos de frontera trae cambios arquitectónicos que desbloquean una mayor inteligencia mientras exigen nuevas optimizaciones para funcionar eficientemente a escala. En la generación más reciente de modelos abiertos líderes, el NVIDIA GB300 NVL72 ofrece hasta 25 veces más rendimiento por vatio en comparación con la generación NVIDIA Hopper, demostrando que el rendimiento de MoE mejora al pasar de un tamaño de dominio de 8 GPUs a 72 GPUs.
El rendimiento por vatio que ofrece NVIDIA Blackwell es el resultado de un codiseño extremo: cada componente del sistema a escala de rack, desde el silicio hasta el software, está diseñado en conjunto para maximizar el rendimiento de tokens para cargas de trabajo de inferencia de IA. Este codiseño toca cada capa de la pila.
Por ejemplo, el NVIDIA NVLink Switch, crucial para el rendimiento a escala de rack, está diseñado específicamente para desbloquear dominios de GPU a gran escala, no adaptado de redes de propósito general. Ahora en su sexta generación con la plataforma Vera Rubin, sus capacidades están diseñadas específicamente para cargas de trabajo de IA como SHARP, que realiza computación en la red directamente en el switch, descargando trabajo de las propias GPUs.
La experiencia acumulada en producción, construida a lo largo de generaciones de modelos de frontera y despliegues en el mundo real, es lo que da a NVIDIA Vera Rubin su ventaja competitiva en el mercado de infraestructuras de IA.
Fuente: https://blogs.nvidia.com/blog/performance-per-watt-ai-infrastructure-efficiency/