La revolución de la refrigeración líquida de Nvidia para servidores de IA
El consumo de energía de los chips de IA de última generación aumenta constantemente, lo que se ha convertido en un catalizador para que la próxima generación de servidores DGX AI pase a la refrigeración líquida. El TDP (potencia de diseño térmico) actual de la GPU insignia H100 de Nvidia es de 700 W, lo que ha superado el límite de la refrigeración por aire tradicional. Se espera que Nvidia lance la GPU B100 de arquitectura Blackwell con un TDP de aproximadamente 1000W a finales de este año, y la refrigeración líquida definitivamente será necesaria en ese momento.

Para los sistemas informáticos de alto rendimiento, la refrigeración líquida tiene varias ventajas clave sobre la refrigeración por aire:
La excelente eficiencia de transferencia de calor permite enfriar completamente los componentes con mayor TDP
Debido a la reducción de la demanda de ventiladores de alta velocidad, el funcionamiento es más silencioso
El diseño del sistema es más denso y los voluminosos disipadores de calor y ventiladores ocupan menos espacio.
Potencial para capturar y reutilizar el calor residual en intercambiadores de calor líquido-líquido

Al utilizar refrigeración líquida, Nvidia puede seguir superando los límites de rendimiento de los aceleradores de IA sin verse limitada por el sistema de refrigeración. A medida que la complejidad de la carga de entrenamiento de la inteligencia artificial continúa aumentando y el correspondiente consumo de energía del hardware aumenta, esto es crucial. El servidor DGX AI de Nvidia incluye múltiples GPU en un sistema optimizado para cargas de trabajo de AI, que ha sido rápidamente adoptado por empresas a gran escala. Los principales proveedores de servicios en la nube, como Google Cloud, Meta y Microsoft, han implementado sistemas DGX en sus centros de datos. En los últimos años, a medida que más y más organizaciones buscan aprovechar el poder transformador de la inteligencia artificial, la adopción de los sistemas de inteligencia artificial Nvidia DGX ha crecido exponencialmente.

El sistema Nvidia DGX puede utilizar diseños avanzados de refrigeración por inmersión que utilizan fluidos dieléctricos. El enfriamiento directo del chip bombea fluidos dieléctricos directamente sobre los chips GPU y otros componentes térmicos, sin necesidad de placas frías, logrando una transferencia de calor más directa. Puede soportar niveles de TDP muy altos (500W+) en un solo chip, consiguiendo sistemas más densos.

A medida que la inteligencia artificial continúa desarrollándose a una velocidad asombrosa, la infraestructura de hardware compatible debe evolucionar de manera sincrónica. La refrigeración líquida es una tecnología clave que permitirá a los aceleradores escalar a niveles de rendimiento sin precedentes. Esta transformación no está exenta de desafíos. Debido a que los centros de datos requieren la transformación de la infraestructura de refrigeración líquida y el desarrollo de nuevos programas de mantenimiento, los beneficios de eficiencia energética, densidad y rendimiento son significativos y no pueden ignorarse.






