Blog

Nuestros ingenieros actualizarán regularmente las nuevas tecnologías y materiales en el campo del diseño térmico en la industria y los compartirán con usted como referencia, a fin de agregar algo de inspiración para el diseño posterior.

Solución de refrigeración por aceite de inmersión para servidores GPU NVIDIA H200

Tiempo de leer: 6 min  |  El recuento de palabras: 1482

En la era de la explosión de la potencia de cálculo de la IA, las GPU, como unidades de cálculo centrales, se enfrentan a importantes desafíos en cuanto a la estabilidad del hardware y la potencia de cálculo debido a su eficiencia de disipación de calor. El consumo de energía de la GPU H200 de NVIDIA varía según el modelo y el escenario de uso. El modelo estándar tiene una potencia de diseño térmico (TDP) de 700 W. El modelo H200 NVL, por otro lado, tiene una TDP de 600 W, lo que lo hace más adecuado para racks empresariales con refrigeración por aire y menores requisitos de energía. En funcionamiento real, el consumo de energía también varía según la carga. Por ejemplo, durante el entrenamiento de IA, el consumo de energía dinámico de la H200 puede alcanzar los 750 W. Con refrigeración líquida y overclocking activados, el consumo de energía puede superar los 800 W. Cuando se implementan ocho GPU en una sola placa base, el consumo total de energía supera los 6000 W, lo que supone un desafío importante para la solución de refrigeración original de NVIDIA. Este artículo no solo analiza la lógica de optimización de la refrigeración para este escenario de alta potencia, sino que también se basa en nuestra experiencia al personalizar una solución para la empresa australiana de IA FIRMUS (sitio web oficial: www.firmus.com) y entregar 3000 muestras. Esto proporciona una referencia práctica para el diseño de refrigeración por inmersión para clústeres de GPU de alta densidad.

1. Antecedentes de la solución: El dilema de la disipación de calor de los servidores H200 de 8 GPU y los puntos débiles de Firmus
Las GPU NVIDIA H200, hardware fundamental para el entrenamiento de IA actual y la computación de alto rendimiento, suelen consumir 750 W de potencia por tarjeta, un aumento del 30 % en comparación con generaciones anteriores. Al utilizar una placa base con 8 GPU, el sistema debe gestionar simultáneamente una fuente de calor concentrada de 6,000 W. Además, el área del chip de la GPU es pequeña y la densidad del flujo térmico es extremadamente alta. Si la disipación de calor no se gestiona adecuadamente, no solo se producirá una limitación de la frecuencia del hardware (lo que provocará una pérdida de potencia de cálculo superior al 20 %), sino que las altas temperaturas prolongadas también pueden acortar la vida útil de la GPU. Este problema es especialmente grave en el contexto de Firmus, una fábrica australiana de IA. Como empresa especializada en el desarrollo de algoritmos de IA industrial y el arrendamiento de potencia de cálculo a gran escala, los centros de datos de Firmus se encuentran en los parques tecnológicos de Singapur y Sídney. Deben cumplir simultáneamente tres requisitos fundamentales: implementación de alta densidad (más de 20 servidores H200 de 8 GPU por gabinete), bajo nivel de ruido (límite de ruido nocturno ≤40 dB) y funcionamiento estable (interrupciones de la alimentación de cómputo de no más de una hora durante todo el año). La solución de NVIDIA claramente no cumplió con estos requisitos.

Inicialmente, Firmus se centró en el diseño de toda la sala de ordenadores y en garantizar la estabilidad del sistema de tuberías. Sin embargo, al recibir el disipador de GPU H200 original de NVIDIA, descubrieron que no funcionaba con un sistema de refrigeración por inmersión basado en aceite. El diseño principal y los problemas que surgieron son los siguientes:
• La estructura de enfriamiento: Una parte inferior cámara de vapor La combinación de tubos de calor soldados transfiere calor desde el núcleo de la GPU a las aletas mediante el proceso de cambio de fase de evaporación y condensación del fluido de trabajo dentro de la cámara de vapor. Sin embargo, dado que toda la base estaba revestida de refrigerante, el fluido de trabajo dentro de la cámara de vapor no podía vaporizarse, lo que impedía la transferencia de calor. A plena carga, la temperatura del núcleo de H₂O₂ superó con frecuencia los 95 °C (cerca del umbral de seguridad de 100 °C), y las frecuentes reducciones de frecuencia afectaron el progreso del entrenamiento de la IA. Por lo tanto, tras recibir los requisitos del proyecto, nuestros ingenieros de Kenfa Tech diseñaron una solución de refrigeración por inmersión de mayor rendimiento en un solo día y confirmaron su viabilidad con el equipo de investigadores doctorales del cliente.

Solución de optimización: Implementación de tecnología de enfriamiento por aceite de inmersión y diseño personalizado de Firmus

Para abordar los cuellos de botella de las soluciones de refrigeración por aire y cumplir con los requisitos de Firmus de alta densidad y bajo nivel de ruido, actualizamos el medio de disipación de calor de aire a aceite térmico aislado. Esta solución personalizada de refrigeración por aceite de inmersión aprovecha la alta conductividad térmica y el silencio del líquido para abordar problemas clave. Los detalles específicos del diseño son los siguientes:

2. Actualización de la estructura de enfriamiento del núcleo: combinación de placa base de cobre + tubo de calor compatible con GPU H200 de 8 GPU.

El diseño tradicional de refrigeración por aire de “cámara de vapor + ventilador” ha sido reemplazado por una placa base de cobre + un ventilador soldado de forma independiente. tubo de calor Estructura más adecuada para entornos de refrigeración por aceite. La compatibilidad también se ha optimizado para las dimensiones de la placa base de servidor Firmus:
Placa base de cobre: ​​Fabricada en cobre T2, se adhiere directamente al núcleo de la GPU H200 (con una tolerancia de ajuste de ≤0.05 mm). La conductividad térmica del cobre (401 W/m·K) es más de 1000 veces superior a la del aire, lo que absorbe rápidamente el calor del núcleo y evita la acumulación localizada de altas temperaturas.

• Tubos de calor soldados independientemente: Cada GPU está equipada con 24 tubos de calor de cobre libre de oxígeno de 6 mm de diámetro, conectados a la placa base de cobre mediante un proceso de soldadura al vacío (la resistencia térmica en la soldadura es ≤0.02 °C/W). La velocidad de cambio de fase del fluido de trabajo en los tubos de calor es un 50 % más rápida que en los sistemas de refrigeración por aire, lo que garantiza una transferencia de calor eficiente al aceite. La clave reside en la capacidad de transferir una gran cantidad de calor a la aleta en un área localizada, que luego es disipada por el refrigerante.

3. Selección de aceite y control de temperatura: Cumplimiento de los requisitos de Firmus para un funcionamiento estable durante todo el año
Para cumplir con los requisitos de Firmus de “operación ininterrumpida durante todo el año”, se implementó una optimización redundante en el diseño del sistema de selección y circulación de petróleo:

• Selección de aceite: aceite aislante mineral de grado industrial con una conductividad térmica de 1.14 W/m·K, una tensión de ruptura ≥ 50 kV (para evitar daños eléctricos al hardware) y una viscosidad a baja temperatura ≤ 20 mm²/s (para adaptarse a las bajas temperaturas en el centro de datos de Sídney durante el invierno y evitar la degradación de la fluidez).

Control de Temperatura: Un intercambiador de calor externo de doble circulación está diseñado para mantener una temperatura del aceite estable en torno a los 40 °C (con un rango de fluctuación de ±2 °C). Esto evita la disminución de la eficiencia de disipación de calor causada por el aumento de la temperatura del aceite, incluso cuando Firmus funciona a plena carga en verano (ocho GPU ejecutando simultáneamente un entrenamiento de modelos de gran tamaño).
• Redundancia: El intercambiador de calor está equipado con una bomba de respaldo. Si la bomba principal falla, se puede activar la bomba de respaldo en 0.5 segundos, cumpliendo así el requisito de fiabilidad de Firmus de "sin interrupciones superiores a una hora al año".

4. Entrega de muestras de FIRMUS: Verificación de escala de 3,000 piezas

Para garantizar la estabilidad de la solución, entregamos 3,000 módulos de enfriamiento de aceite de inmersión a FIRMUS en tres lotes, cubriendo los requisitos de prueba de sus cinco clústeres informáticos:

Primer lote de 1,000 unidades (octubre de 2024): Se utilizó para pruebas a plena carga de un solo servidor para verificar las temperaturas del núcleo. Con un disipador en buen estado, la temperatura total de la GPU se controló en torno a los 68 °C. Esto se entregó correctamente al usuario final, logrando una PUE general de aproximadamente 1.145 en el centro de datos. Segundo lote de 900 unidades (abril de 2025): Se implementó en un clúster de 100 servidores para probar la coordinación de la refrigeración en un entorno de alta densidad; nuevamente, el rendimiento se mantuvo estable, con la temperatura de la GPU perfectamente controlada por debajo de los 68 °C.
• El tercer lote de 1200 unidades (septiembre de 2025): Se utilizó en una prueba de carga de gabinete en Singapur para verificar la estabilidad en un entorno de alta temperatura de 45 °C. Una vez más, la temperatura de la GPU se mantuvo estable por debajo de los 68 °C, lo que demuestra plenamente que nuestra solución de diseño resuelve a la perfección los problemas de gestión térmica de la GPU H200.

5. Resultados de la solución: de los datos de laboratorio a la retroalimentación real de Firmus
Tanto nuestros datos de prueba como los comentarios de Firmus en situaciones reales demuestran las ventajas de la solución de refrigeración por aceite de inmersión. Los indicadores clave de rendimiento son los siguientes:
Temperatura del núcleo de la GPU: Estable en torno a los 68 °C a plena carga, lo que supone una reducción de 22 °C en comparación con la solución de refrigeración por aire anterior de Firmus (más de 90 °C). El H200 nunca se limitó, lo que aumentó la potencia de procesamiento en aproximadamente un 18 % (y redujo el tiempo de entrenamiento de los modelos grandes de Firmus en aproximadamente un 15 %).
• Nivel de ruido: Centro de datos Los niveles de ruido se redujeron de 65 dB a menos de 10 dB (cumpliendo plenamente con los límites de ruido establecidos por el Parque Tecnológico de Sídney y la Zona de Alta Tecnología de Singapur).
• Comparación del consumo de energía: Los intercambiadores de calor externos del sistema de refrigeración por aceite de inmersión se ubican en las azoteas de todo el campus. Gracias a la refrigeración por aire libre y a los ventiladores inteligentes, la temperatura de entrada del refrigerante se mantiene constante a 45 °C antes de llegar a la sala de ordenadores del centro de datos. En comparación con el consumo de energía de 400 W de los ventiladores de aire... solución de enfriamientoEl consumo energético adicional se reduce en un 62.5 %. Según Firmus… Calculando una escala de 1,000 servidores, esto puede ahorrar altos costos de electricidad anuales, rentabilizando el alquiler de servidores.
• Confiabilidad de la muestra: durante el período de prueba de 12 meses de Firmus, ninguna de las 3,000 muestras experimentó fallas de enfriamiento, lo que resultó en una tasa de fallas de cero y cumplió con sus requisitos de “alta confiabilidad”.

Resumen y perspectivas: La refrigeración por aceite de inmersión ofrece un nuevo camino para los centros de datos de IA de alta densidad

Basándonos en nuestra experiencia personalizando una solución para FIRMUS y entregando 3,000 muestras, hemos descubierto que, para servidores GPU de alta densidad de potencia como el NVIDIA H200 de 8 tarjetas, la refrigeración por aire tradicional tiene dificultades para superar los cuellos de botella del alto flujo térmico, el alto nivel de ruido, la baja fiabilidad y una PUE de aproximadamente 1.1. La refrigeración por aceite por inmersión, mediante una combinación de medios mejorados y un diseño personalizado, no solo aborda los problemas de temperatura del núcleo, sino que también se adapta a las necesidades específicas de diferentes escenarios (como la alta densidad, el bajo nivel de ruido y la alta fiabilidad de FIRMUS).

En el futuro, planeamos colaborar con FIRMUS para desarrollar una solución de placa fría líquida + aleación líquida más eficiente para las GPU NVIDIA GB200 y GB300, optimizando así la estructura de refrigeración para los servidores GPU de próxima generación. Nuestro objetivo es mantener la temperatura del aceite por debajo de los 45 °C y la de la GPU por debajo de los 70 °C. Además, estandarizaremos la experiencia práctica de FIRMUS y continuaremos brindando soporte técnico para sus proyectos el próximo año, proporcionando una solución reutilizable de refrigeración por aceite de inmersión para más fábricas de IA en el extranjero.

 

 

Ranking de artículos populares para leer

Placa de refrigeración líquida con intercambiador de calor integrado

Investigación del rendimiento térmico y diseño estructural de sistemas de calefacción por tubos de calor…

Mecanismo de compresión de longitud de onda, optimización de enrutamiento de alta velocidad y codiseño térmico para…

OBTENGA UNA COTIZACIÓN RÁPIDA