Optimizar la gestión térmica en inferencia
Para una inferencia continua, la medida térmica más rentable es limitar la potencia de la GPU: según una medición publicada realizada con una RTX 3090, pasar de 350 W a 250 W supone perder menos del 3 % de velocidad de generación, mientras que por debajo de ese umbral la velocidad cae en picado. Comprueba primero qué limita realmente la tarjeta (temperatura o potencia) con nvidia-smi, antes de modificar los ventiladores, la tensión o la pasta térmica.
Una máquina que responde a solicitudes durante todo el día se calienta de forma distinta que al ejecutar un videojuego: carga constante, memoria sometida a un uso intensivo y caja cerrada. Esta página explica cómo saber si tu tarjeta se ralentiza, qué ajuste probar primero, cuánto rendimiento se pierde realmente en tokens por segundo al limitar la potencia y cuándo el mantenimiento (polvo, pasta térmica, caja) es la verdadera solución.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#¿Por qué la gestión térmica importa para un servidor de inferencia?
Una GPU protege su chip: cuando la temperatura o la potencia superan lo permitido por su firmware, reduce sus frecuencias. Este mecanismo se llama throttling. La documentación de nvidia-smi distingue sus causas: una ralentización por software relacionada con la temperatura («sw thermal slowdown»), una ralentización por hardware más brusca que reduce las frecuencias por un factor de 2 o más («hw thermal slowdown») y un límite de potencia («sw power cap»). Si todas estas causas figuran como inactivas, las frecuencias se mantienen lo más altas posible.
El umbral no es el mismo en todas las tarjetas. NVIDIA lo define como «GPU Slowdown Temp», la temperatura a la que el hardware comienza a optimizar las frecuencias para enfriarse, y lo muestra en nvidia-smi. Por tanto, no te fíes de una cifra general como «83 °C»: consulta el valor de tu tarjeta. Las consecuencias del throttling son una reducción de la velocidad y, si los ventiladores compensan, ruido; a largo plazo, una tarjeta que funciona constantemente a altas temperaturas envejece más rápido, pero no tenemos una cifra fiable que citar al respecto.
#Medir antes de ajustar: lo que realmente dice la tarjeta
El punto de partida es saber si la tarjeta reduce su velocidad y por qué. Bastan dos comandos en una tarjeta NVIDIA. El primero muestra continuamente la temperatura, la potencia, la frecuencia del núcleo y la utilización; el segundo detalla los motivos de la reducción de velocidad y los umbrales de temperatura de tu modelo.
Ejecuta estos comandos durante una generación de varios minutos, no en reposo. Hay dos lecturas que importan. Si la frecuencia del núcleo cae mientras la temperatura sube y hay una causa térmica de limitación activa, se trata de un problema de refrigeración. Si la frecuencia del núcleo se mantiene alta pero hay un límite de potencia activo, la tarjeta está limitada por su consumo: reducir aún más el límite no tendrá un efecto notable en la velocidad de generación, pero sí reducirá el calor.
| Observación durante una generación larga | Interpretación | Primera acción |
|---|---|---|
| Temperatura estable por debajo del umbral de reducción de frecuencia, frecuencia estable | Sin problemas térmicos | No cambiar nada; si es necesario, limitar la potencia para reducir el ruido |
| Temperatura que alcanza el umbral, frecuencia que baja, causa térmica activa | Refrigeración insuficiente | Flujo de aire de la caja, polvo, curva de los ventiladores |
| Frecuencia baja, motivo «power cap» activo, temperatura correcta | Límite de potencia alcanzado | Normal; aumentar el límite solo si la velocidad de generación es insuficiente |
| Diferencia de velocidad entre el primer y el décimo intercambio | Aumento de temperatura progresivo | Medir bajo carga prolongada, no al arranque |
#El límite de potencia: el ajuste que más beneficios aporta
Limitar la potencia es más sencillo que ajustar la curva de tensión y es reversible. En una inferencia limitada por la memoria, la pérdida es pequeña hasta cierto umbral y después se vuelve brusca. El blog runaihome, que realizó mediciones con una RTX 3090 y un modelo denso de 27 mil millones de parámetros, indica que, al pasar de 350 W a 250 W, la tarjeta pierde menos del 3 % de su velocidad a cambio de una reducción de 100 W, y que, a 200 W, la frecuencia del núcleo se desploma y la velocidad cae un 35 %.
| Límite | Efecto medido en la generación |
|---|---|
| 350 W (predeterminado) | Referencia |
| 300 W | A menos de un 3 % de diferencia con la referencia |
| 250 W | 31,7 t/s, menos de un 3 % por debajo de la referencia |
| 200 W | 20,6 t/s, es decir, un 35 % menos: el umbral que no debe sobrepasarse |
Para una RTX 4090, el mismo blog cita a Tom's Hardware, según el cual limitar la potencia al 70 % (unos 315 W) conserva aproximadamente el 94 % del rendimiento. Estas cifras proceden de fuentes secundarias y de una tarjeta concreta: no las apliques tal cual a la tuya. El método fiable consiste en medir tu velocidad de generación durante una generación larga, reduciendo el límite en pasos de 25 a 50 W y deteniéndote antes de que caiga el rendimiento.
La documentación de nvidia-smi especifica que el valor debe estar entre los límites mínimo y máximo indicados por la tarjeta, y que el comando requiere permisos de root. Verifica después de un reinicio que el límite siga aplicándose: si ha vuelto al valor por defecto, crea una unidad systemd que lo vuelva a aplicar al arrancar.
Actívala con sudo systemctl enable --now nvidia-power-limit.service.
#Curva de los ventiladores: agresiva desde el principio en vez de brusca al final
La curva de fábrica prioriza el silencio: los ventiladores giran despacio hasta alcanzar una temperatura elevada y después aumentan gradualmente su velocidad. Para una carga continua, una curva que empiece a aumentar la velocidad antes mantiene la tarjeta más fresca con un nivel de ruido comparable, porque evita los picos de velocidad. En Windows, MSI Afterburner permite ajustar la curva; en Linux, LACT es una aplicación gráfica para controlar las GPU de AMD, NVIDIA e Intel que incluye el control de los ventiladores.
| Temperatura | Velocidad del ventilador |
|---|---|
| 50 °C | 40 % |
| 60 °C | 55 % |
| 70 °C | 75 % |
| 78 °C | 90 % |
| Umbral de ralentización menos 5 °C | 100 % |
Estos valores son un punto de partida, no una recomendación del fabricante. Ajusta el último umbral a partir del valor «GPU Slowdown Temp» de tu tarjeta y evalúa el resultado según el ruido que puedas tolerar en la habitación. En macOS, Apple gestiona los ventiladores: no se puede ajustar la curva.
#Undervolting: más preciso, requiere más tiempo para validarlo
El undervolting consiste en obtener la misma frecuencia con una tensión más baja y, por tanto, generar menos calor. Se ajusta en Windows mediante MSI Afterburner (curva frecuencia-tensión); en Linux, el enfoque habitual es fijar las frecuencias con la opción de nvidia-smi que establece el intervalo de frecuencias del núcleo. La mejora depende de la tarjeta: cada chip tiene su propio margen, y un ajuste demasiado agresivo provoca errores o bloqueos más adelante, no inmediatamente.
- 01Partir de un límite de potencia que funcioneEmpieza por el límite de potencia: es la mejora más segura. Añade un undervolt solo si la tarjeta sigue demasiado caliente o hace demasiado ruido.
- 02Fijar una frecuencia máximaFija la frecuencia del núcleo en un valor inferior a la frecuencia máxima de boost, por ejemplo con nvidia-smi -lgc seguido de un intervalo de frecuencias en MHz.
- 03Probar durante mucho tiempoInicia una generación continua de al menos 30 minutos. Una inestabilidad se manifiesta mediante errores CUDA, fallos del controlador o salidas incoherentes.
- 04CompararMide la velocidad y la temperatura antes y después en el mismo modelo y el mismo prompt, luego mantén el ajuste solo si la pérdida de velocidad es despreciable.
- 05Revertir si es necesarioRestablece las frecuencias (nvidia-smi -rgc) o reinicia el equipo para volver a los ajustes de fábrica.
#Caja y flujo de aire: la mejora se mide en grados
- Recorrido del aire
- Un flujo de aire sin obstáculos de delante hacia atrás, con aire fresco dirigido hacia los ventiladores de la tarjeta. Un cableado que obstruya el flujo hace subir la temperatura.
- Filtros y polvo
- Un filtro obstruido reduce el flujo de aire: límpialo regularmente y elimina el polvo del disipador de la tarjeta con aire comprimido, manteniendo los ventiladores inmovilizados para evitar que giren a una velocidad excesiva.
- Espacio alrededor de la tarjeta
- Dos tarjetas pegadas una a otra en una configuración multi-GPU hacen que se caliente la primera; sepáralas o añade un ventilador lateral.
- Entorno
- Una habitación a 30 °C en lugar de 20 °C añade esos diez grados a la temperatura de la tarjeta: un servidor en un armario cerrado supone un problema térmico antes que un problema de la tarjeta.
Para evaluar un ajuste sin equivocarte, mantén un protocolo constante: el mismo modelo, el mismo prompt largo y la misma duración de generación, cambiando un solo parámetro cada vez. Anota la temperatura máxima, la frecuencia del núcleo y la tasa media de generación al final de la generación, no al principio, porque una tarjeta fría siempre da mejores cifras que la misma tarjeta después de veinte minutos. Repite la medición a la misma temperatura ambiente; de lo contrario, las condiciones de la habitación distorsionan la comparación, no el ajuste.
#Repasting: último recurso, con sus riesgos
Tras varios años, la pasta y las almohadillas térmicas de una tarjeta de segunda mano pueden haberse secado. El síntoma es una temperatura más alta que al comprarla con la misma carga, aunque la caja esté limpia. Desmontar una tarjeta gráfica anula la garantía, puede dañar las almohadillas y el chip, y exige trabajar con método. Hazlo solo después de haber descartado las causas más simples: polvo, flujo de aire, límite de potencia y temperatura ambiente. Si no estás seguro, encarga el trabajo a un profesional; compara el coste con el de una tarjeta de reemplazo.
#Portátiles y Mac: las opciones de ajuste cambian
En un portátil, no ajustas ni la tensión ni la pasta térmica. La opción útil es el modo de alimentación. Apple describe dos modos: el modo de ahorro de energía, que, en macOS Sequoia 15.1 y versiones posteriores, también reduce el ruido de los ventiladores en los modelos con refrigeración activa, y el modo de alta potencia, que permite que los ventiladores giren más rápido para mantener el rendimiento con cargas muy intensas, a costa de un ruido adicional. Para un MacBook Air sin ventilador, las únicas opciones son un soporte que disipe el calor, la conexión a la red eléctrica y un modelo más pequeño.
- Elegir tu GPU para IA local
- Configuración de PC para IA con 32 GB
- Configuración multi-GPU con llama.cpp
- Fuente: documentación nvidia-smi
- Fuente: mediciones de límite de potencia (runaihome)
- Fuente: Apple, modos de alimentación del Mac
#Preguntas frecuentes
¿A qué temperatura empieza a ralentizarse una tarjeta gráfica?+
¿Limitar la potencia ralentiza mucho la inferencia?+
¿Cómo saber si mi GPU sufre throttling?+
¿Hay que cambiar la pasta térmica de tu tarjeta?+
Undervolting o límite de potencia: ¿cuál elegir?+
¿Tiene un MacBook ajustes térmicos para la IA local?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.