Intermedio 11 minRendimiento

Optimizar la gestión térmica en inferencia

Respuesta directa

Para una inferencia continua, la medida térmica más rentable es limitar la potencia de la GPU: según una medición publicada realizada con una RTX 3090, pasar de 350 W a 250 W supone perder menos del 3 % de velocidad de generación, mientras que por debajo de ese umbral la velocidad cae en picado. Comprueba primero qué limita realmente la tarjeta (temperatura o potencia) con nvidia-smi, antes de modificar los ventiladores, la tensión o la pasta térmica.

Una máquina que responde a solicitudes durante todo el día se calienta de forma distinta que al ejecutar un videojuego: carga constante, memoria sometida a un uso intensivo y caja cerrada. Esta página explica cómo saber si tu tarjeta se ralentiza, qué ajuste probar primero, cuánto rendimiento se pierde realmente en tokens por segundo al limitar la potencia y cuándo el mantenimiento (polvo, pasta térmica, caja) es la verdadera solución.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#¿Por qué la gestión térmica importa para un servidor de inferencia?

Una GPU protege su chip: cuando la temperatura o la potencia superan lo permitido por su firmware, reduce sus frecuencias. Este mecanismo se llama throttling. La documentación de nvidia-smi distingue sus causas: una ralentización por software relacionada con la temperatura («sw thermal slowdown»), una ralentización por hardware más brusca que reduce las frecuencias por un factor de 2 o más («hw thermal slowdown») y un límite de potencia («sw power cap»). Si todas estas causas figuran como inactivas, las frecuencias se mantienen lo más altas posible.

El umbral no es el mismo en todas las tarjetas. NVIDIA lo define como «GPU Slowdown Temp», la temperatura a la que el hardware comienza a optimizar las frecuencias para enfriarse, y lo muestra en nvidia-smi. Por tanto, no te fíes de una cifra general como «83 °C»: consulta el valor de tu tarjeta. Las consecuencias del throttling son una reducción de la velocidad y, si los ventiladores compensan, ruido; a largo plazo, una tarjeta que funciona constantemente a altas temperaturas envejece más rápido, pero no tenemos una cifra fiable que citar al respecto.

i
Decodificación y prompt: dos sensibilidades diferentes
La generación de texto está limitada por el ancho de banda de la memoria, por lo que es poco sensible a la frecuencia del núcleo. El procesamiento del prompt está limitado por el cálculo, por lo que es más sensible a cualquier reducción de frecuencia. Un servidor que reciba documentos largos o bucles de agentes sufrirá más por un límite de potencia que un chat interactivo.

#Medir antes de ajustar: lo que realmente dice la tarjeta

El punto de partida es saber si la tarjeta reduce su velocidad y por qué. Bastan dos comandos en una tarjeta NVIDIA. El primero muestra continuamente la temperatura, la potencia, la frecuencia del núcleo y la utilización; el segundo detalla los motivos de la reducción de velocidad y los umbrales de temperatura de tu modelo.

Monitorizar bajo carga (una línea por segundo)
nvidia-smi --query-gpu=timestamp,temperature.gpu,power.draw,clocks.current.graphics,clocks.current.memory,utilization.gpu --format=csv -l 1
Motivos de ralentización y umbrales de temperatura
nvidia-smi -q -d PERFORMANCE
nvidia-smi -q -d TEMPERATURE
Tarjetas AMD
rocm-smi --showtemp --showpower --showuse

Ejecuta estos comandos durante una generación de varios minutos, no en reposo. Hay dos lecturas que importan. Si la frecuencia del núcleo cae mientras la temperatura sube y hay una causa térmica de limitación activa, se trata de un problema de refrigeración. Si la frecuencia del núcleo se mantiene alta pero hay un límite de potencia activo, la tarjeta está limitada por su consumo: reducir aún más el límite no tendrá un efecto notable en la velocidad de generación, pero sí reducirá el calor.

¿Qué leer, qué concluir?
Observación durante una generación largaInterpretaciónPrimera acción
Temperatura estable por debajo del umbral de reducción de frecuencia, frecuencia estableSin problemas térmicosNo cambiar nada; si es necesario, limitar la potencia para reducir el ruido
Temperatura que alcanza el umbral, frecuencia que baja, causa térmica activaRefrigeración insuficienteFlujo de aire de la caja, polvo, curva de los ventiladores
Frecuencia baja, motivo «power cap» activo, temperatura correctaLímite de potencia alcanzadoNormal; aumentar el límite solo si la velocidad de generación es insuficiente
Diferencia de velocidad entre el primer y el décimo intercambioAumento de temperatura progresivoMedir bajo carga prolongada, no al arranque

#El límite de potencia: el ajuste que más beneficios aporta

Limitar la potencia es más sencillo que ajustar la curva de tensión y es reversible. En una inferencia limitada por la memoria, la pérdida es pequeña hasta cierto umbral y después se vuelve brusca. El blog runaihome, que realizó mediciones con una RTX 3090 y un modelo denso de 27 mil millones de parámetros, indica que, al pasar de 350 W a 250 W, la tarjeta pierde menos del 3 % de su velocidad a cambio de una reducción de 100 W, y que, a 200 W, la frecuencia del núcleo se desploma y la velocidad cae un 35 %.

Límite de potencia y velocidad de generación, RTX 3090 (medición publicada por runaihome)
LímiteEfecto medido en la generación
350 W (predeterminado)Referencia
300 WA menos de un 3 % de diferencia con la referencia
250 W31,7 t/s, menos de un 3 % por debajo de la referencia
200 W20,6 t/s, es decir, un 35 % menos: el umbral que no debe sobrepasarse

Para una RTX 4090, el mismo blog cita a Tom's Hardware, según el cual limitar la potencia al 70 % (unos 315 W) conserva aproximadamente el 94 % del rendimiento. Estas cifras proceden de fuentes secundarias y de una tarjeta concreta: no las apliques tal cual a la tuya. El método fiable consiste en medir tu velocidad de generación durante una generación larga, reduciendo el límite en pasos de 25 a 50 W y deteniéndote antes de que caiga el rendimiento.

Limitar la potencia (Linux, adaptar a tu tarjeta)
# Lire la limite par défaut, minimale et maximale
nvidia-smi -q -d POWER

# Appliquer 250 W sur la carte 0 (nécessite les droits root)
sudo nvidia-smi -i 0 -pl 250

La documentación de nvidia-smi especifica que el valor debe estar entre los límites mínimo y máximo indicados por la tarjeta, y que el comando requiere permisos de root. Verifica después de un reinicio que el límite siga aplicándose: si ha vuelto al valor por defecto, crea una unidad systemd que lo vuelva a aplicar al arrancar.

/etc/systemd/system/nvidia-power-limit.service
[Unit]
Description=Limite de puissance GPU
After=multi-user.target

[Service]
Type=oneshot
ExecStart=/usr/bin/nvidia-smi -i 0 -pl 250
RemainAfterExit=yes

[Install]
WantedBy=multi-user.target

Actívala con sudo systemctl enable --now nvidia-power-limit.service.

#Curva de los ventiladores: agresiva desde el principio en vez de brusca al final

La curva de fábrica prioriza el silencio: los ventiladores giran despacio hasta alcanzar una temperatura elevada y después aumentan gradualmente su velocidad. Para una carga continua, una curva que empiece a aumentar la velocidad antes mantiene la tarjeta más fresca con un nivel de ruido comparable, porque evita los picos de velocidad. En Windows, MSI Afterburner permite ajustar la curva; en Linux, LACT es una aplicación gráfica para controlar las GPU de AMD, NVIDIA e Intel que incluye el control de los ventiladores.

Ejemplo de curva para una carga continua (a validar en tu tarjeta)
TemperaturaVelocidad del ventilador
50 °C40 %
60 °C55 %
70 °C75 %
78 °C90 %
Umbral de ralentización menos 5 °C100 %

Estos valores son un punto de partida, no una recomendación del fabricante. Ajusta el último umbral a partir del valor «GPU Slowdown Temp» de tu tarjeta y evalúa el resultado según el ruido que puedas tolerar en la habitación. En macOS, Apple gestiona los ventiladores: no se puede ajustar la curva.

#Undervolting: más preciso, requiere más tiempo para validarlo

El undervolting consiste en obtener la misma frecuencia con una tensión más baja y, por tanto, generar menos calor. Se ajusta en Windows mediante MSI Afterburner (curva frecuencia-tensión); en Linux, el enfoque habitual es fijar las frecuencias con la opción de nvidia-smi que establece el intervalo de frecuencias del núcleo. La mejora depende de la tarjeta: cada chip tiene su propio margen, y un ajuste demasiado agresivo provoca errores o bloqueos más adelante, no inmediatamente.

  1. 01
    Partir de un límite de potencia que funcione
    Empieza por el límite de potencia: es la mejora más segura. Añade un undervolt solo si la tarjeta sigue demasiado caliente o hace demasiado ruido.
  2. 02
    Fijar una frecuencia máxima
    Fija la frecuencia del núcleo en un valor inferior a la frecuencia máxima de boost, por ejemplo con nvidia-smi -lgc seguido de un intervalo de frecuencias en MHz.
  3. 03
    Probar durante mucho tiempo
    Inicia una generación continua de al menos 30 minutos. Una inestabilidad se manifiesta mediante errores CUDA, fallos del controlador o salidas incoherentes.
  4. 04
    Comparar
    Mide la velocidad y la temperatura antes y después en el mismo modelo y el mismo prompt, luego mantén el ajuste solo si la pérdida de velocidad es despreciable.
  5. 05
    Revertir si es necesario
    Restablece las frecuencias (nvidia-smi -rgc) o reinicia el equipo para volver a los ajustes de fábrica.
!
El undervolt no está garantizado
A diferencia del límite de potencia, un undervolt demasiado agresivo puede volver el sistema inestable de forma intermitente. En un servidor que funciona sin supervisión, limítate a ajustar el límite de potencia si no has realizado pruebas durante varias horas.

#Caja y flujo de aire: la mejora se mide en grados

Recorrido del aire
Un flujo de aire sin obstáculos de delante hacia atrás, con aire fresco dirigido hacia los ventiladores de la tarjeta. Un cableado que obstruya el flujo hace subir la temperatura.
Filtros y polvo
Un filtro obstruido reduce el flujo de aire: límpialo regularmente y elimina el polvo del disipador de la tarjeta con aire comprimido, manteniendo los ventiladores inmovilizados para evitar que giren a una velocidad excesiva.
Espacio alrededor de la tarjeta
Dos tarjetas pegadas una a otra en una configuración multi-GPU hacen que se caliente la primera; sepáralas o añade un ventilador lateral.
Entorno
Una habitación a 30 °C en lugar de 20 °C añade esos diez grados a la temperatura de la tarjeta: un servidor en un armario cerrado supone un problema térmico antes que un problema de la tarjeta.

Para evaluar un ajuste sin equivocarte, mantén un protocolo constante: el mismo modelo, el mismo prompt largo y la misma duración de generación, cambiando un solo parámetro cada vez. Anota la temperatura máxima, la frecuencia del núcleo y la tasa media de generación al final de la generación, no al principio, porque una tarjeta fría siempre da mejores cifras que la misma tarjeta después de veinte minutos. Repite la medición a la misma temperatura ambiente; de lo contrario, las condiciones de la habitación distorsionan la comparación, no el ajuste.

#Repasting: último recurso, con sus riesgos

Tras varios años, la pasta y las almohadillas térmicas de una tarjeta de segunda mano pueden haberse secado. El síntoma es una temperatura más alta que al comprarla con la misma carga, aunque la caja esté limpia. Desmontar una tarjeta gráfica anula la garantía, puede dañar las almohadillas y el chip, y exige trabajar con método. Hazlo solo después de haber descartado las causas más simples: polvo, flujo de aire, límite de potencia y temperatura ambiente. Si no estás seguro, encarga el trabajo a un profesional; compara el coste con el de una tarjeta de reemplazo.

#Portátiles y Mac: las opciones de ajuste cambian

En un portátil, no ajustas ni la tensión ni la pasta térmica. La opción útil es el modo de alimentación. Apple describe dos modos: el modo de ahorro de energía, que, en macOS Sequoia 15.1 y versiones posteriores, también reduce el ruido de los ventiladores en los modelos con refrigeración activa, y el modo de alta potencia, que permite que los ventiladores giren más rápido para mantener el rendimiento con cargas muy intensas, a costa de un ruido adicional. Para un MacBook Air sin ventilador, las únicas opciones son un soporte que disipe el calor, la conexión a la red eléctrica y un modelo más pequeño.

#Preguntas frecuentes

FAQ
¿A qué temperatura empieza a ralentizarse una tarjeta gráfica?+
Depende del modelo. NVIDIA define en nvidia-smi una « GPU Slowdown Temp », temperatura a partir de la cual el hardware optimiza las frecuencias para enfriarse. El comando nvidia-smi -q -d TEMPERATURE muestra el valor de tu tarjeta. No confíes en un umbral general como 83 °C sin verificarlo.
¿Limitar la potencia ralentiza mucho la inferencia?+
Poco, hasta un umbral. Una medición publicada en una RTX 3090 indica menos del 3 % de pérdida de 350 W a 250 W en generación, luego una caída del 35 % a 200 W. El procesamiento del prompt, limitado por el cálculo, es más sensible. Mide en tu tarjeta con tu carga.
¿Cómo saber si mi GPU sufre throttling?+
Inicia una generación larga y observa la frecuencia del núcleo con nvidia-smi. Si baja mientras sube la temperatura, consulta nvidia-smi -q -d PERFORMANCE: indica si hay algún motivo térmico o de potencia activo. Si todos los motivos están inactivos, las frecuencias se mantienen lo más altas posible.
¿Hay que cambiar la pasta térmica de tu tarjeta?+
Rara vez. Descarta primero como causas el polvo, el flujo de aire de la caja, la temperatura ambiente y el límite de potencia. El desmontaje anula la garantía y conlleva riesgos para las almohadillas térmicas y el chip. Solo se justifica si las temperaturas han aumentado claramente en una tarjeta limpia, después de haber comprobado todo lo demás.
Undervolting o límite de potencia: ¿cuál elegir?+
Empieza por el límite de potencia: es simple, reversible y sin riesgo de inestabilidad. El undervolting requiere pruebas largas y puede provocar fallos intermitentes, especialmente en un servidor sin supervisión. Añádelo solo si la tarjeta sigue estando demasiado caliente o resulta demasiado ruidosa al aplicar únicamente el límite.
¿Tiene un MacBook ajustes térmicos para la IA local?+
Poco. Apple ofrece modos de alimentación: Bajo consumo y Alta potencia en algunos modelos, con ventiladores más rápidos pero más ruido. En un MacBook Air sin ventilador, colócalo sobre un soporte que disipe el calor, conéctalo a la red eléctrica y elige un modelo más pequeño para las generaciones largas.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.