Intermedio 10 minNVIDIA

Nemotron 3 en local: los modelos NVIDIA con Ollama

NVIDIA no solo fabrica GPU: la marca también realiza el postentrenamiento de sus propios LLM, la familia Nemotron. Esta guía muestra cómo instalar Nemotron 3 localmente con Ollama, qué variantes (Nano, Super) elegir según tu VRAM, qué optimiza NVIDIA de forma diferente a los demás —razonamiento controlable y uso en agentes— y cuándo estos modelos merecen la pena frente a los Qwen3 equivalentes.

Por Clara M.·Actualización 2026-07-28·Probado en Windows, macOS y Linux

#¿Por qué Nemotron en lugar de otro modelo?

Nemotron no es un modelo entrenado desde cero. NVIDIA parte de modelos base sólidos con pesos abiertos (Llama, Qwen según las versiones) y luego aplica su propia receta de postentrenamiento: poda (pruning) para reducir el tamaño, destilación para recuperar la calidad perdida y un ajuste fino masivo orientado al razonamiento, las matemáticas, el código y las llamadas a herramientas. El resultado persigue un objetivo preciso: la mejor relación entre calidad y costo computacional para tareas de agente, no para la conversación generalista.

Otra particularidad es que NVIDIA optimiza estos modelos para su propio hardware y sus propios pipelines de inferencia. En la práctica, esto se traduce en tasas de generación sólidas en GPU NVIDIA y en una familia concebida como una gama coherente: una versión pequeña para tarjetas de consumo, una versión mediana para estaciones de trabajo y una versión gigante para servidores. Eliges según la VRAM disponible sin cambiar la lógica de los prompts.

i
Nemotron es Llama/Qwen mejorado
Si ya conoces Llama o Qwen en local, Nemotron se comporta de forma familiar: mismo formato de chat, mismas cuantizaciones GGUF. La diferencia radica en el posentrenamiento realizado por NVIDIA, no en una arquitectura exótica.

#Nano, Super y Ultra: ¿qué variante?

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

La gama Nemotron 3 se ofrece en tres tamaños, cada uno para un tipo de máquina. El nombre indica más el tipo de máquina al que se dirige que el número exacto de parámetros.

Nano (~8-9B)
La versión para tarjetas de consumo. Cabe holgadamente en una RTX 3060 de 12 GB o en cualquier GPU con al menos 8 GB de VRAM en Q4. Es el punto de entrada ideal para probar Nemotron y para agentes ligeros.
Super (~49B)
La versión para estaciones de trabajo y GPU de gran tamaño. Busca la calidad de un modelo de 70B con un coste de cálculo menor, gracias a la poda de NVIDIA. Requiere una RTX 4090 de 24 GB (con muy poco margen en Q4) o, mejor aún, una tarjeta de 32-48 GB.
Ultra (~253B)
La versión para servidores, fuera del alcance de un equipo de consumo. Reservada para estaciones de trabajo con varias GPU o centros de datos. Se menciona aquí para situar la gama, no para un uso local habitual.

Para un equipo local, la elección real está entre Nano y Super. Nano si tienes una tarjeta de 8 a 16 GB o si la velocidad es prioritaria. Super si tienes 24 GB o más y buscas la máxima calidad en tareas exigentes de razonamiento o programación.

#Requisitos y VRAM por variante

Como ocurre con cualquier modelo local, la VRAM es el factor limitante. Estas son las referencias con cuantización Q4_K_M, la recomendada por defecto porque ofrece el mejor equilibrio entre calidad y memoria. Reserva siempre un margen para la ventana de contexto, que consume memoria además de los pesos.

Nemotron Nano (~9B) — Q4
≈ 6-7 GB de VRAM. Funciona con margen en una RTX 3060 de 12 GB, una RTX 4070 de 12 GB o un Mac Apple Silicon con al menos 16 GB de memoria unificada.
Nemotron Super (~49B) — Q4
≈ 28-30 GB. No cabe en una sola RTX 4090 de 24 GB sin offload: prevé una tarjeta de 32 GB o más, dos GPUs, o un Mac M4 Pro/Max con 48 GB unificados.
Nemotron Super — Q5/Q8
Q5_K_M sube a unos 35 GB, Q8_0 supera los 50 GB. Reservado para configuraciones con mucha VRAM o varias GPU.
Margen de contexto
Añade entre 1 y 4 GB según la longitud de contexto deseada. Un contexto largo para razonamiento genera muchos tokens intermedios, por lo que aumenta la huella de memoria.
→
Verificar qué cabe realmente
Después de ejecutar «ollama run», ejecuta «ollama ps» en otro terminal. La columna PROCESSOR indica «100% GPU» si todo está en VRAM, o un reparto «GPU/CPU» si Ollama ha tenido que trasladar parte del modelo a la RAM; en ese caso, la velocidad cae considerablemente. Es la señal de que debes elegir un modelo de menor tamaño o bajar un nivel de cuantización.

En cuanto al software, el requisito es mínimo: tener instalado el daemon de Ollama, que escucha por defecto en http://localhost:11434. Si usas una GPU NVIDIA, asegúrate de que los controladores CUDA estén actualizados; Ollama detecta la GPU automáticamente. Una interfaz como Open WebUI o LM Studio como capa adicional aporta comodidad, pero no es obligatoria.

#Instalar Nemotron mediante Ollama

La instalación sigue exactamente el flujo habitual de Ollama. Si el daemon ya está en ejecución, una sola orden descarga y arranca el modelo.

  1. 01
    Verificar que Ollama esté en ejecución
    Abre un terminal y ejecuta « ollama --version ». Si el comando responde, el daemon está listo. De lo contrario, instala Ollama primero (véase la guía de instalación al final del artículo).
  2. 02
    Descargar la variante Nano
    Para probar sin arriesgarte a superar la capacidad de la VRAM, empieza por Nano. El comando descarga los pesos y luego abre una sesión de chat directamente en el terminal.
  3. 03
    Pasar a Super si tu GPU lo permite
    Una vez que te sientas cómodo y si tienes suficiente VRAM, descarga la variante Super para mejorar la calidad del razonamiento y del código.
  4. 04
    Listar y gestionar los modelos
    « ollama list » muestra los modelos instalados y su tamaño en disco. « ollama rm <modelo> » libera espacio de una variante que ya no usas.
Terminal — instalación de Nemotron
# Vérifier qu'Ollama répond
ollama --version

# Variante Nano (~9B) — cartes grand public
ollama run nemotron-nano

# Variante Super (~49B) — grosse VRAM / multi-GPU
ollama run nemotron-super

# Voir ce qui est installé et vérifier le placement GPU
ollama list
ollama ps
!
Los tags evolucionan
La biblioteca de Ollama actualiza regularmente los nombres y las versiones de los modelos Nemotron. Antes de ejecutar un comando, verifica el tag exacto en ollama.com/library: el nombre del modelo y su número de versión pueden diferir del ejemplo anterior según la generación publicada.

Para llamar a Nemotron desde tus propios scripts, la API REST de Ollama está disponible en el mismo puerto. El campo «model» contiene la etiqueta exacta del modelo que has descargado.

Terminal — llamada a la API
curl http://localhost:11434/api/generate -d '{
  "model": "nemotron-nano",
  "prompt": "Explique la différence entre RAG et fine-tuning en trois phrases.",
  "stream": false
}'

#El modo de razonamiento controlable

El rasgo distintivo de los modelos Nemotron es un razonamiento que se puede activar o desactivar a demanda. NVIDIA entrenó estos modelos para producir una cadena de pensamiento detallada cuando se les pide mediante el prompt del sistema, y para responder directamente en caso contrario. En concreto, se alterna entre dos modos con una simple instrucción del sistema: «detailed thinking on» para forzar el razonamiento paso a paso, «detailed thinking off» para obtener una respuesta concisa y rápida.

Este interruptor es útil porque el razonamiento tiene un costo. Una cadena de pensamiento genera muchos tokens intermedios: esto resulta valioso para un problema de matemáticas, de lógica o una depuración delicada, pero es un desperdicio para reformular un correo electrónico. Con Nemotron decides, prompt a prompt, si pagas este costo adicional.

Terminal — activar el razonamiento
# Dans une session ollama run, définir le system prompt :
/set system detailed thinking on

# Puis poser une question de raisonnement
Un train part de A à 60 km/h, un autre de B à 90 km/h... résous étape par étape.
→
Desactivar el razonamiento para ir más rápido
Para texto sencillo, reformulación o clasificación, selecciona «detailed thinking off». Reduces la latencia y el consumo de tokens sin perder calidad en estas tareas, en las que pensar en voz alta no aporta nada.

Este funcionamiento acerca a Nemotron a modelos como DeepSeek R1 o Qwen3 en su modo «thinking», pero con un control más explícito: el razonamiento no es un modo global del modelo, sino un ajuste que controlas a lo largo de la conversación.

#Código, agentes y llamadas a herramientas

NVIDIA optimiza Nemotron sobre todo para dos usos: el razonamiento y las tareas con agentes. En programación, las variantes Super compiten con los buenos modelos de 32-70B para generar, explicar y corregir código. Nano sigue siendo adecuado para asistencia puntual, pero muestra sus límites en tareas largas o refactorizaciones extensas; es lo esperable en un modelo de su tamaño.

El verdadero factor diferenciador es la llamada a funciones. Nemotron está entrenado para producir llamadas a herramientas fiables y bien formadas, lo que lo convierte en un buen candidato para construir agentes locales: un modelo que decide llamar a una función, lee el resultado y continúa. Combinado con el modo de razonamiento, esto permite obtener agentes capaces de planificar antes de actuar en lugar de lanzarse sin pensar.

Razonamiento / matemáticas
Un punto fuerte claro, especialmente en Super con « detailed thinking on ». La cadena de pensamiento reduce los errores de cálculo y de lógica.
Código
Super rivaliza con los 70B en generación y depuración; Nano sirve para asistencia ligera y autocompletado.
Agentes y herramientas
Llamadas a herramientas fiables, formato JSON respetado — uno de los mejores usos de la familia para automatización local.
Francés / conversación general
Correcto sin ser el mejor de su categoría. Nemotron está diseñado para razonar y actuar, menos para charlar en múltiples idiomas.

#Frente a Qwen3: cuándo preferir Nemotron

Qwen3 es la referencia de pesos abiertos con la que comparar, ya que ambas familias compiten en el mismo terreno: razonamiento, código, varios tamaños y modo thinking. En muchas tareas generales y en calidad del francés, Qwen3 mantiene la ventaja a igual tamaño: es un modelo más versátil y mejor entrenado para trabajar en varios idiomas.

Nemotron recupera la ventaja cuando tu uso se orienta hacia los agentes de IA y la integración en un ecosistema NVIDIA. Si construyes un agente con muchas llamadas a herramientas, si quieres un control explícito del razonamiento en cada prompt o si utilizas un conjunto de GPU NVIDIA donde importa la tasa de procesamiento de la inferencia, merece la pena probar Nemotron. En cambio, para un asistente conversacional generalista en francés, Qwen3 es la opción predeterminada más segura.

Elegir Nemotron si
Agentes que hacen un uso intensivo de las llamadas a herramientas, necesidad de controlar con precisión la activación y desactivación del razonamiento, infraestructura 100 % NVIDIA o búsqueda de la mejor relación calidad/cálculo en razonamiento puro.
Elegir Qwen3 si
Asistente generalista, prioridad al francés y al uso multilingüe, versatilidad conversacional, o simplemente el modelo más probado para un uso amplio.
Veredicto práctico
Prueba ambos con tamaños comparables (Nano vs Qwen3-8B, Super vs Qwen3-32B) con TUS prompts reales. La diferencia depende mucho de la tarea, no de una clasificación abstracta.

#Solución de problemas

« model not found » al hacer pull
La etiqueta no existe con ese nombre. Comprueba cómo se escribe exactamente en ollama.com/library: los nombres de Nemotron cambian de una generación a otra.
Caída drástica de la velocidad con Super
Parte del modelo se carga en la RAM por falta de VRAM. «ollama ps» muestra un reparto entre GPU y CPU. Cambia a Nano, a una cuantización más baja (Q4), o añade capacidad de GPU.
El razonamiento no se activa
El prompt de sistema no se tiene en cuenta. En una sesión interactiva, utiliza «/set system detailed thinking on»; mediante la API, incluye la instrucción en el campo system, no en el prompt del usuario.
Respuestas demasiado verbosas
El modo de razonamiento está activado por defecto o por una configuración heredada. Cambia a «detailed thinking off» para las tareas sencillas.
« Connection refused »
El daemon Ollama no está en ejecución. Verifica con «ollama ps» y asegúrate de que el servicio esté escuchando bien en http://localhost:11434.

#Para ir más allá

Nemotron se apoya en componentes ya tratados en el sitio. Estas guías amplían lo explicado en esta:

Qwen 3 en local: prueba completa y benchmarks reales
La comparativa imprescindible para situar a Nemotron frente a su principal alternativa de pesos abiertos, con cifras de tokens/segundo.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para equilibrar calidad y VRAM en Nemotron Super, donde cada nivel de cuantización cambia lo que cabe en tu tarjeta.
Instalar Ollama en Linux
El requisito previo si el daemon aún no está en marcha: script de instalación, servicio systemd y configuración de la GPU NVIDIA.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.