Nemotron 3 en local: los modelos NVIDIA con Ollama
NVIDIA no solo fabrica GPU: la marca también realiza el postentrenamiento de sus propios LLM, la familia Nemotron. Esta guía muestra cómo instalar Nemotron 3 localmente con Ollama, qué variantes (Nano, Super) elegir según tu VRAM, qué optimiza NVIDIA de forma diferente a los demás —razonamiento controlable y uso en agentes— y cuándo estos modelos merecen la pena frente a los Qwen3 equivalentes.
#¿Por qué Nemotron en lugar de otro modelo?
Nemotron no es un modelo entrenado desde cero. NVIDIA parte de modelos base sólidos con pesos abiertos (Llama, Qwen según las versiones) y luego aplica su propia receta de postentrenamiento: poda (pruning) para reducir el tamaño, destilación para recuperar la calidad perdida y un ajuste fino masivo orientado al razonamiento, las matemáticas, el código y las llamadas a herramientas. El resultado persigue un objetivo preciso: la mejor relación entre calidad y costo computacional para tareas de agente, no para la conversación generalista.
Otra particularidad es que NVIDIA optimiza estos modelos para su propio hardware y sus propios pipelines de inferencia. En la práctica, esto se traduce en tasas de generación sólidas en GPU NVIDIA y en una familia concebida como una gama coherente: una versión pequeña para tarjetas de consumo, una versión mediana para estaciones de trabajo y una versión gigante para servidores. Eliges según la VRAM disponible sin cambiar la lógica de los prompts.
#Nano, Super y Ultra: ¿qué variante?
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
La gama Nemotron 3 se ofrece en tres tamaños, cada uno para un tipo de máquina. El nombre indica más el tipo de máquina al que se dirige que el número exacto de parámetros.
- Nano (~8-9B)
- La versión para tarjetas de consumo. Cabe holgadamente en una RTX 3060 de 12 GB o en cualquier GPU con al menos 8 GB de VRAM en Q4. Es el punto de entrada ideal para probar Nemotron y para agentes ligeros.
- Super (~49B)
- La versión para estaciones de trabajo y GPU de gran tamaño. Busca la calidad de un modelo de 70B con un coste de cálculo menor, gracias a la poda de NVIDIA. Requiere una RTX 4090 de 24 GB (con muy poco margen en Q4) o, mejor aún, una tarjeta de 32-48 GB.
- Ultra (~253B)
- La versión para servidores, fuera del alcance de un equipo de consumo. Reservada para estaciones de trabajo con varias GPU o centros de datos. Se menciona aquí para situar la gama, no para un uso local habitual.
Para un equipo local, la elección real está entre Nano y Super. Nano si tienes una tarjeta de 8 a 16 GB o si la velocidad es prioritaria. Super si tienes 24 GB o más y buscas la máxima calidad en tareas exigentes de razonamiento o programación.
#Requisitos y VRAM por variante
Como ocurre con cualquier modelo local, la VRAM es el factor limitante. Estas son las referencias con cuantización Q4_K_M, la recomendada por defecto porque ofrece el mejor equilibrio entre calidad y memoria. Reserva siempre un margen para la ventana de contexto, que consume memoria además de los pesos.
- Nemotron Nano (~9B) — Q4
- ≈ 6-7 GB de VRAM. Funciona con margen en una RTX 3060 de 12 GB, una RTX 4070 de 12 GB o un Mac Apple Silicon con al menos 16 GB de memoria unificada.
- Nemotron Super (~49B) — Q4
- ≈ 28-30 GB. No cabe en una sola RTX 4090 de 24 GB sin offload: prevé una tarjeta de 32 GB o más, dos GPUs, o un Mac M4 Pro/Max con 48 GB unificados.
- Nemotron Super — Q5/Q8
- Q5_K_M sube a unos 35 GB, Q8_0 supera los 50 GB. Reservado para configuraciones con mucha VRAM o varias GPU.
- Margen de contexto
- Añade entre 1 y 4 GB según la longitud de contexto deseada. Un contexto largo para razonamiento genera muchos tokens intermedios, por lo que aumenta la huella de memoria.
En cuanto al software, el requisito es mínimo: tener instalado el daemon de Ollama, que escucha por defecto en http://localhost:11434. Si usas una GPU NVIDIA, asegúrate de que los controladores CUDA estén actualizados; Ollama detecta la GPU automáticamente. Una interfaz como Open WebUI o LM Studio como capa adicional aporta comodidad, pero no es obligatoria.
#Instalar Nemotron mediante Ollama
La instalación sigue exactamente el flujo habitual de Ollama. Si el daemon ya está en ejecución, una sola orden descarga y arranca el modelo.
- 01Verificar que Ollama esté en ejecuciónAbre un terminal y ejecuta « ollama --version ». Si el comando responde, el daemon está listo. De lo contrario, instala Ollama primero (véase la guía de instalación al final del artículo).
- 02Descargar la variante NanoPara probar sin arriesgarte a superar la capacidad de la VRAM, empieza por Nano. El comando descarga los pesos y luego abre una sesión de chat directamente en el terminal.
- 03Pasar a Super si tu GPU lo permiteUna vez que te sientas cómodo y si tienes suficiente VRAM, descarga la variante Super para mejorar la calidad del razonamiento y del código.
- 04Listar y gestionar los modelos« ollama list » muestra los modelos instalados y su tamaño en disco. « ollama rm <modelo> » libera espacio de una variante que ya no usas.
Para llamar a Nemotron desde tus propios scripts, la API REST de Ollama está disponible en el mismo puerto. El campo «model» contiene la etiqueta exacta del modelo que has descargado.
#El modo de razonamiento controlable
El rasgo distintivo de los modelos Nemotron es un razonamiento que se puede activar o desactivar a demanda. NVIDIA entrenó estos modelos para producir una cadena de pensamiento detallada cuando se les pide mediante el prompt del sistema, y para responder directamente en caso contrario. En concreto, se alterna entre dos modos con una simple instrucción del sistema: «detailed thinking on» para forzar el razonamiento paso a paso, «detailed thinking off» para obtener una respuesta concisa y rápida.
Este interruptor es útil porque el razonamiento tiene un costo. Una cadena de pensamiento genera muchos tokens intermedios: esto resulta valioso para un problema de matemáticas, de lógica o una depuración delicada, pero es un desperdicio para reformular un correo electrónico. Con Nemotron decides, prompt a prompt, si pagas este costo adicional.
Este funcionamiento acerca a Nemotron a modelos como DeepSeek R1 o Qwen3 en su modo «thinking», pero con un control más explícito: el razonamiento no es un modo global del modelo, sino un ajuste que controlas a lo largo de la conversación.
#Código, agentes y llamadas a herramientas
NVIDIA optimiza Nemotron sobre todo para dos usos: el razonamiento y las tareas con agentes. En programación, las variantes Super compiten con los buenos modelos de 32-70B para generar, explicar y corregir código. Nano sigue siendo adecuado para asistencia puntual, pero muestra sus límites en tareas largas o refactorizaciones extensas; es lo esperable en un modelo de su tamaño.
El verdadero factor diferenciador es la llamada a funciones. Nemotron está entrenado para producir llamadas a herramientas fiables y bien formadas, lo que lo convierte en un buen candidato para construir agentes locales: un modelo que decide llamar a una función, lee el resultado y continúa. Combinado con el modo de razonamiento, esto permite obtener agentes capaces de planificar antes de actuar en lugar de lanzarse sin pensar.
- Razonamiento / matemáticas
- Un punto fuerte claro, especialmente en Super con « detailed thinking on ». La cadena de pensamiento reduce los errores de cálculo y de lógica.
- Código
- Super rivaliza con los 70B en generación y depuración; Nano sirve para asistencia ligera y autocompletado.
- Agentes y herramientas
- Llamadas a herramientas fiables, formato JSON respetado — uno de los mejores usos de la familia para automatización local.
- Francés / conversación general
- Correcto sin ser el mejor de su categoría. Nemotron está diseñado para razonar y actuar, menos para charlar en múltiples idiomas.
#Frente a Qwen3: cuándo preferir Nemotron
Qwen3 es la referencia de pesos abiertos con la que comparar, ya que ambas familias compiten en el mismo terreno: razonamiento, código, varios tamaños y modo thinking. En muchas tareas generales y en calidad del francés, Qwen3 mantiene la ventaja a igual tamaño: es un modelo más versátil y mejor entrenado para trabajar en varios idiomas.
Nemotron recupera la ventaja cuando tu uso se orienta hacia los agentes de IA y la integración en un ecosistema NVIDIA. Si construyes un agente con muchas llamadas a herramientas, si quieres un control explícito del razonamiento en cada prompt o si utilizas un conjunto de GPU NVIDIA donde importa la tasa de procesamiento de la inferencia, merece la pena probar Nemotron. En cambio, para un asistente conversacional generalista en francés, Qwen3 es la opción predeterminada más segura.
- Elegir Nemotron si
- Agentes que hacen un uso intensivo de las llamadas a herramientas, necesidad de controlar con precisión la activación y desactivación del razonamiento, infraestructura 100 % NVIDIA o búsqueda de la mejor relación calidad/cálculo en razonamiento puro.
- Elegir Qwen3 si
- Asistente generalista, prioridad al francés y al uso multilingüe, versatilidad conversacional, o simplemente el modelo más probado para un uso amplio.
- Veredicto práctico
- Prueba ambos con tamaños comparables (Nano vs Qwen3-8B, Super vs Qwen3-32B) con TUS prompts reales. La diferencia depende mucho de la tarea, no de una clasificación abstracta.
#Solución de problemas
- « model not found » al hacer pull
- La etiqueta no existe con ese nombre. Comprueba cómo se escribe exactamente en ollama.com/library: los nombres de Nemotron cambian de una generación a otra.
- Caída drástica de la velocidad con Super
- Parte del modelo se carga en la RAM por falta de VRAM. «ollama ps» muestra un reparto entre GPU y CPU. Cambia a Nano, a una cuantización más baja (Q4), o añade capacidad de GPU.
- El razonamiento no se activa
- El prompt de sistema no se tiene en cuenta. En una sesión interactiva, utiliza «/set system detailed thinking on»; mediante la API, incluye la instrucción en el campo system, no en el prompt del usuario.
- Respuestas demasiado verbosas
- El modo de razonamiento está activado por defecto o por una configuración heredada. Cambia a «detailed thinking off» para las tareas sencillas.
- « Connection refused »
- El daemon Ollama no está en ejecución. Verifica con «ollama ps» y asegúrate de que el servicio esté escuchando bien en http://localhost:11434.
#Para ir más allá
Nemotron se apoya en componentes ya tratados en el sitio. Estas guías amplían lo explicado en esta:
- Qwen 3 en local: prueba completa y benchmarks reales
- La comparativa imprescindible para situar a Nemotron frente a su principal alternativa de pesos abiertos, con cifras de tokens/segundo.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para equilibrar calidad y VRAM en Nemotron Super, donde cada nivel de cuantización cambia lo que cabe en tu tarjeta.
- Instalar Ollama en Linux
- El requisito previo si el daemon aún no está en marcha: script de instalación, servicio systemd y configuración de la GPU NVIDIA.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.