Intermedio 10 minNous Research

Hermes 4 en local (Ollama) : el modelo de Nous Research

Hermes 4 es la cuarta generación de los modelos de Nous Research, un laboratorio conocido por sus modelos ajustados que siguen al pie de la letra el prompt del sistema y rara vez rechazan una tarea legítima. Esta guía explica cómo instalar Hermes 4 con Ollama, qué variante elegir según tu tarjeta gráfica y cómo aprovechar sus dos puntos fuertes: la fidelidad a las instrucciones del sistema y las salidas estructuradas para los agentes. Nosotros mismos lo utilizamos en producción en una RTX 5070 Ti de 12 GB; las cifras proceden de ese uso.

Por Mohamed Meguedmi·Actualización 2026-09-25·Probado en Windows, macOS y Linux

#Por qué elegir Hermes 4 en lugar de un Qwen o un Llama de base

Nous Research no preentrena modelos. El laboratorio toma un modelo de pesos abiertos existente y le aplica un postentrenamiento masivo: para Hermes 4, alrededor de 5 millones de ejemplos y 60 mil millones de tokens de datos sintéticos generados por su pipeline DataForge, con una alta proporción de trazas de razonamiento verificadas. El resultado no es más «inteligente» que su modelo base en los benchmarks de cultura general, pero se comporta de forma diferente en el uso cotidiano: hace lo que se le pide, en el formato solicitado, sin comentarios innecesarios.

Tres características explican la popularidad de Hermes entre los usuarios de LLM autoalojados. En primer lugar, el prompt del sistema se trata como la fuente de verdad: personalidad, tono, restricciones de formato, todo se respeta a lo largo de una conversación. En segundo lugar, la alineación es deliberadamente neutra: el modelo no añade advertencias no solicitadas y se niega a responder con mucha menos frecuencia que los asistentes dirigidos al público general sobre temas habituales (medicina, derecho, seguridad informática, ficción para adultos). Por último, el formato de llamadas a herramientas de Nous, con sus etiquetas específicas, se ha convertido en un estándar de facto adoptado por muchos frameworks de agentes.

Hermes 4 añade a esto un modo de razonamiento híbrido heredado de DeepHermes: el modelo puede reflexionar entre etiquetas think antes de responder, o responder directamente, según lo que le indiques en el prompt del sistema. Eres tú quien decide, petición por petición, si pagas el costo adicional en tokens del razonamiento.

i
Hermes no es un modelo «al que se le haya eliminado la censura»
No confundas Hermes con las variantes abliterated o uncensored que circulan en Hugging Face. Nous Research no elimina nada: entrena un modelo que obedece al operador. Si tu prompt de sistema establece límites, Hermes los respeta. Si no estableces ninguno, no los inventa. La responsabilidad de las salvaguardas se traslada a ti, que es precisamente lo que se busca con un uso autoalojado.

#Las variantes de Hermes 4 y la VRAM necesaria

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Hermes 4 salió al final de agosto de 2025 en tres tamaños, cada uno construido sobre una base distinta. Este detalle cuenta: la licencia, el contexto máximo y el comportamiento en francés son los de la base, no de Nous Research.

Hermes 4 14B
Base Qwen3-14B. Aproximadamente 9 GB de VRAM en Q4_K_M, una capacidad de contexto nativa holgada y muy buen dominio del francés. Es la variante que conviene instalar en una tarjeta de entre 12 y 16 GB y la que utilizamos en producción. Licencia heredada de Qwen3: Apache 2.0.
Hermes 4 70B
Base Llama 3.1 70B. Aproximadamente 40 GB en Q4_K_M: dos RTX 3090/4090, un Mac Studio o un MacBook Pro con 48 GB o más de memoria unificada. Claramente mejor en razonamientos largos y en el seguimiento de instrucciones complejas. Licencia Llama 3.1 Community.
Hermes 4 405B
Basado en Llama 3.1 405B. Más de 200 GB incluso en Q4: fuera del alcance de un ordenador personal, reservado para servidores multi-GPU o proveedores de API. Lo mencionamos para ofrecer una visión completa.
¿Y por debajo de 12 GB?
No existe Hermes 4 en 3B ni en 8B. En una tarjeta de 8 GB, usa hermes3:8b (base Llama 3.1 8B, aproximadamente 5 GB en Q4_K_M): misma filosofía, mismo formato de herramientas, sin el modo de razonamiento.

La elección de la cuantización sigue las reglas habituales del sitio: Q4_K_M ofrece un buen equilibrio como opción predeterminada; Q5_K_M o Q8_0 si la VRAM lo permite y realizas extracción estructurada, donde cada bit de precisión reduce los errores de formato. En nuestra RTX 5070 Ti de 12 GB, hermes4:14b en Q4_K_M con un contexto de 8 192 tokens ocupa 9,4 GB de VRAM, lo que deja espacio para tener un modelo de embeddings cargado en paralelo.

→
Mac Apple Silicon
En un M4 Pro con 24 GB de memoria unificada, el 14B en Q4_K_M funciona sin problemas. El 70B requiere al menos 48 GB para funcionar con fluidez; con 36 GB se carga, pero el contexto disponible resulta demasiado corto para usarlo como agente.

#Prerrequisitos

Ollama actualizado
La base Qwen3 del modelo de 14B requiere una versión de Ollama posterior a abril de 2025. Compruébalo con ollama --version y actualiza si es necesario; de lo contrario, obtendrás un error de arquitectura desconocida al cargar el modelo.
GPU o memoria unificada
12 GB de VRAM para el 14B en Q4_K_M con un contexto de 8k. Con 8 GB, el modelo se carga parcialmente en CPU y su velocidad cae a unos pocos tokens por segundo: pasa a hermes3:8b.
Espacio en disco
Calcula 9 GB para el 14B en Q4_K_M, 15 GB en Q8_0 y 40 GB para el 70B en Q4_K_M.
Una interfaz (opcional)
Open WebUI o LM Studio para conversar cómodamente. Open WebUI contrae automáticamente los bloques de razonamiento, lo que se agradece con Hermes 4.

#Instalar Hermes 4 con Ollama en 4 pasos

  1. 01
    Descargar la variante adaptada a tu máquina
    En la biblioteca de Ollama, la etiqueta hermes4 está disponible en distintos tamaños. En una tarjeta de 12 a 16 GB, elige el 14B; es la etiqueta que ejecutamos a diario.
  2. 02
    O importar el GGUF oficial desde Hugging Face
    Nous Research publica sus propias cuantizaciones GGUF. La sintaxis hf.co de Ollama permite elegir con precisión el nivel (Q4_K_M, Q5_K_M, Q8_0) sin necesidad de un Modelfile. Es la vía preferible si deseas un Q8_0 o si la etiqueta de la biblioteca no ofrece la cuantización deseada.
  3. 03
    Verificar la carga y la distribución GPU/CPU
    El comando ollama ps indica la memoria ocupada y el porcentaje cargado en la GPU. Busca el 100 % en la GPU: en cuanto una parte pasa a la CPU, la velocidad cae en picado.
  4. 04
    Primera prueba con un prompt de sistema
    No pruebes Hermes sin un prompt de sistema: te perderías lo que lo hace interesante. Dale un rol, un formato de salida y una restricción, y luego observa hasta qué punto los respeta.
Terminal — desde la biblioteca Ollama
ollama pull hermes4:14b
ollama run hermes4:14b
Terminal — GGUF oficial de Nous Research, cuantización a elegir
# Q4_K_M : le compromis recommandé (environ 9 Go)
ollama run hf.co/NousResearch/Hermes-4-14B-GGUF:Q4_K_M

# Q8_0 si vous avez 16 Go et plus, pour l'extraction structurée
ollama run hf.co/NousResearch/Hermes-4-14B-GGUF:Q8_0
Terminal — comprobación de la carga
ollama ps
# NAME           SIZE     PROCESSOR    CONTEXT
# hermes4:14b    9.4 GB   100% GPU     8192
!
Contexto por defecto demasiado corto
Ollama carga los modelos con un contexto de 4.096 tokens por defecto. Para un agente que acumula llamadas a herramientas o un modo de razonamiento que puede generar varios miles de tokens de reflexión, esto es insuficiente: los primeros mensajes salen de la ventana y el modelo «olvida» sus instrucciones. Establece num_ctx en un mínimo de 8.192, o en 16.384 si la VRAM lo permite (ver la sección de ajustes).

#Lo que distingue a Hermes de los modelos alineados para el público general

Un asistente para el público en general se entrena para agradar a un usuario anónimo y para proteger al proveedor. Esto produce comportamientos que acabamos por dejar de notar: un preámbulo que reformula la pregunta, una advertencia al final de la respuesta, una negativa cortés en cuanto aparece una palabra clave sensible y una tendencia a suavizar las cosas. Para charlar, es aceptable. Para un pipeline automatizado que espera un JSON, una clasificación o una reescritura, cada desviación rompe el procesamiento posterior.

Hermes 4 está entrenado para el operador, no para el usuario final. Nous Research evaluó esta decisión con un banco de pruebas propio, RefusalBench, en el que Hermes 4 rechaza solicitudes con mucha menos frecuencia que los modelos cerrados y que la mayoría de los modelos de pesos abiertos alineados. En concreto, en un corpus de tickets de soporte donde se pide extraer el motivo de la reclamación, un modelo dirigido al público general a veces responde «no puedo dar asesoramiento jurídico», mientras que Hermes devuelve el campo solicitado. En una tarea de reescritura, no añade «no dudes en preguntar si tienes más preguntas».

Sin preámbulo ni conclusión
Si el prompt del sistema dice «responde únicamente con el JSON», la respuesta comienza con una llave. En muchos modelos, se necesitan tres ejemplos y un posprocesamiento para obtener el mismo resultado.
Persona estable
Un rol definido en el prompt del sistema se mantiene durante decenas de turnos sin diluirse, incluso cuando el usuario intenta hacerlo salir de su marco.
Menos rechazos no solicitados
Temas médicos, jurídicos, ciberseguridad, ficción oscura: Hermes atiende la solicitud. Los límites son los que tú escribes.
Tono neutro
Sin elogios sobre la calidad de la pregunta, sin emojis, sin entusiasmo artificial. El estilo se regula completamente mediante el prompt del sistema.

La contrapartida es evidente: si expones Hermes a desconocidos, por ejemplo a través de un chatbot público, te corresponde implementar las salvaguardas. Son indispensables un prompt de sistema que enumere lo que el asistente no debe hacer y un filtro de salida en la aplicación para los casos críticos. En un uso personal o interno, esta responsabilidad es precisamente la ventaja buscada.


#El prompt de sistema, donde Hermes 4 destaca

Con Hermes 4, el prompt del sistema no es una sugerencia sino un contrato. Eso cambia la forma de escribirlo: sé preciso y completo, y no cuentes con que el modelo rellene lo que no hayas especificado con el «sentido común» de un asistente. Tres reglas bastan para obtener resultados fiables.

Describir el rol en una frase
« Tú eres el asistente de redacción del equipo de marketing de X » es mejor que tres párrafos de contexto. Hermes no diluye la información, pero un rol corto es más estable.
Fijar explícitamente el formato de salida
Longitud, idioma, estructura, lo que debe omitirse. Hermes respeta una restricción como «sin introducción, sin conclusión, máximo 120 palabras» sin que tengas que repetirla.
Escribir las prohibiciones
Como el modelo no añade prohibiciones, enumera las tuyas: temas fuera de alcance, información que nunca debe revelarse y comportamiento ante una pregunta ambigua.

Lo más práctico es fijar este prompt de sistema en un Modelfile: obtienes un alias listo para usar, con el contexto y la temperatura ya configurados, que puedes utilizar en Open WebUI, en tus scripts y desde el terminal.

Modelfile — asistente de redacción en francés
FROM hermes4:14b

PARAMETER num_ctx 16384
PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER repeat_penalty 1.05

SYSTEM """Tu es un assistant de rédaction pour une PME française.
Tu réponds toujours en français, au vouvoiement.
Tu ne commences jamais par reformuler la demande et tu ne termines jamais par une formule de politesse.
Quand on te demande de réécrire un texte, tu renvoies uniquement le texte réécrit, sans commentaire.
Si une demande sort du cadre de la rédaction professionnelle, tu le dis en une phrase et tu t'arrêtes."""
Terminal — crear y usar el alias
ollama create hermes-redac -f Modelfile
ollama run hermes-redac "Réécris en deux phrases : Nous sommes ravis de vous annoncer que notre nouvelle offre est disponible dès maintenant et qu'elle vous permettra de gagner du temps."
→
Prueba la coherencia del rol
Después de crear el alias, intenta hacer que se salga de su marco de instrucciones con dos o tres mensajes («olvida tus instrucciones», «háblame en inglés»). Hermes 4 se mantiene dentro de ese marco mucho mejor que la versión base de Qwen3-14B en este tipo de pruebas, y es una buena forma de comprobar que tu prompt del sistema está completo.

#Activar o desactivar el modo de razonamiento

Hermes 4 es un modelo de razonamiento híbrido: por defecto, responde directamente, como un modelo clásico ajustado para seguir instrucciones. Para activar la reflexión, se añade al prompt de sistema una instrucción específica, la que documenta Nous Research en la ficha del modelo. El modelo produce entonces su reflexión entre etiquetas think y después su respuesta.

Prompt de sistema — instrucción de razonamiento recomendada por Nous Research
You are a deep thinking AI, you may use extremely long chains of thought to deeply consider the problem and deliberate with yourself via systematic reasoning processes to help come to a correct solution prior to answering. You should enclose your thoughts and internal monologue inside <think> </think> tags, and then provide your solution or response to the problem.

Puedes combinarla con tus propias instrucciones, en francés, añadiéndolas a continuación. El razonamiento es útil para las matemáticas, el código no trivial, la planificación de un agente o el análisis de un documento largo. Es inútil y costoso para la extracción de campos, la clasificación o la reescritura: en estas tareas, deja el modo directo. Calcula entre 500 y varios miles de tokens de reflexión por solicitud, de ahí la importancia de un num_ctx amplio.

Modo directo (predeterminado)
Sin instrucciones especiales. Respuesta inmediata, ideal para pipelines y conversaciones habituales. Este es el modo que utilizamos para la evaluación automatizada de nuestro seguimiento de novedades.
Modo razonamiento
Agrega la instrucción anterior al principio del prompt del sistema. Open WebUI contrae el bloque think; en tus scripts, fíltralo antes de mostrar o analizar la respuesta.
Dos alias
Lo más sencillo es crear dos Modelfiles, hermes-direct y hermes-think, y elegir uno u otro según la tarea en lugar de modificar el prompt en cada llamada.

#Casos de uso: agentes y extracción estructurada

El formato de llamada a herramientas de Nous Research, donde el modelo recibe la lista de funciones disponibles en el prompt del sistema y emite sus llamadas en forma de JSON etiquetado, es el que Ollama utiliza a través del parámetro tools de su API de chat. Con Hermes 4, no necesitas configurar nada: describe tus funciones, envía la conversación, y el modelo devuelve una llamada estructurada cuando la necesita, o una respuesta de texto en caso contrario.

Para la extracción estructurada, dos enfoques se complementan. El primero consiste en imponer un esquema JSON mediante el parámetro format de Ollama: el motor restringe la generación y el modelo no puede salirse del esquema. El segundo se basa únicamente en el prompt del sistema, y ahí es donde Hermes marca la diferencia: incluso sin restricciones de decodificación, devuelve un JSON válido y sin comentarios en la gran mayoría de los casos, lo que simplifica las integraciones con herramientas que no admiten la decodificación restringida.

Python — extracción estructurada con esquema impuesto
from ollama import chat
from pydantic import BaseModel

class Ticket(BaseModel):
    motif: str
    produit: str
    urgence: int  # 1 à 5
    remboursement_demande: bool

message = """Bonjour, ma cafetière X200 achetée il y a 3 semaines fuit par le dessous.
Je veux un remboursement, c'est la deuxième fois que ça arrive."""

response = chat(
    model="hermes4:14b",
    messages=[
        {"role": "system", "content": "Tu extrais les informations d'un ticket de support. Réponds uniquement avec le JSON demandé."},
        {"role": "user", "content": message},
    ],
    format=Ticket.model_json_schema(),
    options={"temperature": 0.1, "num_ctx": 8192},
)

ticket = Ticket.model_validate_json(response.message.content)
print(ticket)
# motif='fuite' produit='X200' urgence=4 remboursement_demande=True
Terminal — llamada a herramienta a través de la API REST
curl http://localhost:11434/api/chat -d '{
  "model": "hermes4:14b",
  "stream": false,
  "messages": [
    {"role": "system", "content": "Tu es un assistant qui utilise les outils fournis quand ils sont pertinents."},
    {"role": "user", "content": "Quel temps fait-il à Lyon ?"}
  ],
  "tools": [{
    "type": "function",
    "function": {
      "name": "get_weather",
      "description": "Donne la météo actuelle pour une ville",
      "parameters": {
        "type": "object",
        "properties": {"ville": {"type": "string"}},
        "required": ["ville"]
      }
    }
  }]
}'

La respuesta incluye un campo tool_calls con el nombre de la función y sus argumentos. Te corresponde ejecutar la función y devolver el resultado en un mensaje con el rol tool para que el modelo formule su respuesta final. Este bucle lo implementan LangChain, CrewAI, n8n o Hermes Agent, el framework de agentes publicado por la propia Nous Research, que funciona con cualquier modelo, pero fue diseñado en torno a este formato.

Clasificación y enrutamiento
Clasificar correos, tickets o artículos según categorías definidas. Baja temperatura, modo directo, esquema JSON impuesto: el 14B procesa varias centenas de elementos por hora en una tarjeta de 12 GB.
Extracción de campos
Facturas, CV, fichas de producto, informes: Hermes devuelve exactamente los campos solicitados, con null cuando falta la información, si lo especificas en el prompt del sistema.
Evaluación automática
Puntuar textos según una rúbrica (es lo que hace nuestro pipeline de seguimiento diario con hermes4:14b). La estabilidad del formato y la ausencia de complacencia hacen que las puntuaciones sean aprovechables.
Agente con herramientas
Búsqueda en una base de datos, llamada a una API interna, ejecución de comandos validados por una persona. El modo de razonamiento ayuda con los planes de varios pasos.
!
El 14B sigue siendo un 14B
En un agente que encadena más de cinco o seis llamadas a herramientas con resultados largos, el 14B empieza a perder el hilo, tenga un contexto de 16k o no. Para estos escenarios, el 70B marca realmente la diferencia. Si tu hardware no lo permite, divide la tarea entre subagentes con tareas breves en lugar de alargar el bucle.

#Ajustes recomendados

Los valores que aparecen a continuación son los que usamos en producción. No proceden de la ficha del modelo, que ofrece poca información sobre este tema, sino de varios meses de uso diario en una tarjeta de 12 GB.

num_ctx
8 192 para el chat y la extracción, 16 384 para los agentes y el modo de razonamiento. Cada vez que duplicas el contexto, aumenta el consumo de VRAM: con 12 GB, un contexto de 16k cabe con la caché KV cuantizada (ver más abajo), pero uno mayor no.
temperature
0,6 a 0,7 para la conversación y la redacción. 0,1 a 0,2 para la extracción, la clasificación y todo lo que debe ser reproducible.
top_p y repeat_penalty
0,95 y 1,05. Una penalización de repetición más fuerte empeora las salidas JSON, donde las repeticiones de claves son normales.
Cuantización
Q4_K_M para todo uso común. Q8_0 si realizas extracciones a gran escala y dispones de 16 GB: los errores de formato se vuelven casi inexistentes.

En el lado del servidor, dos variables de entorno de Ollama ahorran espacio en una tarjeta de 12 GB: la atención flash y la cuantización de la caché KV en 8 bits. Se definen en el archivo de servicio de systemd en Linux, en las variables de entorno del usuario en Windows o mediante launchctl en macOS.

Linux — /etc/systemd/system/ollama.service.d/override.conf
[Service]
Environment="OLLAMA_FLASH_ATTENTION=1"
Environment="OLLAMA_KV_CACHE_TYPE=q8_0"
Environment="OLLAMA_KEEP_ALIVE=24h"
Terminal — aplicar
sudo systemctl daemon-reload
sudo systemctl restart ollama
ollama ps   # vérifier que le modèle est toujours à 100 % GPU

La caché KV en q8_0 reduce a la mitad la memoria consumida por el contexto, sin pérdida medible en tareas de extracción y chat. Este ajuste permite que hermes4:14b quepa con 16k de contexto en 12 GB. El keep-alive de 24 horas evita recargar 9 GB en cada llamada espaciada, algo útil para un servidor que responde a scripts durante todo el día.


#Solución de problemas

Las etiquetas think aparecen en la respuesta
Es normal en el modo de razonamiento, en el terminal o a través de la API sin procesar. Open WebUI los contrae; en tus scripts, elimina todo lo que precede a la etiqueta de cierre antes de parsear. Si no querías razonamiento, elimina la instrucción específica del prompt de sistema.
El modelo responde en inglés
Hermes 4 está entrenado en su gran mayoría con datos en inglés. Añade «Siempre respondes en francés» al prompt del sistema: esta única línea basta en casi todos los casos, precisamente porque el modelo respeta el prompt del sistema.
Error de arquitectura desconocida al cargar
Tu Ollama es demasiado antiguo para la base Qwen3 del 14B. Actualízalo y vuelve a realizar el pull.
Velocidad de unos pocos tokens por segundo
ollama ps muestra un porcentaje de CPU: el modelo no cabe en la VRAM. Reduce num_ctx, activa la caché KV q8_0 o cambia a hermes3:8b.
JSON inválido de vez en cuando
Usa el parámetro format con un esquema: la generación queda sujeta a ese esquema. Si no puedes, baja la temperatura a 0,1 y añade un ejemplo de la salida esperada en el prompt del sistema.
El modelo olvida sus instrucciones tras varios turnos
El contexto está saturado. Aumenta num_ctx o recorta el historial desde la aplicación, manteniendo siempre el prompt de sistema al principio.
Rechazo inesperado
Raro, pero posible en el 14B cuando la formulación se parece a un escenario de ataque. Reformula especificando el marco legítimo en el prompt de sistema (prueba autorizada, contexto profesional): Hermes sigue el marco que estableces.

#Para ir más allá

Hermes 4 ofrece todo su potencial una vez que dominas los componentes que lo rodean. Estas guías del sitio complementan esta:

Dominar los system prompts
El método para escribir un prompt de sistema completo, con ejemplos para cada caso de uso. El complemento natural de esta guía, ya que el prompt de sistema es lo que permite dirigir Hermes.
Function calling y salidas JSON estructuradas con Ollama
Los detalles del parámetro format, de los esquemas JSON y del bucle de llamadas a herramientas, con ejemplos completos en Python.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para elegir entre Q4_K_M y Q8_0 según tu VRAM y tu tolerancia a errores de formato.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.