Hermes 4 en local (Ollama) : el modelo de Nous Research
Hermes 4 es la cuarta generación de los modelos de Nous Research, un laboratorio conocido por sus modelos ajustados que siguen al pie de la letra el prompt del sistema y rara vez rechazan una tarea legítima. Esta guía explica cómo instalar Hermes 4 con Ollama, qué variante elegir según tu tarjeta gráfica y cómo aprovechar sus dos puntos fuertes: la fidelidad a las instrucciones del sistema y las salidas estructuradas para los agentes. Nosotros mismos lo utilizamos en producción en una RTX 5070 Ti de 12 GB; las cifras proceden de ese uso.
#Por qué elegir Hermes 4 en lugar de un Qwen o un Llama de base
Nous Research no preentrena modelos. El laboratorio toma un modelo de pesos abiertos existente y le aplica un postentrenamiento masivo: para Hermes 4, alrededor de 5 millones de ejemplos y 60 mil millones de tokens de datos sintéticos generados por su pipeline DataForge, con una alta proporción de trazas de razonamiento verificadas. El resultado no es más «inteligente» que su modelo base en los benchmarks de cultura general, pero se comporta de forma diferente en el uso cotidiano: hace lo que se le pide, en el formato solicitado, sin comentarios innecesarios.
Tres características explican la popularidad de Hermes entre los usuarios de LLM autoalojados. En primer lugar, el prompt del sistema se trata como la fuente de verdad: personalidad, tono, restricciones de formato, todo se respeta a lo largo de una conversación. En segundo lugar, la alineación es deliberadamente neutra: el modelo no añade advertencias no solicitadas y se niega a responder con mucha menos frecuencia que los asistentes dirigidos al público general sobre temas habituales (medicina, derecho, seguridad informática, ficción para adultos). Por último, el formato de llamadas a herramientas de Nous, con sus etiquetas específicas, se ha convertido en un estándar de facto adoptado por muchos frameworks de agentes.
Hermes 4 añade a esto un modo de razonamiento híbrido heredado de DeepHermes: el modelo puede reflexionar entre etiquetas think antes de responder, o responder directamente, según lo que le indiques en el prompt del sistema. Eres tú quien decide, petición por petición, si pagas el costo adicional en tokens del razonamiento.
#Las variantes de Hermes 4 y la VRAM necesaria
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Hermes 4 salió al final de agosto de 2025 en tres tamaños, cada uno construido sobre una base distinta. Este detalle cuenta: la licencia, el contexto máximo y el comportamiento en francés son los de la base, no de Nous Research.
- Hermes 4 14B
- Base Qwen3-14B. Aproximadamente 9 GB de VRAM en Q4_K_M, una capacidad de contexto nativa holgada y muy buen dominio del francés. Es la variante que conviene instalar en una tarjeta de entre 12 y 16 GB y la que utilizamos en producción. Licencia heredada de Qwen3: Apache 2.0.
- Hermes 4 70B
- Base Llama 3.1 70B. Aproximadamente 40 GB en Q4_K_M: dos RTX 3090/4090, un Mac Studio o un MacBook Pro con 48 GB o más de memoria unificada. Claramente mejor en razonamientos largos y en el seguimiento de instrucciones complejas. Licencia Llama 3.1 Community.
- Hermes 4 405B
- Basado en Llama 3.1 405B. Más de 200 GB incluso en Q4: fuera del alcance de un ordenador personal, reservado para servidores multi-GPU o proveedores de API. Lo mencionamos para ofrecer una visión completa.
- ¿Y por debajo de 12 GB?
- No existe Hermes 4 en 3B ni en 8B. En una tarjeta de 8 GB, usa hermes3:8b (base Llama 3.1 8B, aproximadamente 5 GB en Q4_K_M): misma filosofía, mismo formato de herramientas, sin el modo de razonamiento.
La elección de la cuantización sigue las reglas habituales del sitio: Q4_K_M ofrece un buen equilibrio como opción predeterminada; Q5_K_M o Q8_0 si la VRAM lo permite y realizas extracción estructurada, donde cada bit de precisión reduce los errores de formato. En nuestra RTX 5070 Ti de 12 GB, hermes4:14b en Q4_K_M con un contexto de 8 192 tokens ocupa 9,4 GB de VRAM, lo que deja espacio para tener un modelo de embeddings cargado en paralelo.
#Prerrequisitos
- Ollama actualizado
- La base Qwen3 del modelo de 14B requiere una versión de Ollama posterior a abril de 2025. Compruébalo con ollama --version y actualiza si es necesario; de lo contrario, obtendrás un error de arquitectura desconocida al cargar el modelo.
- GPU o memoria unificada
- 12 GB de VRAM para el 14B en Q4_K_M con un contexto de 8k. Con 8 GB, el modelo se carga parcialmente en CPU y su velocidad cae a unos pocos tokens por segundo: pasa a hermes3:8b.
- Espacio en disco
- Calcula 9 GB para el 14B en Q4_K_M, 15 GB en Q8_0 y 40 GB para el 70B en Q4_K_M.
- Una interfaz (opcional)
- Open WebUI o LM Studio para conversar cómodamente. Open WebUI contrae automáticamente los bloques de razonamiento, lo que se agradece con Hermes 4.
#Instalar Hermes 4 con Ollama en 4 pasos
- 01Descargar la variante adaptada a tu máquinaEn la biblioteca de Ollama, la etiqueta hermes4 está disponible en distintos tamaños. En una tarjeta de 12 a 16 GB, elige el 14B; es la etiqueta que ejecutamos a diario.
- 02O importar el GGUF oficial desde Hugging FaceNous Research publica sus propias cuantizaciones GGUF. La sintaxis hf.co de Ollama permite elegir con precisión el nivel (Q4_K_M, Q5_K_M, Q8_0) sin necesidad de un Modelfile. Es la vía preferible si deseas un Q8_0 o si la etiqueta de la biblioteca no ofrece la cuantización deseada.
- 03Verificar la carga y la distribución GPU/CPUEl comando ollama ps indica la memoria ocupada y el porcentaje cargado en la GPU. Busca el 100 % en la GPU: en cuanto una parte pasa a la CPU, la velocidad cae en picado.
- 04Primera prueba con un prompt de sistemaNo pruebes Hermes sin un prompt de sistema: te perderías lo que lo hace interesante. Dale un rol, un formato de salida y una restricción, y luego observa hasta qué punto los respeta.
#Lo que distingue a Hermes de los modelos alineados para el público general
Un asistente para el público en general se entrena para agradar a un usuario anónimo y para proteger al proveedor. Esto produce comportamientos que acabamos por dejar de notar: un preámbulo que reformula la pregunta, una advertencia al final de la respuesta, una negativa cortés en cuanto aparece una palabra clave sensible y una tendencia a suavizar las cosas. Para charlar, es aceptable. Para un pipeline automatizado que espera un JSON, una clasificación o una reescritura, cada desviación rompe el procesamiento posterior.
Hermes 4 está entrenado para el operador, no para el usuario final. Nous Research evaluó esta decisión con un banco de pruebas propio, RefusalBench, en el que Hermes 4 rechaza solicitudes con mucha menos frecuencia que los modelos cerrados y que la mayoría de los modelos de pesos abiertos alineados. En concreto, en un corpus de tickets de soporte donde se pide extraer el motivo de la reclamación, un modelo dirigido al público general a veces responde «no puedo dar asesoramiento jurídico», mientras que Hermes devuelve el campo solicitado. En una tarea de reescritura, no añade «no dudes en preguntar si tienes más preguntas».
- Sin preámbulo ni conclusión
- Si el prompt del sistema dice «responde únicamente con el JSON», la respuesta comienza con una llave. En muchos modelos, se necesitan tres ejemplos y un posprocesamiento para obtener el mismo resultado.
- Persona estable
- Un rol definido en el prompt del sistema se mantiene durante decenas de turnos sin diluirse, incluso cuando el usuario intenta hacerlo salir de su marco.
- Menos rechazos no solicitados
- Temas médicos, jurídicos, ciberseguridad, ficción oscura: Hermes atiende la solicitud. Los límites son los que tú escribes.
- Tono neutro
- Sin elogios sobre la calidad de la pregunta, sin emojis, sin entusiasmo artificial. El estilo se regula completamente mediante el prompt del sistema.
La contrapartida es evidente: si expones Hermes a desconocidos, por ejemplo a través de un chatbot público, te corresponde implementar las salvaguardas. Son indispensables un prompt de sistema que enumere lo que el asistente no debe hacer y un filtro de salida en la aplicación para los casos críticos. En un uso personal o interno, esta responsabilidad es precisamente la ventaja buscada.
#El prompt de sistema, donde Hermes 4 destaca
Con Hermes 4, el prompt del sistema no es una sugerencia sino un contrato. Eso cambia la forma de escribirlo: sé preciso y completo, y no cuentes con que el modelo rellene lo que no hayas especificado con el «sentido común» de un asistente. Tres reglas bastan para obtener resultados fiables.
- Describir el rol en una frase
- « Tú eres el asistente de redacción del equipo de marketing de X » es mejor que tres párrafos de contexto. Hermes no diluye la información, pero un rol corto es más estable.
- Fijar explícitamente el formato de salida
- Longitud, idioma, estructura, lo que debe omitirse. Hermes respeta una restricción como «sin introducción, sin conclusión, máximo 120 palabras» sin que tengas que repetirla.
- Escribir las prohibiciones
- Como el modelo no añade prohibiciones, enumera las tuyas: temas fuera de alcance, información que nunca debe revelarse y comportamiento ante una pregunta ambigua.
Lo más práctico es fijar este prompt de sistema en un Modelfile: obtienes un alias listo para usar, con el contexto y la temperatura ya configurados, que puedes utilizar en Open WebUI, en tus scripts y desde el terminal.
#Activar o desactivar el modo de razonamiento
Hermes 4 es un modelo de razonamiento híbrido: por defecto, responde directamente, como un modelo clásico ajustado para seguir instrucciones. Para activar la reflexión, se añade al prompt de sistema una instrucción específica, la que documenta Nous Research en la ficha del modelo. El modelo produce entonces su reflexión entre etiquetas think y después su respuesta.
Puedes combinarla con tus propias instrucciones, en francés, añadiéndolas a continuación. El razonamiento es útil para las matemáticas, el código no trivial, la planificación de un agente o el análisis de un documento largo. Es inútil y costoso para la extracción de campos, la clasificación o la reescritura: en estas tareas, deja el modo directo. Calcula entre 500 y varios miles de tokens de reflexión por solicitud, de ahí la importancia de un num_ctx amplio.
- Modo directo (predeterminado)
- Sin instrucciones especiales. Respuesta inmediata, ideal para pipelines y conversaciones habituales. Este es el modo que utilizamos para la evaluación automatizada de nuestro seguimiento de novedades.
- Modo razonamiento
- Agrega la instrucción anterior al principio del prompt del sistema. Open WebUI contrae el bloque think; en tus scripts, fíltralo antes de mostrar o analizar la respuesta.
- Dos alias
- Lo más sencillo es crear dos Modelfiles, hermes-direct y hermes-think, y elegir uno u otro según la tarea en lugar de modificar el prompt en cada llamada.
#Casos de uso: agentes y extracción estructurada
El formato de llamada a herramientas de Nous Research, donde el modelo recibe la lista de funciones disponibles en el prompt del sistema y emite sus llamadas en forma de JSON etiquetado, es el que Ollama utiliza a través del parámetro tools de su API de chat. Con Hermes 4, no necesitas configurar nada: describe tus funciones, envía la conversación, y el modelo devuelve una llamada estructurada cuando la necesita, o una respuesta de texto en caso contrario.
Para la extracción estructurada, dos enfoques se complementan. El primero consiste en imponer un esquema JSON mediante el parámetro format de Ollama: el motor restringe la generación y el modelo no puede salirse del esquema. El segundo se basa únicamente en el prompt del sistema, y ahí es donde Hermes marca la diferencia: incluso sin restricciones de decodificación, devuelve un JSON válido y sin comentarios en la gran mayoría de los casos, lo que simplifica las integraciones con herramientas que no admiten la decodificación restringida.
La respuesta incluye un campo tool_calls con el nombre de la función y sus argumentos. Te corresponde ejecutar la función y devolver el resultado en un mensaje con el rol tool para que el modelo formule su respuesta final. Este bucle lo implementan LangChain, CrewAI, n8n o Hermes Agent, el framework de agentes publicado por la propia Nous Research, que funciona con cualquier modelo, pero fue diseñado en torno a este formato.
- Clasificación y enrutamiento
- Clasificar correos, tickets o artículos según categorías definidas. Baja temperatura, modo directo, esquema JSON impuesto: el 14B procesa varias centenas de elementos por hora en una tarjeta de 12 GB.
- Extracción de campos
- Facturas, CV, fichas de producto, informes: Hermes devuelve exactamente los campos solicitados, con null cuando falta la información, si lo especificas en el prompt del sistema.
- Evaluación automática
- Puntuar textos según una rúbrica (es lo que hace nuestro pipeline de seguimiento diario con hermes4:14b). La estabilidad del formato y la ausencia de complacencia hacen que las puntuaciones sean aprovechables.
- Agente con herramientas
- Búsqueda en una base de datos, llamada a una API interna, ejecución de comandos validados por una persona. El modo de razonamiento ayuda con los planes de varios pasos.
#Ajustes recomendados
Los valores que aparecen a continuación son los que usamos en producción. No proceden de la ficha del modelo, que ofrece poca información sobre este tema, sino de varios meses de uso diario en una tarjeta de 12 GB.
- num_ctx
- 8 192 para el chat y la extracción, 16 384 para los agentes y el modo de razonamiento. Cada vez que duplicas el contexto, aumenta el consumo de VRAM: con 12 GB, un contexto de 16k cabe con la caché KV cuantizada (ver más abajo), pero uno mayor no.
- temperature
- 0,6 a 0,7 para la conversación y la redacción. 0,1 a 0,2 para la extracción, la clasificación y todo lo que debe ser reproducible.
- top_p y repeat_penalty
- 0,95 y 1,05. Una penalización de repetición más fuerte empeora las salidas JSON, donde las repeticiones de claves son normales.
- Cuantización
- Q4_K_M para todo uso común. Q8_0 si realizas extracciones a gran escala y dispones de 16 GB: los errores de formato se vuelven casi inexistentes.
En el lado del servidor, dos variables de entorno de Ollama ahorran espacio en una tarjeta de 12 GB: la atención flash y la cuantización de la caché KV en 8 bits. Se definen en el archivo de servicio de systemd en Linux, en las variables de entorno del usuario en Windows o mediante launchctl en macOS.
La caché KV en q8_0 reduce a la mitad la memoria consumida por el contexto, sin pérdida medible en tareas de extracción y chat. Este ajuste permite que hermes4:14b quepa con 16k de contexto en 12 GB. El keep-alive de 24 horas evita recargar 9 GB en cada llamada espaciada, algo útil para un servidor que responde a scripts durante todo el día.
#Solución de problemas
- Las etiquetas think aparecen en la respuesta
- Es normal en el modo de razonamiento, en el terminal o a través de la API sin procesar. Open WebUI los contrae; en tus scripts, elimina todo lo que precede a la etiqueta de cierre antes de parsear. Si no querías razonamiento, elimina la instrucción específica del prompt de sistema.
- El modelo responde en inglés
- Hermes 4 está entrenado en su gran mayoría con datos en inglés. Añade «Siempre respondes en francés» al prompt del sistema: esta única línea basta en casi todos los casos, precisamente porque el modelo respeta el prompt del sistema.
- Error de arquitectura desconocida al cargar
- Tu Ollama es demasiado antiguo para la base Qwen3 del 14B. Actualízalo y vuelve a realizar el pull.
- Velocidad de unos pocos tokens por segundo
- ollama ps muestra un porcentaje de CPU: el modelo no cabe en la VRAM. Reduce num_ctx, activa la caché KV q8_0 o cambia a hermes3:8b.
- JSON inválido de vez en cuando
- Usa el parámetro format con un esquema: la generación queda sujeta a ese esquema. Si no puedes, baja la temperatura a 0,1 y añade un ejemplo de la salida esperada en el prompt del sistema.
- El modelo olvida sus instrucciones tras varios turnos
- El contexto está saturado. Aumenta num_ctx o recorta el historial desde la aplicación, manteniendo siempre el prompt de sistema al principio.
- Rechazo inesperado
- Raro, pero posible en el 14B cuando la formulación se parece a un escenario de ataque. Reformula especificando el marco legítimo en el prompt de sistema (prueba autorizada, contexto profesional): Hermes sigue el marco que estableces.
#Para ir más allá
Hermes 4 ofrece todo su potencial una vez que dominas los componentes que lo rodean. Estas guías del sitio complementan esta:
- Dominar los system prompts
- El método para escribir un prompt de sistema completo, con ejemplos para cada caso de uso. El complemento natural de esta guía, ya que el prompt de sistema es lo que permite dirigir Hermes.
- Function calling y salidas JSON estructuradas con Ollama
- Los detalles del parámetro format, de los esquemas JSON y del bucle de llamadas a herramientas, con ejemplos completos en Python.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para elegir entre Q4_K_M y Q8_0 según tu VRAM y tu tolerancia a errores de formato.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.