Falcon H1 en local: el híbrido Mamba procedente de los Emiratos
Falcon H1 es la familia de modelos con pesos abiertos del Technology Innovation Institute de Abu Dabi y la primera de TII que combina atención clásica y capas Mamba en cada bloque. Esta guía explica qué cambia con esta arquitectura híbrida, qué tamaño de Falcon H1 instalar localmente según tu VRAM, cómo medir su ahorro de memoria en contextos largos y si merece la pena sustituir Mistral Small o Qwen3 en tu entorno Ollama.
#¿Por qué interesarse por Falcon H1?
Los primeros Falcon, en 2023, habían dejado huella en el mundo de los modelos de pesos abiertos antes de quedar atrás frente a Llama, Mistral y luego Qwen. Falcon H1, publicado en mayo de 2025 por el Instituto de Innovación Tecnológica (TII) de Abu Dabi, cambia de enfoque: en lugar de intentar alcanzar a los transformadores clásicos, TII parte de una arquitectura diferente que combina atención y modelos de espacio de estados (Mamba-2), para obtener modelos compactos capaces de competir con otros del doble de tamaño.
Para un uso local, el interés se basa en tres puntos. La gama cubre todas las configuraciones, desde 0,5 mil millones de parámetros para un Raspberry Pi o un viejo portátil hasta 34 mil millones para una RTX 4090 o un Mac con memoria unificada. El contexto anunciado alcanza 256.000 tokens, y la arquitectura híbrida lo hace realmente usable localmente, donde un transformador clásico saturaría la VRAM. Por último, Falcon H1 fue entrenado nativamente en 18 idiomas, entre ellos el francés y el árabe, lo que lo convierte en un candidato serio para texto francés sin recurrir a modelos centrados en inglés o chino.
#Híbrido atención-Mamba en dos palabras
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Un transformer clásico se basa completamente en la atención. Con cada nuevo token, el modelo vuelve a leer todo el contexto y conserva un par de vectores por cada token anterior: la famosa caché KV. Esta memoria crece linealmente con la longitud de la conversación o del documento. Es esta memoria, y no los pesos del modelo, la que hace que se supere la capacidad de memoria de tu tarjeta gráfica cuando cargas un informe largo.
Mamba pertenece a otra familia, los modelos de espacio de estados (state space models). Una capa Mamba no vuelve a leer el pasado: mantiene un estado recurrente de tamaño fijo que resume lo anterior, como una red recurrente modernizada. La memoria por token es constante y la velocidad de procesamiento se mantiene estable independientemente de la longitud del contexto. La contrapartida conocida es una recuperación menos precisa de los detalles lejanos: un modelo Mamba puro recupera con menos precisión una cifra concreta escondida en una página 40.
Los híbridos buscan lo mejor de ambos. Mientras que IBM Granite 4 o Jamba alternan capas Mamba y capas de atención, Falcon H1 adopta un esquema paralelo: en cada bloque, cabezas de atención y cabezas Mamba-2 trabajan en paralelo sobre la misma entrada, y sus salidas se concatenan antes de la siguiente capa. TII ajustó la proporción entre ambas a favor de los canales Mamba, lo que mantiene la memoria de atención muy por debajo de la de un modelo Transformer de tamaño equivalente, al tiempo que conserva suficiente atención para recuperar un detalle exacto.
- Transformador clásico (Mistral, Qwen, Llama)
- 100 % atención. Máxima calidad de recuperación de información, pero la caché KV crece en proporción al contexto: el consumo de VRAM se dispara al superar unas decenas de miles de tokens.
- Mamba puro (Falcon Mamba 7B)
- Memoria constante por token, muy rápido en flujos largos. Menor capacidad para recordar detalles lejanos y soporte de software aún desigual.
- Híbrido secuencial (Granite 4, Jamba)
- Capas Mamba predominantes, intercaladas con capas de atención. Buen ahorro de memoria, arquitectura simple de implementar en los runtimes.
- Híbrido paralelo (Falcon H1)
- Atención y Mamba-2 en cada bloque, con salidas concatenadas. El modelo decide en cada capa qué información confía a la memoria precisa o a la memoria comprimida.
#Tamaños disponibles: desde 0,5B hasta 34B
TII publica Falcon H1 en seis tamaños, cada uno en versión Base (preentrenada) e Instruct (chat). Solo las versiones Instruct te interesan para usarlo con Ollama o LM Studio. Todas comparten la misma arquitectura y el mismo tokenizer multilingüe.
- Falcon H1 0.5B
- El más pequeño. Para sistemas embebidos, una prueba de pipeline o un Raspberry Pi. No cuentes con él para una tarea de redacción seria.
- Falcon H1 1.5B
- Clasificación, extracción simple, autocompletado. Funciona en cualquier CPU reciente con menos de 2 GB de memoria.
- Falcon H1 1.5B-Deep
- El mismo número de parámetros que el 1.5B, pero muchas más capas y más estrechas. TII lo sitúa en el rango de modelos de 7 a 10 mil millones de parámetros. Es la variante que se debe probar en un portátil sin GPU.
- Falcon H1 3B
- El equilibrio para una tarjeta de 4 a 6 GB o un Mac de 16 GB. Resumen, chat en francés, RAG ligero.
- Falcon H1 7B
- El modelo de gama media. Compete con Qwen3 8B y supera los 7B de la generación anterior. Una RTX 3060 12GB lo hace funcionar con un contexto amplio.
- Falcon H1 34B
- De gama alta. TII lo compara con Qwen3 32B, Gemma 3 27B y Llama 4 Scout. Necesita al menos 24 GB de VRAM en Q4, o un Mac con memoria unificada de 48 GB para funcionar cómodamente.
La variante 1.5B-Deep merece un comentario. TII ha apostado por un modelo estrecho pero muy profundo, con casi el triple de capas que el 1.5B estándar. El resultado es más lento por token, ya que cada capa se ejecuta en serie, pero claramente más capaz. En CPU, donde el ancho de banda de la memoria lo limita todo, suele ofrecer la mejor relación entre calidad y gigabyte de toda la gama.
#Prerrequisitos y VRAM
En cuanto al software, necesitas una versión reciente de Ollama. La compatibilidad con la arquitectura falcon-h1 se añadió a llama.cpp en el verano de 2025, y Ollama la incorporó en las versiones publicadas después. Una versión anterior de Ollama se negará a cargar el modelo con un error de arquitectura desconocida. El daemon escucha por defecto en http://localhost:11434; Open WebUI o LM Studio se conectan a él sin ajustes especiales.
- 0.5B y 1.5B en Q4_K_M
- Menos de 1,5 GB. Solo con CPU y 4 GB de RAM libres. No se requiere GPU.
- 3B en Q4_K_M
- ≈ 2 GB de VRAM. Cualquier tarjeta de 4 GB o más, o 8 GB de RAM en modo CPU.
- 7B en Q4_K_M
- ≈ 5 GB de VRAM para los pesos. Una RTX 3060 12GB o una RTX 4070 12GB permiten trabajar con holgura, con margen para un contexto de 32K tokens o más.
- 7B en Q8_0
- ≈ 8 GB. Para una RTX 4080 de 16 GB o un Mac de 24 GB si quieres precisión máxima en extracción.
- 34B en Q4_K_M
- ≈ 20 GB. Una RTX 4090 de 24 GB va justa; hay que vigilar el contexto. Un M4 Pro de 48 GB o un Mac Studio tiene mucho más margen.
- 34B en Q8_0
- ≈ 36 GB. Reservado para Macs con 64 GB o más, o para un sistema con dos GPUs.
#Instalar Falcon H1 en local según tu VRAM
TII publica GGUF oficiales para cada tamaño en Hugging Face, en repositorios llamados tiiuae/Falcon-H1-<taille>-Instruct-GGUF. Ollama puede descargar un GGUF directamente desde Hugging Face con el prefijo hf.co, especificando la cuantización deseada después de los dos puntos. Comprueba también en ollama.com/library si ha aparecido una etiqueta oficial falcon-h1 desde la redacción de esta guía; si es así, dale preferencia, ya que incluye una plantilla de chat validada.
- 01Actualizar OllamaVuelve a ejecutar el instalador oficial o tu gestor de paquetes y luego comprueba la versión. Es el paso que todo el mundo se salta y que explica la mayoría de los fallos de carga.
- 02Elegir el tamaño según la VRAM12 GB o menos: 7B en Q4_K_M. De 4 a 6 GB: 3B. Sin GPU: 1.5B-Deep. 24 GB o un Mac de 48 GB: 34B. No descargues varios tamaños de una vez: cada GGUF pesa entre 1 y 20 GB.
- 03Descargar el GGUF desde Hugging FaceUsa ollama pull con la ruta hf.co del repositorio y la etiqueta de cuantización. Ollama descarga el archivo, lee sus metadatos y genera la plantilla de chat a partir de ellos.
- 04Iniciar una sesión y probar en francésollama run ouvre un chat interactif. Posez une vraie tâche, résumé d'un texte ou extraction de champs, plutôt qu'une devinette. Vérifiez que le modèle répond en français sans glisser vers l'anglais.
- 05Controlar la distribución GPU/CPUollama ps indique le pourcentage du modèle chargé sur le GPU. Si une partie est en CPU, réduisez la taille ou la quantification, sinon le débit s'effondre.
El nombre completo con el prefijo hf.co es largo de escribir y poco legible en Open WebUI. Crea un alias local con un Modelfile: aprovecha para fijar el contexto y un prompt de sistema en francés, y el modelo aparece con un nombre corto en todas tus interfaces.
Para su uso en aplicaciones, Ollama expone su API HTTP en el mismo puerto, con un endpoint compatible con OpenAI. Cualquier cliente existente funciona cambiando la URL base y el nombre del modelo.
#Ventaja de memoria en contextos largos, medida
Es la promesa central de Falcon H1 en local, y se verifica en diez minutos. El protocolo es sencillo: cargar el mismo modelo con dos tamaños de contexto y comparar la memoria ocupada que indica ollama ps. En un transformer clásico, pasar de 8K a 64K tokens aumenta el consumo en varios gigabytes. En Falcon H1 también hay un aumento, porque la parte de atención conserva un caché KV, pero es mucho menor.
Dos precisiones para interpretar las cifras. Primero, Ollama reserva la caché KV de antemano para todo el contexto solicitado: la memoria mostrada refleja, por tanto, la capacidad reservada, no lo que realmente utiliza tu prompt. Segundo, si has activado la cuantización de la caché KV en la configuración de Ollama, esta también se aplica a la parte de atención de Falcon H1, lo que reduce aún más la diferencia medida, pero no cambia la conclusión: con la misma VRAM, Falcon H1 admite un contexto mucho más largo que un transformador del mismo tamaño.
En la práctica, en una tarjeta de 12 GB, Falcon H1 7B en Q4_K_M deja espacio para un contexto de 64K tokens sin tener que recurrir a la CPU, mientras que Qwen3 8B o Mistral 7B obligan a cuantizar la caché KV o a limitarse a alrededor de 32K. La tasa de generación, por su parte, se degrada mucho menos a medida que el contexto se llena: la parte Mamba procesa cada nuevo token en tiempo constante.
#Frente a Mistral Small y Qwen3: el veredicto
La pregunta que todos se hacen: ¿hay que reemplazar el modelo habitual? La respuesta depende del tamaño, porque Falcon H1 compite en distintas categorías según la variante.
- Falcon H1 7B contra Qwen3 8B
- La calidad es comparable en general: Qwen3 mantiene una ventaja en código y razonamiento estructurado, mientras que Falcon H1 es más natural en francés y, sobre todo, consume muchos menos recursos en cuanto el contexto se alarga. Para resumir documentos y conversar en francés con 12 GB, Falcon H1 lleva la ventaja. Para programar, sigue con Qwen3.
- Falcon H1 7B contra Mistral Small 3.2
- No es la misma clase: Mistral Small tiene 24 mil millones de parámetros y requiere entre 14 y 15 GB en Q4. Si tienes suficiente VRAM, Mistral Small sigue siendo mejor en la mayoría de las tareas. Falcon H1 7B es la opción cuando la tarjeta tiene 12 GB o cuando el contexto debe superar los 32K.
- Falcon H1 34B contra Mistral Small 3.2
- El duelo interesante. Falcon H1 34B es más fuerte en los benchmarks de conocimiento y razonamiento y maneja mejor los contextos muy largos, pero requiere 5 GB más en Q4 y no tiene visión. Mistral Small cabe en una tarjeta de 16 GB, lee imágenes, está bajo Apache 2.0 y cuenta con un ecosistema más maduro, especialmente para el function calling.
- Falcon H1 34B contra Qwen3 32B
- Con una cantidad comparable de VRAM, Qwen3 32B sigue siendo la referencia para el código y los agentes. Falcon H1 34B es preferible para documentos largos en francés o árabe, y en Mac, donde la memoria unificada admite sus 20 GB sin esfuerzo.
El veredicto se resume en una frase: Falcon H1 es el mejor modelo para instalar cuando tu problema es la memoria con contextos largos o cuando el francés y el árabe son tus idiomas de trabajo. No es el mejor modelo generalista para todo tipo de tareas, y su ecosistema no tiene la madurez del de Mistral o Qwen. En una estación de trabajo con 24 GB, Mistral Small sigue siendo una apuesta segura para un asistente de uso diario; Falcon H1 34B es el que se añade como complemento para los documentos grandes.
#Licencia Falcon-LLM: leer antes de desplegar
Falcon H1 se publica bajo la licencia Falcon-LLM de TII. Deriva de Apache 2.0 y permite el uso comercial, la modificación y la redistribución, pero añade una política de uso aceptable y algunas obligaciones de atribución. No ofrece la libertad total de Apache 2.0 que ofrecen Mistral Small o Granite, ni tampoco es una licencia restrictiva como la de Llama, con sus umbrales de usuarios.
Para un uso personal o interno, la cuestión no se plantea. Para un producto comercial redistribuido, dedica diez minutos a leer el texto en el sitio de TII y verificar que tu caso no esté entre los usos excluidos. El catálogo del sitio indica la licencia en cada ficha de Falcon, y su versión puede cambiar de una generación a otra.
#Solución de problemas
- Error unknown model architecture falcon-h1
- Tu versión de Ollama, LM Studio o llama.cpp es demasiado antigua para reconocer la arquitectura híbrida. Actualiza, reinicia el daemon y vuelve a ejecutar el pull. No hay otra solución alternativa: las capas Mamba-2 no se cargan sin soporte del motor.
- El pull de hf.co falla o no encuentra la etiqueta
- Comprueba la escritura exacta del nombre del repositorio y de la cuantización en la página de Hugging Face, especialmente las mayúsculas y minúsculas de Q4_K_M. Si el repositorio no ofrece el tag solicitado, abre la pestaña Files para consultar la lista de archivos GGUF disponibles.
- Respuestas en inglés aunque escribas en francés
- Agrega un prompt del sistema que imponga el idioma, como en el Modelfile anterior. El tokenizer multilingüe de Falcon H1 maneja muy bien el francés, pero la variante Instruct, sin una instrucción explícita, a veces sigue el idioma dominante de sus datos.
- Velocidad muy baja en 34B
- ollama ps montre probablement une répartition partielle sur le CPU. En 24 Go, réduisez le contexte à 16K ou passez en Q4_K_S. Sur Mac, augmentez la limite de mémoire GPU allouable si le système en réserve trop.
- Consumo de memoria mayor de lo esperado con contextos largos
- Es normal: Ollama reserva la caché KV de atención para todo el contexto declarado, aunque esté vacío. Compara siempre con otro modelo usando el mismo tamaño de contexto y activa la cuantización de la caché KV si quieres ahorrar un poco más.
- Plantilla de chat incorrecta, etiquetas visibles en las respuestas
- Ollama genera la plantilla a partir de los metadatos del GGUF. Si aparecen etiquetas, descarga el GGUF oficial de TII en lugar de una conversión de terceros, o define explícitamente el TEMPLATE en tu Modelfile.
#Para ir más allá
Falcon H1 cobra todo su sentido una vez que dominas los conceptos de contexto y memoria que utiliza. Estas guías del sitio complementan esta:
- Comprender la ventana de contexto
- Qué representan 8K, 32K o 256K tokens, cuánta VRAM requieren y por qué la caché KV es el verdadero cuello de botella de los transformadores clásicos.
- Cuantizar la caché KV para ahorrar VRAM
- La otra opción para ampliar el contexto, que se puede combinar con la arquitectura híbrida de Falcon H1.
- Granite 4 de IBM en local
- El otro híbrido Mamba actual, con arquitectura secuencial y bajo Apache 2.0. Compararlo con Falcon H1 ayuda a entender las decisiones de TII.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para elegir entre Q4_K_M y Q8_0 en cada tamaño de Falcon H1 según tu VRAM.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.