Intermedio 10 minFalcon

Falcon H1 en local: el híbrido Mamba procedente de los Emiratos

Falcon H1 es la familia de modelos con pesos abiertos del Technology Innovation Institute de Abu Dabi y la primera de TII que combina atención clásica y capas Mamba en cada bloque. Esta guía explica qué cambia con esta arquitectura híbrida, qué tamaño de Falcon H1 instalar localmente según tu VRAM, cómo medir su ahorro de memoria en contextos largos y si merece la pena sustituir Mistral Small o Qwen3 en tu entorno Ollama.

Por Samir K.·Actualización 2026-09-27·Probado en Windows, macOS y Linux

#¿Por qué interesarse por Falcon H1?

Los primeros Falcon, en 2023, habían dejado huella en el mundo de los modelos de pesos abiertos antes de quedar atrás frente a Llama, Mistral y luego Qwen. Falcon H1, publicado en mayo de 2025 por el Instituto de Innovación Tecnológica (TII) de Abu Dabi, cambia de enfoque: en lugar de intentar alcanzar a los transformadores clásicos, TII parte de una arquitectura diferente que combina atención y modelos de espacio de estados (Mamba-2), para obtener modelos compactos capaces de competir con otros del doble de tamaño.

Para un uso local, el interés se basa en tres puntos. La gama cubre todas las configuraciones, desde 0,5 mil millones de parámetros para un Raspberry Pi o un viejo portátil hasta 34 mil millones para una RTX 4090 o un Mac con memoria unificada. El contexto anunciado alcanza 256.000 tokens, y la arquitectura híbrida lo hace realmente usable localmente, donde un transformador clásico saturaría la VRAM. Por último, Falcon H1 fue entrenado nativamente en 18 idiomas, entre ellos el francés y el árabe, lo que lo convierte en un candidato serio para texto francés sin recurrir a modelos centrados en inglés o chino.

i
Falcon H1 y Falcon H1R
Esta guía trata sobre la familia Falcon H1 de base (Instruct). Falcon H1R 7B, lanzado a principios de 2026, es la variante entrenada para razonar paso a paso, con la misma arquitectura. Todo lo relacionado con la instalación y la memoria se aplica a ambos; solo difiere el comportamiento al responder, ya que H1R es más lento porque es más verboso.

#Híbrido atención-Mamba en dos palabras

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Un transformer clásico se basa completamente en la atención. Con cada nuevo token, el modelo vuelve a leer todo el contexto y conserva un par de vectores por cada token anterior: la famosa caché KV. Esta memoria crece linealmente con la longitud de la conversación o del documento. Es esta memoria, y no los pesos del modelo, la que hace que se supere la capacidad de memoria de tu tarjeta gráfica cuando cargas un informe largo.

Mamba pertenece a otra familia, los modelos de espacio de estados (state space models). Una capa Mamba no vuelve a leer el pasado: mantiene un estado recurrente de tamaño fijo que resume lo anterior, como una red recurrente modernizada. La memoria por token es constante y la velocidad de procesamiento se mantiene estable independientemente de la longitud del contexto. La contrapartida conocida es una recuperación menos precisa de los detalles lejanos: un modelo Mamba puro recupera con menos precisión una cifra concreta escondida en una página 40.

Los híbridos buscan lo mejor de ambos. Mientras que IBM Granite 4 o Jamba alternan capas Mamba y capas de atención, Falcon H1 adopta un esquema paralelo: en cada bloque, cabezas de atención y cabezas Mamba-2 trabajan en paralelo sobre la misma entrada, y sus salidas se concatenan antes de la siguiente capa. TII ajustó la proporción entre ambas a favor de los canales Mamba, lo que mantiene la memoria de atención muy por debajo de la de un modelo Transformer de tamaño equivalente, al tiempo que conserva suficiente atención para recuperar un detalle exacto.

Transformador clásico (Mistral, Qwen, Llama)
100 % atención. Máxima calidad de recuperación de información, pero la caché KV crece en proporción al contexto: el consumo de VRAM se dispara al superar unas decenas de miles de tokens.
Mamba puro (Falcon Mamba 7B)
Memoria constante por token, muy rápido en flujos largos. Menor capacidad para recordar detalles lejanos y soporte de software aún desigual.
Híbrido secuencial (Granite 4, Jamba)
Capas Mamba predominantes, intercaladas con capas de atención. Buen ahorro de memoria, arquitectura simple de implementar en los runtimes.
Híbrido paralelo (Falcon H1)
Atención y Mamba-2 en cada bloque, con salidas concatenadas. El modelo decide en cada capa qué información confía a la memoria precisa o a la memoria comprimida.
→
Qué cambia concretamente
Con un prompt de 2.000 tokens, no verás ninguna diferencia con un transformador clásico. Carga un contrato de 60 páginas o una conversación de tres horas, y la diferencia se vuelve visible: Falcon H1 mantiene un consumo de memoria casi constante, mientras que Mistral Small o Qwen3 deben cuantizar su caché KV o reducir el contexto.

#Tamaños disponibles: desde 0,5B hasta 34B

TII publica Falcon H1 en seis tamaños, cada uno en versión Base (preentrenada) e Instruct (chat). Solo las versiones Instruct te interesan para usarlo con Ollama o LM Studio. Todas comparten la misma arquitectura y el mismo tokenizer multilingüe.

Falcon H1 0.5B
El más pequeño. Para sistemas embebidos, una prueba de pipeline o un Raspberry Pi. No cuentes con él para una tarea de redacción seria.
Falcon H1 1.5B
Clasificación, extracción simple, autocompletado. Funciona en cualquier CPU reciente con menos de 2 GB de memoria.
Falcon H1 1.5B-Deep
El mismo número de parámetros que el 1.5B, pero muchas más capas y más estrechas. TII lo sitúa en el rango de modelos de 7 a 10 mil millones de parámetros. Es la variante que se debe probar en un portátil sin GPU.
Falcon H1 3B
El equilibrio para una tarjeta de 4 a 6 GB o un Mac de 16 GB. Resumen, chat en francés, RAG ligero.
Falcon H1 7B
El modelo de gama media. Compete con Qwen3 8B y supera los 7B de la generación anterior. Una RTX 3060 12GB lo hace funcionar con un contexto amplio.
Falcon H1 34B
De gama alta. TII lo compara con Qwen3 32B, Gemma 3 27B y Llama 4 Scout. Necesita al menos 24 GB de VRAM en Q4, o un Mac con memoria unificada de 48 GB para funcionar cómodamente.

La variante 1.5B-Deep merece un comentario. TII ha apostado por un modelo estrecho pero muy profundo, con casi el triple de capas que el 1.5B estándar. El resultado es más lento por token, ya que cada capa se ejecuta en serie, pero claramente más capaz. En CPU, donde el ancho de banda de la memoria lo limita todo, suele ofrecer la mejor relación entre calidad y gigabyte de toda la gama.

#Prerrequisitos y VRAM

En cuanto al software, necesitas una versión reciente de Ollama. La compatibilidad con la arquitectura falcon-h1 se añadió a llama.cpp en el verano de 2025, y Ollama la incorporó en las versiones publicadas después. Una versión anterior de Ollama se negará a cargar el modelo con un error de arquitectura desconocida. El daemon escucha por defecto en http://localhost:11434; Open WebUI o LM Studio se conectan a él sin ajustes especiales.

0.5B y 1.5B en Q4_K_M
Menos de 1,5 GB. Solo con CPU y 4 GB de RAM libres. No se requiere GPU.
3B en Q4_K_M
≈ 2 GB de VRAM. Cualquier tarjeta de 4 GB o más, o 8 GB de RAM en modo CPU.
7B en Q4_K_M
≈ 5 GB de VRAM para los pesos. Una RTX 3060 12GB o una RTX 4070 12GB permiten trabajar con holgura, con margen para un contexto de 32K tokens o más.
7B en Q8_0
≈ 8 GB. Para una RTX 4080 de 16 GB o un Mac de 24 GB si quieres precisión máxima en extracción.
34B en Q4_K_M
≈ 20 GB. Una RTX 4090 de 24 GB va justa; hay que vigilar el contexto. Un M4 Pro de 48 GB o un Mac Studio tiene mucho más margen.
34B en Q8_0
≈ 36 GB. Reservado para Macs con 64 GB o más, o para un sistema con dos GPUs.
i
Referencia de cuantización
Q4_K_M sigue siendo la opción predeterminada recomendada, con la mejor relación calidad/tamaño. Pasa a Q5_K_M o Q8_0 únicamente si la VRAM lo permite y mides una diferencia en tus tareas. En Falcon H1, el margen de memoria que libera la caché KV reducida suele valer más que subir un nivel de cuantización.

#Instalar Falcon H1 en local según tu VRAM

TII publica GGUF oficiales para cada tamaño en Hugging Face, en repositorios llamados tiiuae/Falcon-H1-<taille>-Instruct-GGUF. Ollama puede descargar un GGUF directamente desde Hugging Face con el prefijo hf.co, especificando la cuantización deseada después de los dos puntos. Comprueba también en ollama.com/library si ha aparecido una etiqueta oficial falcon-h1 desde la redacción de esta guía; si es así, dale preferencia, ya que incluye una plantilla de chat validada.

  1. 01
    Actualizar Ollama
    Vuelve a ejecutar el instalador oficial o tu gestor de paquetes y luego comprueba la versión. Es el paso que todo el mundo se salta y que explica la mayoría de los fallos de carga.
  2. 02
    Elegir el tamaño según la VRAM
    12 GB o menos: 7B en Q4_K_M. De 4 a 6 GB: 3B. Sin GPU: 1.5B-Deep. 24 GB o un Mac de 48 GB: 34B. No descargues varios tamaños de una vez: cada GGUF pesa entre 1 y 20 GB.
  3. 03
    Descargar el GGUF desde Hugging Face
    Usa ollama pull con la ruta hf.co del repositorio y la etiqueta de cuantización. Ollama descarga el archivo, lee sus metadatos y genera la plantilla de chat a partir de ellos.
  4. 04
    Iniciar una sesión y probar en francés
    ollama run ouvre un chat interactif. Posez une vraie tâche, résumé d'un texte ou extraction de champs, plutôt qu'une devinette. Vérifiez que le modèle répond en français sans glisser vers l'anglais.
  5. 05
    Controlar la distribución GPU/CPU
    ollama ps indique le pourcentage du modèle chargé sur le GPU. Si une partie est en CPU, réduisez la taille ou la quantification, sinon le débit s'effondre.
Terminal — Falcon H1 7B en una tarjeta de 12 GB
# 1. Vérifier la version d'Ollama (doit dater d'après l'été 2025)
ollama --version

# 2. Tirer le GGUF officiel TII en Q4_K_M (~4,5 Go)
ollama pull hf.co/tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M

# 3. Lancer une session interactive
ollama run hf.co/tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M

# 4. Vérifier que tout est sur le GPU
ollama ps
Terminal — otros tamaños
# Sans GPU : la variante 1.5B-Deep, étroite mais très profonde
ollama pull hf.co/tiiuae/Falcon-H1-1.5B-Deep-Instruct-GGUF:Q4_K_M

# Carte 4-6 Go ou Mac 16 Go
ollama pull hf.co/tiiuae/Falcon-H1-3B-Instruct-GGUF:Q4_K_M

# RTX 4090 24 Go ou Mac 48 Go
ollama pull hf.co/tiiuae/Falcon-H1-34B-Instruct-GGUF:Q4_K_M

El nombre completo con el prefijo hf.co es largo de escribir y poco legible en Open WebUI. Crea un alias local con un Modelfile: aprovecha para fijar el contexto y un prompt de sistema en francés, y el modelo aparece con un nombre corto en todas tus interfaces.

Terminal — alias corto con Modelfile
cat > Modelfile.falcon-h1 <<'EOF'
FROM hf.co/tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M
PARAMETER num_ctx 32768
PARAMETER temperature 0.3
SYSTEM "Tu es un assistant précis. Tu réponds en français, de façon concise."
EOF

ollama create falcon-h1:7b -f Modelfile.falcon-h1
ollama run falcon-h1:7b

Para su uso en aplicaciones, Ollama expone su API HTTP en el mismo puerto, con un endpoint compatible con OpenAI. Cualquier cliente existente funciona cambiando la URL base y el nombre del modelo.

Terminal — llamada a la API local
curl http://localhost:11434/api/chat -d '{
  "model": "falcon-h1:7b",
  "messages": [
    { "role": "user", "content": "Résume ce texte en trois points : ..." }
  ],
  "options": { "num_ctx": 32768 },
  "stream": false
}'
!
Usuarios de llama.cpp y LM Studio
llama.cpp carga los mismos GGUF con la opción -hf, por ejemplo llama-server -hf tiiuae/Falcon-H1-7B-Instruct-GGUF:Q4_K_M. LM Studio se basa en el mismo motor: actualízalo antes de buscar Falcon H1 en su catálogo, una versión antigua no listará el archivo como compatible.

#Ventaja de memoria en contextos largos, medida

Es la promesa central de Falcon H1 en local, y se verifica en diez minutos. El protocolo es sencillo: cargar el mismo modelo con dos tamaños de contexto y comparar la memoria ocupada que indica ollama ps. En un transformer clásico, pasar de 8K a 64K tokens aumenta el consumo en varios gigabytes. En Falcon H1 también hay un aumento, porque la parte de atención conserva un caché KV, pero es mucho menor.

Terminal — medir el costo del contexto
# Contexte 8K : noter la colonne SIZE de ollama ps
OLLAMA_CONTEXT_LENGTH=8192 ollama run falcon-h1:7b "Bonjour" && ollama ps

# Décharger, puis recharger avec 64K
ollama stop falcon-h1:7b
OLLAMA_CONTEXT_LENGTH=65536 ollama run falcon-h1:7b "Bonjour" && ollama ps

# Même exercice avec un transformeur classique pour comparer
ollama stop falcon-h1:7b
OLLAMA_CONTEXT_LENGTH=65536 ollama run qwen3:8b "Bonjour" && ollama ps

Dos precisiones para interpretar las cifras. Primero, Ollama reserva la caché KV de antemano para todo el contexto solicitado: la memoria mostrada refleja, por tanto, la capacidad reservada, no lo que realmente utiliza tu prompt. Segundo, si has activado la cuantización de la caché KV en la configuración de Ollama, esta también se aplica a la parte de atención de Falcon H1, lo que reduce aún más la diferencia medida, pero no cambia la conclusión: con la misma VRAM, Falcon H1 admite un contexto mucho más largo que un transformador del mismo tamaño.

En la práctica, en una tarjeta de 12 GB, Falcon H1 7B en Q4_K_M deja espacio para un contexto de 64K tokens sin tener que recurrir a la CPU, mientras que Qwen3 8B o Mistral 7B obligan a cuantizar la caché KV o a limitarse a alrededor de 32K. La tasa de generación, por su parte, se degrada mucho menos a medida que el contexto se llena: la parte Mamba procesa cada nuevo token en tiempo constante.

!
Un contexto largo no implica recordar perfectamente la información
Falcon H1 acepta 256K tokens, pero aceptar no es comprender. Como cualquier modelo, su precisión disminuye cuando los detalles quedan enterrados muy lejos dentro del prompt, y el componente Mamba contribuye a ello. Para encontrar una cifra exacta en 200 páginas, un RAG con segmentación y búsqueda sigue siendo más fiable que un contexto gigante. El contexto largo de Falcon H1 destaca en el resumen, la síntesis y el seguimiento de conversaciones, no en la búsqueda de una aguja en un pajar.

#Frente a Mistral Small y Qwen3: el veredicto

La pregunta que todos se hacen: ¿hay que reemplazar el modelo habitual? La respuesta depende del tamaño, porque Falcon H1 compite en distintas categorías según la variante.

Falcon H1 7B contra Qwen3 8B
La calidad es comparable en general: Qwen3 mantiene una ventaja en código y razonamiento estructurado, mientras que Falcon H1 es más natural en francés y, sobre todo, consume muchos menos recursos en cuanto el contexto se alarga. Para resumir documentos y conversar en francés con 12 GB, Falcon H1 lleva la ventaja. Para programar, sigue con Qwen3.
Falcon H1 7B contra Mistral Small 3.2
No es la misma clase: Mistral Small tiene 24 mil millones de parámetros y requiere entre 14 y 15 GB en Q4. Si tienes suficiente VRAM, Mistral Small sigue siendo mejor en la mayoría de las tareas. Falcon H1 7B es la opción cuando la tarjeta tiene 12 GB o cuando el contexto debe superar los 32K.
Falcon H1 34B contra Mistral Small 3.2
El duelo interesante. Falcon H1 34B es más fuerte en los benchmarks de conocimiento y razonamiento y maneja mejor los contextos muy largos, pero requiere 5 GB más en Q4 y no tiene visión. Mistral Small cabe en una tarjeta de 16 GB, lee imágenes, está bajo Apache 2.0 y cuenta con un ecosistema más maduro, especialmente para el function calling.
Falcon H1 34B contra Qwen3 32B
Con una cantidad comparable de VRAM, Qwen3 32B sigue siendo la referencia para el código y los agentes. Falcon H1 34B es preferible para documentos largos en francés o árabe, y en Mac, donde la memoria unificada admite sus 20 GB sin esfuerzo.

El veredicto se resume en una frase: Falcon H1 es el mejor modelo para instalar cuando tu problema es la memoria con contextos largos o cuando el francés y el árabe son tus idiomas de trabajo. No es el mejor modelo generalista para todo tipo de tareas, y su ecosistema no tiene la madurez del de Mistral o Qwen. En una estación de trabajo con 24 GB, Mistral Small sigue siendo una apuesta segura para un asistente de uso diario; Falcon H1 34B es el que se añade como complemento para los documentos grandes.

→
La prueba adecuada antes de decidir
Toma tres documentos reales de tu actividad, de 20 a 80 páginas, y plantea la misma serie de preguntas a Falcon H1 7B y a tu modelo actual, con el mismo contexto. Compara la calidad de los resúmenes, la fidelidad de las cifras citadas y la velocidad indicada al final de la respuesta con la opción --verbose de ollama run. Es más ilustrativo que cualquier benchmark público.

#Licencia Falcon-LLM: leer antes de desplegar

Falcon H1 se publica bajo la licencia Falcon-LLM de TII. Deriva de Apache 2.0 y permite el uso comercial, la modificación y la redistribución, pero añade una política de uso aceptable y algunas obligaciones de atribución. No ofrece la libertad total de Apache 2.0 que ofrecen Mistral Small o Granite, ni tampoco es una licencia restrictiva como la de Llama, con sus umbrales de usuarios.

Para un uso personal o interno, la cuestión no se plantea. Para un producto comercial redistribuido, dedica diez minutos a leer el texto en el sitio de TII y verificar que tu caso no esté entre los usos excluidos. El catálogo del sitio indica la licencia en cada ficha de Falcon, y su versión puede cambiar de una generación a otra.

#Solución de problemas

Error unknown model architecture falcon-h1
Tu versión de Ollama, LM Studio o llama.cpp es demasiado antigua para reconocer la arquitectura híbrida. Actualiza, reinicia el daemon y vuelve a ejecutar el pull. No hay otra solución alternativa: las capas Mamba-2 no se cargan sin soporte del motor.
El pull de hf.co falla o no encuentra la etiqueta
Comprueba la escritura exacta del nombre del repositorio y de la cuantización en la página de Hugging Face, especialmente las mayúsculas y minúsculas de Q4_K_M. Si el repositorio no ofrece el tag solicitado, abre la pestaña Files para consultar la lista de archivos GGUF disponibles.
Respuestas en inglés aunque escribas en francés
Agrega un prompt del sistema que imponga el idioma, como en el Modelfile anterior. El tokenizer multilingüe de Falcon H1 maneja muy bien el francés, pero la variante Instruct, sin una instrucción explícita, a veces sigue el idioma dominante de sus datos.
Velocidad muy baja en 34B
ollama ps montre probablement une répartition partielle sur le CPU. En 24 Go, réduisez le contexte à 16K ou passez en Q4_K_S. Sur Mac, augmentez la limite de mémoire GPU allouable si le système en réserve trop.
Consumo de memoria mayor de lo esperado con contextos largos
Es normal: Ollama reserva la caché KV de atención para todo el contexto declarado, aunque esté vacío. Compara siempre con otro modelo usando el mismo tamaño de contexto y activa la cuantización de la caché KV si quieres ahorrar un poco más.
Plantilla de chat incorrecta, etiquetas visibles en las respuestas
Ollama genera la plantilla a partir de los metadatos del GGUF. Si aparecen etiquetas, descarga el GGUF oficial de TII en lugar de una conversión de terceros, o define explícitamente el TEMPLATE en tu Modelfile.

#Para ir más allá

Falcon H1 cobra todo su sentido una vez que dominas los conceptos de contexto y memoria que utiliza. Estas guías del sitio complementan esta:

Comprender la ventana de contexto
Qué representan 8K, 32K o 256K tokens, cuánta VRAM requieren y por qué la caché KV es el verdadero cuello de botella de los transformadores clásicos.
Cuantizar la caché KV para ahorrar VRAM
La otra opción para ampliar el contexto, que se puede combinar con la arquitectura híbrida de Falcon H1.
Granite 4 de IBM en local
El otro híbrido Mamba actual, con arquitectura secuencial y bajo Apache 2.0. Compararlo con Falcon H1 ayuda a entender las decisiones de TII.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para elegir entre Q4_K_M y Q8_0 en cada tamaño de Falcon H1 según tu VRAM.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.