Principiante 8 minOllama

Phi-4 en local: instalar con Ollama, VRAM y velocidad

Phi-4 es el pequeño modelo de Microsoft que dio mucho que hablar a finales de 2024: solo 14 mil millones de parámetros y, aun así, puntuaciones en matemáticas y código que rivalizan con las de modelos tres veces más grandes. Esta guía muestra cómo instalar Phi-4 con Ollama en local, qué tal funciona realmente en la práctica y en qué aspectos decepciona, especialmente en francés.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux
i
En resumen
Phi-4 es un modelo de Microsoft de 14 mil millones de parámetros, potente en matemáticas y código (GPQA, MATH, HumanEval), bajo licencia MIT. · Cabe en unos 9 GB de VRAM en Q4_K_M y puede ejecutarse con una RTX 3060 o RTX 4070 de 12 GB, e incluso exclusivamente en CPU (16 GB de RAM, aproximadamente 5 tok/s). · La instalación se realiza con un solo comando: ollama pull phi4. · Su debilidad: el francés, con errores de concordancia y cambios al inglés — prefiere Mistral Small o Qwen 3.5 9B para redactar en francés.

#¿Por qué Phi-4?

Phi-4 es la continuación lógica de la familia Phi de Microsoft Research: modelos de pequeño tamaño, entrenados principalmente con datos sintéticos cuidadosamente elaborados, diseñados para competir con modelos mucho más grandes en tareas de razonamiento. La versión 4, lanzada a finales de 2024, lleva este enfoque a 14B de parámetros y obtiene puntuaciones notables en GPQA, MATH y HumanEval —a menudo por encima de Llama 3.3 70B en estos benchmarks específicos.

En concreto, es un modelo que cabe en 9 GB de VRAM en Q4_K_M, por lo que puede ejecutarse en una GPU de gama de entrada de 12 GB como una RTX 3060 o una RTX 4070. Y se desenvuelve decentemente incluso usando solo la CPU si tienes 16 GB de RAM. Este equilibrio entre tamaño y calidad lo convierte en un excelente candidato para el autoalojamiento con recursos modestos.

i
En dos palabras
Phi-4 = 14B, fuerte en matemáticas y en código, débil en cultura general y en francés, licencia MIT. Ideal si quieres un "pequeño gigante" para tareas técnicas en una GPU de 12 GB.

#Prerrequisitos

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida
Ollama instalado
Windows, macOS o Linux. Si aún no lo has instalado, la guía de instalación de Ollama te lleva 3 minutos.
VRAM para la cuantización Q4_K_M
≈ 9 GB. Una RTX 3060 de 12 GB, una RTX 4070 de 12 GB o un Mac con 16 GB de memoria unificada funcionan sin problemas.
RAM de la CPU si no hay GPU
16 GB como mínimo para Q4. Calcula de 4 a 8 tokens/segundo en un Ryzen 5 o Core i5 reciente —utilizable para pruebas, pero no para un chat fluido.
10 GB de espacio en disco
El modelo Q4_K_M pesa aproximadamente 9 GB. Reserva más espacio si también quieres probar Phi-4-Mini en paralelo.
→
Caso sin GPU
Phi-4 es uno de los pocos modelos de 14B realmente utilizables sin GPU. En un Ryzen 7 5800X o un Intel i7-12700, se alcanzan alrededor de 5 tok/sec en Q4: lento, pero aceptable para una pregunta a la vez. Para un uso interactivo, aun así, procura contar con una GPU.

#1. Instalar Ollama

Si Ollama ya está instalado, salta directamente a la siguiente sección. De lo contrario, aquí tienes la instalación con un solo comando en Linux y macOS.

Linux / macOS
curl -fsSL https://ollama.com/install.sh | sh

En Windows, descarga el instalador desde el sitio oficial.

Enlace oficial de Windows
https://ollama.com/download/windows

Una vez instalado, el daemon Ollama escucha en el puerto 11434.

Verificación
ollama --version
curl http://localhost:11434/api/tags

#2. Obtener Phi-4

Phi-4 está disponible en el catálogo oficial de Ollama. La etiqueta predeterminada descarga la cuantización Q4_K_M, que ofrece el equilibrio recomendado.

Terminal
ollama pull phi4

La descarga ocupa aproximadamente 9 GB. Para elegir explícitamente otra cuantización, especifica la etiqueta.

Variantes
ollama pull phi4:14b-q4_K_M    # ≈ 9 Go  (défaut)
ollama pull phi4:14b-q5_K_M    # ≈ 10 Go
ollama pull phi4:14b-q8_0      # ≈ 15 Go
ollama pull phi4:14b-fp16      # ≈ 29 Go (sans quantization)
→
Qué cuantización elegir
Para Phi-4, Q4_K_M sigue siendo el mejor equilibrio en hardware de consumo. La diferencia con Q5_K_M es marginal en la práctica con este modelo, y Q8_0 requiere 15 GB de VRAM para una mejora de calidad difícil de percibir fuera de los benchmarks.

#3. Pruebas iniciales: matemáticas, código, razonamiento

Inicia una sesión interactiva para verificar que el modelo funcione y probar sus puntos fuertes.

Sesión
ollama run phi4

Deberías ver un prompt `>>>`. Es allí donde Phi-4 brilla: los ejercicios lógicos y técnicos. Algunos prompts reveladores:

Prueba de matemáticas
>>> Une boutique vend des stylos à 0,80 € pièce. Si vous en achetez 12 ou plus, le prix tombe à 0,65 € pièce. À partir de combien de stylos est-il plus économique de commander une boîte de 12 ?

Phi-4 desglosa el razonamiento paso a paso y llega al resultado. Para código, maneja sin problemas Python y JavaScript estándar.

Código de prueba
>>> Écris une fonction Python qui prend une liste d'entiers et renvoie le sous-tableau contigu de somme maximale (algorithme de Kadane). Avec docstring et 3 cas de test.
i
Velocidad estimada
Con una RTX 4070 (12 GB) en Q4_K_M, calcula entre 45 y 60 tokens/s. Con una RTX 3060 (12 GB), entre 25 y 35 tokens/s. En un Mac M2 con 24 GB, entre 20 y 30 tokens/s. Con una CPU Ryzen 5 5600X, entre 4 y 6 tokens/s.

#4. Calidad en francés: las verdaderas debilidades

Aquí es donde Phi-4 muestra sus límites. El modelo se entrenó principalmente con textos en inglés (y muchos datos sintéticos generados en inglés). El francés está presente en el corpus, pero ocupa un lugar claramente secundario.

Gramática y concordancias
Buenos resultados con frases simples, pero errores de concordancia, anglicismos y construcciones poco fluidas en cuanto se pide una redacción extensa.
Términos técnicos FR
Tendencia a usar términos en inglés ("endpoint", "deployment", "thread") aunque exista un equivalente francés habitual.
Comprensión
Entiende muy bien un prompt en francés. El problema es la generación.
Código comentado en FR
Los comentarios de código cambian frecuentemente al inglés durante la generación. Da la instrucción de forma explícita: ayuda, pero no lo resuelve todo.
Cultura FR
Baja. Conocimiento superficial de la jurisprudencia, de la historia o de las instituciones francesas. Todo menos un modelo para redactar una nota jurídica en FR.
!
El veredicto para el uso en francés
Para redactar correctamente en francés, elige Mistral Small 24B (generalista, bueno en francés) o, en una máquina más modesta, Qwen 3.5 9B, que se desenvuelve claramente mejor en francés que Phi-4. Phi-4 sigue siendo excelente para tareas en las que la salida es código o razonamiento estructurado y en las que el idioma de interacción importa poco.

Un consejo que ayuda un poco: un prompt de sistema estricto obliga al modelo a responder siempre en francés, a costa de respuestas a veces más cortas.

Prompt de sistema FR
>>> /set system "Tu réponds exclusivement en français, sans jamais basculer en anglais. Les commentaires de code, les noms de variables explicatifs et les titres restent en français."

#5. Phi-4-Mini: la versión 3.8B

Microsoft lanzó simultáneamente Phi-4-Mini, una variante de 3,8B destinada a configuraciones con recursos muy limitados: portátiles sin GPU dedicada, Raspberry Pi 5 y dispositivos edge. Con 2,5 GB en Q4, funciona en cualquier máquina moderna.

Instalación
ollama pull phi4-mini
VRAM/RAM necesaria
≈ 2,5 GB en Q4_K_M. Cabe en un MacBook Air M1 de 8 GB o en un PC con una GPU de 4 GB.
Velocidad
Muy rápido. 80+ tok/seg en RTX 3060, 30+ tok/seg en CPU reciente.
Fortalezas
Sigue bien las instrucciones cortas; sirve para ayudar con los prompts, reformular textos sencillos y clasificar.
Debilidades
El razonamiento complejo y el código largo están fuera de sus capacidades. Es un modelo de apoyo, no un reemplazo de la versión 14B.
→
Casos de uso Phi-4-Mini
Excelente para conectarlo a un flujo de trabajo local de n8n, clasificar correos electrónicos o integrar un LLM en un script de Python que deba ejecutarse con rapidez y consumir pocos recursos. No se recomienda para conversaciones de propósito general.

#6. Phi-4 vs Qwen 3.5 9B

En 2026, su competidor directo más relevante es Qwen 3.5 9B de Alibaba. Un poco más compacto (6,6 GB en Q4 frente a 9 GB para Phi-4), cabe en el mismo GPU de 12 GB y apunta a la misma categoría de usuarios. Lo que los diferencia:

Razonamiento y matemáticas
Phi-4 lleva ventaja en los benchmarks formales (GPQA, MATH). En el uso práctico con problemas comunes, la diferencia es menor de lo que se cree.
Código
Qwen 3.5 9B es en general mejor en lenguajes menos comunes (Rust, Go, SQL avanzado). Phi-4 sigue siendo competitivo en Python y JS.
Francés
Qwen 3.5 es claramente mejor. Muchos más datos multilingües en su entrenamiento, vocabulario más rico, menos cambios al inglés. Ventaja clara de Qwen en este criterio.
Contexto
Qwen 3.5 9B acepta hasta 256k tokens de contexto, Phi-4 se limita a 16k. Si trabajas con documentos largos, Qwen es mucho más adecuado.
Seguimiento de instrucciones
Phi-4 sigue con más precisión las instrucciones estructuradas (formato JSON, restricciones estrictas). Qwen es un poco más "creativo" y puede tomarse libertades.
→
Cómo elegir
Trabajo en inglés sobre razonamiento, código Python y salida estructurada: Phi-4. Trabajo en francés, contexto largo, código en varios lenguajes de programación: Qwen 3.5 9B. En una GPU de 12 GB, de todos modos puedes instalar los dos y cambiar según la tarea.

#Solución de problemas

"Out of memory" al cargar
Tu VRAM no es suficiente para la cuantización elegida. Cambia a Q4_K_M (la opción útil más ligera) o deja que Ollama haga el offload parcial a la CPU con `ollama run phi4 --num-gpu N`, donde N es el número de capas que se colocan en la GPU.
Generación a 1–2 tokens/segundo en una máquina con GPU
Probablemente el modelo se esté ejecutando en la CPU. Comprueba la columna "PROCESSOR" con `ollama ps`. Si indica "100% CPU", libera VRAM (Chrome, juegos, otros modelos cargados) y vuelve a iniciarlo.
Respuestas que cambian al inglés durante la generación
Comportamiento esperado en Phi-4 en francés. Reforzar el prompt del sistema ayuda parcialmente. Para un uso recurrente en francés, cambia de modelo en lugar de luchar.
Contexto truncado a 4096 tokens
Ollama carga por defecto un contexto corto. Amplíalo explícitamente: `/set parameter num_ctx 16384`. Phi-4 solo se entrenó con un contexto de hasta 16k, así que no tiene sentido aumentarlo más.
El modelo inventa hechos recientes
Los conocimientos de Phi-4 se limitan a su fecha de entrenamiento (finales de 2024), y su cultura general es menor que la de modelos más grandes. Para obtener información factual actualizada, hace falta un pipeline RAG, no el modelo por sí solo.

#Para ir más allá

Phi-4 es un buen punto de partida para usar LLM de 14B en local. Algunas ideas para ir más allá con tu instalación:

Probar un competidor directo
La guía de pruebas de Qwen 3 muestra benchmarks comparables en hardware de consumo, lo que resulta útil para hacer la comparación con tus propios prompts.
Elegir la cuantización adecuada
La guía "Elegir la cuantización (Q4, Q5, Q8, FP16)" detalla los compromisos entre calidad y memoria que también se aplican a Phi-4.
Ejecutar Phi-4 sin GPU
Si utilizas solo la CPU, la guía "Ejecutar un LLM localmente sin GPU" complementa lo descrito aquí con optimizaciones específicas.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.