Phi-4 en local: instalar con Ollama, VRAM y velocidad
Phi-4 es el pequeño modelo de Microsoft que dio mucho que hablar a finales de 2024: solo 14 mil millones de parámetros y, aun así, puntuaciones en matemáticas y código que rivalizan con las de modelos tres veces más grandes. Esta guía muestra cómo instalar Phi-4 con Ollama en local, qué tal funciona realmente en la práctica y en qué aspectos decepciona, especialmente en francés.
#¿Por qué Phi-4?
Phi-4 es la continuación lógica de la familia Phi de Microsoft Research: modelos de pequeño tamaño, entrenados principalmente con datos sintéticos cuidadosamente elaborados, diseñados para competir con modelos mucho más grandes en tareas de razonamiento. La versión 4, lanzada a finales de 2024, lleva este enfoque a 14B de parámetros y obtiene puntuaciones notables en GPQA, MATH y HumanEval —a menudo por encima de Llama 3.3 70B en estos benchmarks específicos.
En concreto, es un modelo que cabe en 9 GB de VRAM en Q4_K_M, por lo que puede ejecutarse en una GPU de gama de entrada de 12 GB como una RTX 3060 o una RTX 4070. Y se desenvuelve decentemente incluso usando solo la CPU si tienes 16 GB de RAM. Este equilibrio entre tamaño y calidad lo convierte en un excelente candidato para el autoalojamiento con recursos modestos.
#Prerrequisitos
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
- Ollama instalado
- Windows, macOS o Linux. Si aún no lo has instalado, la guía de instalación de Ollama te lleva 3 minutos.
- VRAM para la cuantización Q4_K_M
- ≈ 9 GB. Una RTX 3060 de 12 GB, una RTX 4070 de 12 GB o un Mac con 16 GB de memoria unificada funcionan sin problemas.
- RAM de la CPU si no hay GPU
- 16 GB como mínimo para Q4. Calcula de 4 a 8 tokens/segundo en un Ryzen 5 o Core i5 reciente —utilizable para pruebas, pero no para un chat fluido.
- 10 GB de espacio en disco
- El modelo Q4_K_M pesa aproximadamente 9 GB. Reserva más espacio si también quieres probar Phi-4-Mini en paralelo.
#1. Instalar Ollama
Si Ollama ya está instalado, salta directamente a la siguiente sección. De lo contrario, aquí tienes la instalación con un solo comando en Linux y macOS.
En Windows, descarga el instalador desde el sitio oficial.
Una vez instalado, el daemon Ollama escucha en el puerto 11434.
#2. Obtener Phi-4
Phi-4 está disponible en el catálogo oficial de Ollama. La etiqueta predeterminada descarga la cuantización Q4_K_M, que ofrece el equilibrio recomendado.
La descarga ocupa aproximadamente 9 GB. Para elegir explícitamente otra cuantización, especifica la etiqueta.
#3. Pruebas iniciales: matemáticas, código, razonamiento
Inicia una sesión interactiva para verificar que el modelo funcione y probar sus puntos fuertes.
Deberías ver un prompt `>>>`. Es allí donde Phi-4 brilla: los ejercicios lógicos y técnicos. Algunos prompts reveladores:
Phi-4 desglosa el razonamiento paso a paso y llega al resultado. Para código, maneja sin problemas Python y JavaScript estándar.
#4. Calidad en francés: las verdaderas debilidades
Aquí es donde Phi-4 muestra sus límites. El modelo se entrenó principalmente con textos en inglés (y muchos datos sintéticos generados en inglés). El francés está presente en el corpus, pero ocupa un lugar claramente secundario.
- Gramática y concordancias
- Buenos resultados con frases simples, pero errores de concordancia, anglicismos y construcciones poco fluidas en cuanto se pide una redacción extensa.
- Términos técnicos FR
- Tendencia a usar términos en inglés ("endpoint", "deployment", "thread") aunque exista un equivalente francés habitual.
- Comprensión
- Entiende muy bien un prompt en francés. El problema es la generación.
- Código comentado en FR
- Los comentarios de código cambian frecuentemente al inglés durante la generación. Da la instrucción de forma explícita: ayuda, pero no lo resuelve todo.
- Cultura FR
- Baja. Conocimiento superficial de la jurisprudencia, de la historia o de las instituciones francesas. Todo menos un modelo para redactar una nota jurídica en FR.
Un consejo que ayuda un poco: un prompt de sistema estricto obliga al modelo a responder siempre en francés, a costa de respuestas a veces más cortas.
#5. Phi-4-Mini: la versión 3.8B
Microsoft lanzó simultáneamente Phi-4-Mini, una variante de 3,8B destinada a configuraciones con recursos muy limitados: portátiles sin GPU dedicada, Raspberry Pi 5 y dispositivos edge. Con 2,5 GB en Q4, funciona en cualquier máquina moderna.
- VRAM/RAM necesaria
- ≈ 2,5 GB en Q4_K_M. Cabe en un MacBook Air M1 de 8 GB o en un PC con una GPU de 4 GB.
- Velocidad
- Muy rápido. 80+ tok/seg en RTX 3060, 30+ tok/seg en CPU reciente.
- Fortalezas
- Sigue bien las instrucciones cortas; sirve para ayudar con los prompts, reformular textos sencillos y clasificar.
- Debilidades
- El razonamiento complejo y el código largo están fuera de sus capacidades. Es un modelo de apoyo, no un reemplazo de la versión 14B.
#6. Phi-4 vs Qwen 3.5 9B
En 2026, su competidor directo más relevante es Qwen 3.5 9B de Alibaba. Un poco más compacto (6,6 GB en Q4 frente a 9 GB para Phi-4), cabe en el mismo GPU de 12 GB y apunta a la misma categoría de usuarios. Lo que los diferencia:
- Razonamiento y matemáticas
- Phi-4 lleva ventaja en los benchmarks formales (GPQA, MATH). En el uso práctico con problemas comunes, la diferencia es menor de lo que se cree.
- Código
- Qwen 3.5 9B es en general mejor en lenguajes menos comunes (Rust, Go, SQL avanzado). Phi-4 sigue siendo competitivo en Python y JS.
- Francés
- Qwen 3.5 es claramente mejor. Muchos más datos multilingües en su entrenamiento, vocabulario más rico, menos cambios al inglés. Ventaja clara de Qwen en este criterio.
- Contexto
- Qwen 3.5 9B acepta hasta 256k tokens de contexto, Phi-4 se limita a 16k. Si trabajas con documentos largos, Qwen es mucho más adecuado.
- Seguimiento de instrucciones
- Phi-4 sigue con más precisión las instrucciones estructuradas (formato JSON, restricciones estrictas). Qwen es un poco más "creativo" y puede tomarse libertades.
#Solución de problemas
- "Out of memory" al cargar
- Tu VRAM no es suficiente para la cuantización elegida. Cambia a Q4_K_M (la opción útil más ligera) o deja que Ollama haga el offload parcial a la CPU con `ollama run phi4 --num-gpu N`, donde N es el número de capas que se colocan en la GPU.
- Generación a 1–2 tokens/segundo en una máquina con GPU
- Probablemente el modelo se esté ejecutando en la CPU. Comprueba la columna "PROCESSOR" con `ollama ps`. Si indica "100% CPU", libera VRAM (Chrome, juegos, otros modelos cargados) y vuelve a iniciarlo.
- Respuestas que cambian al inglés durante la generación
- Comportamiento esperado en Phi-4 en francés. Reforzar el prompt del sistema ayuda parcialmente. Para un uso recurrente en francés, cambia de modelo en lugar de luchar.
- Contexto truncado a 4096 tokens
- Ollama carga por defecto un contexto corto. Amplíalo explícitamente: `/set parameter num_ctx 16384`. Phi-4 solo se entrenó con un contexto de hasta 16k, así que no tiene sentido aumentarlo más.
- El modelo inventa hechos recientes
- Los conocimientos de Phi-4 se limitan a su fecha de entrenamiento (finales de 2024), y su cultura general es menor que la de modelos más grandes. Para obtener información factual actualizada, hace falta un pipeline RAG, no el modelo por sí solo.
#Para ir más allá
Phi-4 es un buen punto de partida para usar LLM de 14B en local. Algunas ideas para ir más allá con tu instalación:
- Probar un competidor directo
- La guía de pruebas de Qwen 3 muestra benchmarks comparables en hardware de consumo, lo que resulta útil para hacer la comparación con tus propios prompts.
- Elegir la cuantización adecuada
- La guía "Elegir la cuantización (Q4, Q5, Q8, FP16)" detalla los compromisos entre calidad y memoria que también se aplican a Phi-4.
- Ejecutar Phi-4 sin GPU
- Si utilizas solo la CPU, la guía "Ejecutar un LLM localmente sin GPU" complementa lo descrito aquí con optimizaciones específicas.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.