Principiante 8 minConceptos

Destilación: cómo los modelos pequeños heredan de los gros

Seguramente has visto nombres como DeepSeek-R1-Distill-Qwen-14B y te has preguntado por qué un «pequeño» modelo razona de repente casi tan bien como un gigante. La respuesta está en una palabra: la destilación. Es la técnica que permite a un modelo compacto heredar el comportamiento de un modelo mucho más grande, sin tener su tamaño ni su lentitud. Esta guía explica la destilación de LLM con la metáfora del profesor y del alumno, detalla lo que realmente se transmite, lo que se pierde por el camino y cómo reconocer una destilación exitosa antes de ejecutarla en tu propia máquina.

Por Clara M.·Actualización 2026-08-07·Probado en Windows, macOS y Linux

#El problema que soluciona la destilación

Los mejores modelos abiertos son enormes: varios cientos de miles de millones de parámetros. Son brillantes, pero inutilizables en un ordenador de consumo: requieren decenas de gigabytes de VRAM y generan texto lentamente. Por el contrario, un modelo de 7B o 14B cabe en una tarjeta gráfica para videojuegos y responde rápido, pero a menudo le falta la fineza de razonamiento de su hermano mayor.

Nos gustaría, por tanto, recuperar parte del talento de un modelo grande en un formato que funcione en local. La reacción ingenua sería simplemente volver a entrenar un modelo pequeño con los mismos datos brutos que el grande. Eso no basta: con un tamaño reducido, aprender por su cuenta a partir de un océano de texto da como resultado un modelo correcto, pero no excepcional. La destilación ofrece un atajo: en lugar de volver a aprender sobre el mundo desde cero, el modelo pequeño aprende directamente del grande.

i
Intuición en una frase
La destilación no consiste en comprimir un gran modelo. Consiste en entrenar un pequeño modelo para imitar las respuestas y el estilo de razonamiento de uno grande, como un aprendiz que observa trabajar al maestro.

#El principio maestro-alumno

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

La destilación pone en juego dos modelos. El «profesor» es el modelo grande y muy potente que se quiere imitar. El «alumno» es el modelo pequeño que se entrena. El principio: se plantean miles de preguntas al profesor, se recogen sus respuestas y se entrena al alumno para que produzca las mismas. El alumno ya no aprende de textos en bruto encontrados en internet, sino de ejemplos ya «masticados» por un modelo experto.

La sutileza que marca toda la diferencia es qué copia exactamente el alumno. En la versión más rica, no imita solo la palabra final elegida por el profesor, sino toda la distribución de probabilidades de la siguiente palabra: el profesor no dice simplemente «la respuesta es gato», sino que indica «gato muy probable, perro algo probable, tostadora casi imposible». Estos matices —a veces llamados etiquetas suaves— contienen información que la mera respuesta correcta no aporta.

Profesor (teacher)
El gran modelo de referencia, caro pero excelente. Sirve de fuente; no se despliega en tu equipo.
Alumno (student)
El pequeño modelo que se entrena para reproducir el comportamiento del profesor. Es el que ejecutarás en local.
Etiquetas blandas
Las probabilidades matizadas que el profesor asigna a cada palabra posible, no solo a la palabra ganadora. La materia prima más rica de la destilación.
Conjunto de datos de destilación
El conjunto de preguntas y respuestas del profesor, sobre el que el alumno se entrena.
→
Una imagen mental
Un estudiante puede aprender solo con libros, o seguir al mejor profesor del país que no solo le muestre la respuesta correcta, sino también su razonamiento, sus dudas y lo que descarta. El segundo avanza mucho más rápido con el mismo esfuerzo. La distilación consiste en ofrecer a ese profesor al modelo pequeño.

#Lo que realmente se transmite

A menudo se piensa que la destilación «transfiere los conocimientos» del modelo grande. En parte es cierto, pero impreciso. Lo que mejor se transfiere son sobre todo comportamientos y formas de hacer las cosas, más que hechos en bruto. Un modelo pequeño tiene una capacidad de almacenamiento limitada: no puede retener toda la enciclopedia interna de un gigante. En cambio, puede asimilar métodos muy bien.

Estilo de razonamiento
La forma de descomponer un problema en etapas, de plantear una cadena de pensamiento antes de concluir. Es lo que se transmite mejor, y el corazón de R1-Distill.
Formato de las respuestas
La estructura, el tono, la forma de organizar una explicación o código. El alumno adopta los hábitos de redacción del profesor.
Esquemas de resolución
En matemáticas, código o lógica, el alumno recibe recetas probadas: cómo abordar un tipo de problema, qué verificaciones realizar.
Una parte de los conocimientos
Hechos y asociaciones, sí, pero dentro de los límites de capacidad del modelo pequeño. Es el aspecto que peor se transfiere.

Esta distinción es esencial para comprender los modelos destilados recientes. Cuando DeepSeek destila R1 en un Qwen 14B, el objetivo no es que todo el conocimiento general de R1 quepa en 14 mil millones de parámetros: eso es imposible. El objetivo es transmitir su forma de razonar: pensar paso a paso, corregirse y desarrollar una demostración. Y eso, un modelo pequeño puede aprenderlo extraordinariamente bien.

i
Comportamiento vs conocimiento
Recuerda esta regla: la destilación transmite sobre todo habilidades y hábitos (cómo pensar), y en menor medida datos en bruto (qué saber). Un modelo destilado puede razonar como un gigante aunque conozca menos cosas que él.

#¿Por qué un 14B destilado supera a un 14B clásico?

Esta es la parte contraintuitiva. Dos modelos tienen exactamente el mismo tamaño —14 mil millones de parámetros— y, por tanto, la misma VRAM y la misma velocidad. Sin embargo, el modelo destilado suele superar con creces al clásico en razonamiento. El tamaño no ha cambiado; solo ha cambiado la forma de entrenarlo. ¿Cómo puede un mismo número de parámetros dar lugar a un modelo mucho mejor?

Porque el entrenamiento no llena los parámetros al azar: los organiza. Un 14B clásico aprende por sí solo a partir de texto en bruto; desarrolla capacidades aceptables, pero generalistas. Un 14B destilado aprende de ejemplos producidos por un profesor de élite, a menudo con razonamientos completos desarrollados paso a paso. Sus 14 mil millones de parámetros se estructuran en torno a buenos métodos, en lugar de aprender un poco de todo. A igual capacidad, la calidad de la señal de entrenamiento marca la diferencia.

Mismo costo, mejor señal
El modelo destilado no es más grande ni más lento, pero ha aprendido a partir de material de mucha mejor calidad: las salidas de un experto.
Ejemplos densos
Las respuestas del profesor están repletas de razonamientos correctos y completos, poco frecuentes en el texto sin procesar de la web.
Menos ruido
La web contiene mucha información errónea y ruido. Un profesor filtra: el alumno aprende con contenido limpio.

Cuidado con sacar conclusiones excesivas: «superar» se aplica sobre todo a las tareas a las que se dirige la destilación, normalmente el razonamiento, las matemáticas y el código. En cultura general pura o en conocimientos factuales detallados, la diferencia se reduce e incluso puede invertirse. Un modelo destilado no es mágicamente superior en todo: es superior en aquello para lo que se lo ha entrenado.

#El caso de los R1-Distill

El ejemplo que popularizó la destilación en local es la familia DeepSeek-R1-Distill, lanzada a principios de 2025. DeepSeek utilizó su gran modelo de razonamiento R1 como profesor y destiló su comportamiento en varios alumnos de distintos tamaños, basados en arquitecturas existentes como Qwen y Llama. Resultado: modelos de 1.5B, 7B, 8B, 14B y 32B que razonan con una cadena de pensamiento visible, algo que antes estaba reservado a los gigantes.

R1-Distill-Qwen-1.5B
Minúsculo, funciona casi en cualquier lugar, incluso sin GPU. Sorprendente para su tamaño en matemáticas sencillas.
R1-Distill-Qwen-7B / Llama-8B
La opción equilibrada para el público general: ~5 GB en Q4, en una tarjeta de 8 GB. Buen razonamiento para uso diario.
R1-Distill-Qwen-14B
≈ 9 GB en Q4, adecuado para una RTX 3060 de 12 GB o una 4070 de 12 GB. El punto de equilibrio entre razonamiento y hardware accesible.
R1-Distill-Qwen-32B
≈ 19 GB en Q4, para una RTX 4090 de 24 GB. El más cercano al profesor, si tu VRAM lo permite.

Estos modelos muestran su cadena de pensamiento entre etiquetas de reflexión antes de dar la respuesta final. Es exactamente el comportamiento del profesor R1 que se ha transmitido. En la práctica, un R1-Distill-Qwen-14B desarrolla un razonamiento estructurado sobre un problema de matemáticas, mientras que un Qwen 14B clásico respondería de forma más superficial — con el mismo consumo de memoria.

!
Un modelo destilado no es «el verdadero R1»
Un DeepSeek-R1-Distill-Qwen-14B no es R1 reducido: es un Qwen 14B que ha aprendido a razonar como R1. Tiene su método, pero no toda su potencia ni todos sus conocimientos. No esperes el rendimiento del modelo completo de 671B.

#Límites: lo que no se transmite

La destilación tiene un límite fijado por el tamaño del alumno. No se puede verter el océano de un gigante en un dedal. Comprender lo que se pierde por el camino evita decepciones y malas elecciones de modelo.

El conocimiento factual detallado
El modelo pequeño no puede memorizar todo lo que sabe el profesor. Cuando se trata de datos muy especializados o de nicho, inventa información con más facilidad.
La robustez en tareas ajenas a lo aprendido
En tareas alejadas de lo que se ha destilado, el alumno vuelve aproximadamente al nivel de un modelo convencional de su tamaño.
El límite de capacidad
Un 7B destilado sigue siendo un 7B. La destilación optimiza el uso de los parámetros, pero no añade más.
La coherencia con contextos muy largos
Seguir un razonamiento a lo largo de decenas de miles de tokens sigue siendo más difícil para un modelo pequeño, destilado o no.

También hay un riesgo más sutil: un modelo destilado puede imitar la forma de razonar del profesor sin alcanzar siempre su precisión. «Hace como si pensara» de forma convincente, pero puede equivocarse con seguridad ante un problema fuera de su alcance. Una cadena de pensamiento elegante no garantiza la exactitud: es algo que siempre hay que comprobar, especialmente al tomar decisiones importantes.

i
Lo recomendable
Usa un modelo destilado para lo que hace bien —razonar, estructurar, programar— y mantén una actitud crítica ante los hechos que afirma. Para la fiabilidad factual, un RAG que lo respalde con tus documentos es mejor que depender únicamente de la memoria del modelo.

#Detectar una buena destilación

No todos los modelos destilados son igual de buenos. Antes de descargar uno, algunos indicios permiten evaluar con rigor su calidad sin ser experto.

Un profesor identificado
Una buena ficha indica claramente el modelo maestro (por ejemplo, «destilado a partir de R1»). Un maestro reconocido es un buen indicio de partida.
Base clara
¿En qué arquitectura se basa el alumno (Qwen, Llama…)? Una base sólida y con buen soporte facilita el uso local.
Benchmarks específicos
Mira las puntuaciones en las tareas objetivo (matemáticas, código, razonamiento), no una cifra global vaga. Y compara con el modelo no destilado del mismo tamaño.
Coherencia entre tamaño y promesa
Cuidado con un modelo muy pequeño vendido como equivalente a un gigante en todo. La destilación ayuda, pero no hace milagros.
Formato de reflexión
Para un modelo de razonamiento destilado, verifica que muestre su cadena de pensamiento y que esta sea pertinente, no meramente decorativa.
→
Prueba que no engaña
Descarga TANTO el modelo destilado COMO el modelo clásico del mismo tamaño y plantéales tus propias preguntas difíciles para comparar sus respuestas una junto a otra. Si el modelo destilado razona mejor en tus casos reales, es adecuado para ti: eso dice mucho más que un benchmark público.

#Los principales modelos destilados para probar en local

Estos son los modelos destilados que merecen la pena en 2026, del más ligero al más exigente, con su consumo de memoria orientativo en Q4_K_M.

DeepSeek-R1-Distill-Qwen-1.5B
≈ 1,5 GB. La apuesta por lo diminuto: funciona incluso en CPU o en un portátil pequeño. Impresionante en matemáticas para su tamaño.
DeepSeek-R1-Distill-Qwen-7B
≈ 5 GB, en una tarjeta de 8 GB. El punto de entrada ideal para descubrir el razonamiento destilado en el día a día.
DeepSeek-R1-Distill-Qwen-14B
≈ 9 GB, adecuado para una RTX 3060 de 12 GB o una 4070. La mejor relación entre capacidad de razonamiento y hardware asequible.
DeepSeek-R1-Distill-Qwen-32B
≈ 19 GB, para una RTX 4090 de 24 GB. El más cercano al modelo maestro si tu VRAM lo permite.

Si estás empezando, comienza con la versión 7B o 14B: muestran las ventajas de la destilación en una sola tarjeta de consumo, sin la complejidad de las configuraciones grandes. La 1.5B es un excelente entorno de pruebas para entender el comportamiento de razonamiento incluso sin GPU.

#Probar un modelo destilado en 3 minutos

Si Ollama ya está instalado y escucha en su puerto predeterminado (http://localhost:11434), dos comandos bastan para apreciar qué aporta la destilación frente a un modelo clásico del mismo tamaño.

  1. 01
    Descargar y ejecutar un modelo destilado
    Descarga un R1-Distill y conversa con él. La primera ejecución descarga el modelo (unos pocos GB según el tamaño elegido).
  2. 02
    Plantear un problema de razonamiento
    Dale un problema de matemáticas o lógica en varios pasos. Observa su cadena de pensamiento: desarrolla un razonamiento antes de concluir.
  3. 03
    Comparar con el modelo no destilado
    Arranca el Qwen clásico del mismo tamaño y plantea la misma pregunta. El modelo destilado debería razonar de forma más estructurada, con la misma VRAM y velocidad.
Terminal
# Lancer un modèle distillé de raisonnement
ollama run deepseek-r1:14b

# Comparer avec le modèle classique de même taille
ollama run qwen3:14b
i
Ver el razonamiento
En un R1-Distill, la respuesta comienza con una fase de reflexión (cadena de pensamiento) antes de la conclusión. Es precisamente el comportamiento heredado del modelo maestro R1: la señal visible de que la destilación ha hecho su trabajo.

#Para ir más allá

La destilación se entiende mejor al relacionarla con otros conceptos básicos de la IA local. Estas guías amplían directamente el contenido de esta guía:

Instalar DeepSeek R1 con Ollama
Pasos para ejecutar las versiones destiladas de 7B/14B/32B localmente, con los requisitos de VRAM según el tamaño.
MoE explicado: por qué un 30B-A3B funciona como un modelo pequeño
El otro gran recurso arquitectónico que permite ejecutar grandes modelos en local, complementario a la destilación.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Una vez elegido tu modelo destilado, la cuantización determina su consumo final de memoria en tu tarjeta.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.