Destilación: cómo los modelos pequeños heredan de los gros
Seguramente has visto nombres como DeepSeek-R1-Distill-Qwen-14B y te has preguntado por qué un «pequeño» modelo razona de repente casi tan bien como un gigante. La respuesta está en una palabra: la destilación. Es la técnica que permite a un modelo compacto heredar el comportamiento de un modelo mucho más grande, sin tener su tamaño ni su lentitud. Esta guía explica la destilación de LLM con la metáfora del profesor y del alumno, detalla lo que realmente se transmite, lo que se pierde por el camino y cómo reconocer una destilación exitosa antes de ejecutarla en tu propia máquina.
#El problema que soluciona la destilación
Los mejores modelos abiertos son enormes: varios cientos de miles de millones de parámetros. Son brillantes, pero inutilizables en un ordenador de consumo: requieren decenas de gigabytes de VRAM y generan texto lentamente. Por el contrario, un modelo de 7B o 14B cabe en una tarjeta gráfica para videojuegos y responde rápido, pero a menudo le falta la fineza de razonamiento de su hermano mayor.
Nos gustaría, por tanto, recuperar parte del talento de un modelo grande en un formato que funcione en local. La reacción ingenua sería simplemente volver a entrenar un modelo pequeño con los mismos datos brutos que el grande. Eso no basta: con un tamaño reducido, aprender por su cuenta a partir de un océano de texto da como resultado un modelo correcto, pero no excepcional. La destilación ofrece un atajo: en lugar de volver a aprender sobre el mundo desde cero, el modelo pequeño aprende directamente del grande.
#El principio maestro-alumno
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
La destilación pone en juego dos modelos. El «profesor» es el modelo grande y muy potente que se quiere imitar. El «alumno» es el modelo pequeño que se entrena. El principio: se plantean miles de preguntas al profesor, se recogen sus respuestas y se entrena al alumno para que produzca las mismas. El alumno ya no aprende de textos en bruto encontrados en internet, sino de ejemplos ya «masticados» por un modelo experto.
La sutileza que marca toda la diferencia es qué copia exactamente el alumno. En la versión más rica, no imita solo la palabra final elegida por el profesor, sino toda la distribución de probabilidades de la siguiente palabra: el profesor no dice simplemente «la respuesta es gato», sino que indica «gato muy probable, perro algo probable, tostadora casi imposible». Estos matices —a veces llamados etiquetas suaves— contienen información que la mera respuesta correcta no aporta.
- Profesor (teacher)
- El gran modelo de referencia, caro pero excelente. Sirve de fuente; no se despliega en tu equipo.
- Alumno (student)
- El pequeño modelo que se entrena para reproducir el comportamiento del profesor. Es el que ejecutarás en local.
- Etiquetas blandas
- Las probabilidades matizadas que el profesor asigna a cada palabra posible, no solo a la palabra ganadora. La materia prima más rica de la destilación.
- Conjunto de datos de destilación
- El conjunto de preguntas y respuestas del profesor, sobre el que el alumno se entrena.
#Lo que realmente se transmite
A menudo se piensa que la destilación «transfiere los conocimientos» del modelo grande. En parte es cierto, pero impreciso. Lo que mejor se transfiere son sobre todo comportamientos y formas de hacer las cosas, más que hechos en bruto. Un modelo pequeño tiene una capacidad de almacenamiento limitada: no puede retener toda la enciclopedia interna de un gigante. En cambio, puede asimilar métodos muy bien.
- Estilo de razonamiento
- La forma de descomponer un problema en etapas, de plantear una cadena de pensamiento antes de concluir. Es lo que se transmite mejor, y el corazón de R1-Distill.
- Formato de las respuestas
- La estructura, el tono, la forma de organizar una explicación o código. El alumno adopta los hábitos de redacción del profesor.
- Esquemas de resolución
- En matemáticas, código o lógica, el alumno recibe recetas probadas: cómo abordar un tipo de problema, qué verificaciones realizar.
- Una parte de los conocimientos
- Hechos y asociaciones, sí, pero dentro de los límites de capacidad del modelo pequeño. Es el aspecto que peor se transfiere.
Esta distinción es esencial para comprender los modelos destilados recientes. Cuando DeepSeek destila R1 en un Qwen 14B, el objetivo no es que todo el conocimiento general de R1 quepa en 14 mil millones de parámetros: eso es imposible. El objetivo es transmitir su forma de razonar: pensar paso a paso, corregirse y desarrollar una demostración. Y eso, un modelo pequeño puede aprenderlo extraordinariamente bien.
#¿Por qué un 14B destilado supera a un 14B clásico?
Esta es la parte contraintuitiva. Dos modelos tienen exactamente el mismo tamaño —14 mil millones de parámetros— y, por tanto, la misma VRAM y la misma velocidad. Sin embargo, el modelo destilado suele superar con creces al clásico en razonamiento. El tamaño no ha cambiado; solo ha cambiado la forma de entrenarlo. ¿Cómo puede un mismo número de parámetros dar lugar a un modelo mucho mejor?
Porque el entrenamiento no llena los parámetros al azar: los organiza. Un 14B clásico aprende por sí solo a partir de texto en bruto; desarrolla capacidades aceptables, pero generalistas. Un 14B destilado aprende de ejemplos producidos por un profesor de élite, a menudo con razonamientos completos desarrollados paso a paso. Sus 14 mil millones de parámetros se estructuran en torno a buenos métodos, en lugar de aprender un poco de todo. A igual capacidad, la calidad de la señal de entrenamiento marca la diferencia.
- Mismo costo, mejor señal
- El modelo destilado no es más grande ni más lento, pero ha aprendido a partir de material de mucha mejor calidad: las salidas de un experto.
- Ejemplos densos
- Las respuestas del profesor están repletas de razonamientos correctos y completos, poco frecuentes en el texto sin procesar de la web.
- Menos ruido
- La web contiene mucha información errónea y ruido. Un profesor filtra: el alumno aprende con contenido limpio.
Cuidado con sacar conclusiones excesivas: «superar» se aplica sobre todo a las tareas a las que se dirige la destilación, normalmente el razonamiento, las matemáticas y el código. En cultura general pura o en conocimientos factuales detallados, la diferencia se reduce e incluso puede invertirse. Un modelo destilado no es mágicamente superior en todo: es superior en aquello para lo que se lo ha entrenado.
#El caso de los R1-Distill
El ejemplo que popularizó la destilación en local es la familia DeepSeek-R1-Distill, lanzada a principios de 2025. DeepSeek utilizó su gran modelo de razonamiento R1 como profesor y destiló su comportamiento en varios alumnos de distintos tamaños, basados en arquitecturas existentes como Qwen y Llama. Resultado: modelos de 1.5B, 7B, 8B, 14B y 32B que razonan con una cadena de pensamiento visible, algo que antes estaba reservado a los gigantes.
- R1-Distill-Qwen-1.5B
- Minúsculo, funciona casi en cualquier lugar, incluso sin GPU. Sorprendente para su tamaño en matemáticas sencillas.
- R1-Distill-Qwen-7B / Llama-8B
- La opción equilibrada para el público general: ~5 GB en Q4, en una tarjeta de 8 GB. Buen razonamiento para uso diario.
- R1-Distill-Qwen-14B
- ≈ 9 GB en Q4, adecuado para una RTX 3060 de 12 GB o una 4070 de 12 GB. El punto de equilibrio entre razonamiento y hardware accesible.
- R1-Distill-Qwen-32B
- ≈ 19 GB en Q4, para una RTX 4090 de 24 GB. El más cercano al profesor, si tu VRAM lo permite.
Estos modelos muestran su cadena de pensamiento entre etiquetas de reflexión antes de dar la respuesta final. Es exactamente el comportamiento del profesor R1 que se ha transmitido. En la práctica, un R1-Distill-Qwen-14B desarrolla un razonamiento estructurado sobre un problema de matemáticas, mientras que un Qwen 14B clásico respondería de forma más superficial — con el mismo consumo de memoria.
#Límites: lo que no se transmite
La destilación tiene un límite fijado por el tamaño del alumno. No se puede verter el océano de un gigante en un dedal. Comprender lo que se pierde por el camino evita decepciones y malas elecciones de modelo.
- El conocimiento factual detallado
- El modelo pequeño no puede memorizar todo lo que sabe el profesor. Cuando se trata de datos muy especializados o de nicho, inventa información con más facilidad.
- La robustez en tareas ajenas a lo aprendido
- En tareas alejadas de lo que se ha destilado, el alumno vuelve aproximadamente al nivel de un modelo convencional de su tamaño.
- El límite de capacidad
- Un 7B destilado sigue siendo un 7B. La destilación optimiza el uso de los parámetros, pero no añade más.
- La coherencia con contextos muy largos
- Seguir un razonamiento a lo largo de decenas de miles de tokens sigue siendo más difícil para un modelo pequeño, destilado o no.
También hay un riesgo más sutil: un modelo destilado puede imitar la forma de razonar del profesor sin alcanzar siempre su precisión. «Hace como si pensara» de forma convincente, pero puede equivocarse con seguridad ante un problema fuera de su alcance. Una cadena de pensamiento elegante no garantiza la exactitud: es algo que siempre hay que comprobar, especialmente al tomar decisiones importantes.
#Detectar una buena destilación
No todos los modelos destilados son igual de buenos. Antes de descargar uno, algunos indicios permiten evaluar con rigor su calidad sin ser experto.
- Un profesor identificado
- Una buena ficha indica claramente el modelo maestro (por ejemplo, «destilado a partir de R1»). Un maestro reconocido es un buen indicio de partida.
- Base clara
- ¿En qué arquitectura se basa el alumno (Qwen, Llama…)? Una base sólida y con buen soporte facilita el uso local.
- Benchmarks específicos
- Mira las puntuaciones en las tareas objetivo (matemáticas, código, razonamiento), no una cifra global vaga. Y compara con el modelo no destilado del mismo tamaño.
- Coherencia entre tamaño y promesa
- Cuidado con un modelo muy pequeño vendido como equivalente a un gigante en todo. La destilación ayuda, pero no hace milagros.
- Formato de reflexión
- Para un modelo de razonamiento destilado, verifica que muestre su cadena de pensamiento y que esta sea pertinente, no meramente decorativa.
#Los principales modelos destilados para probar en local
Estos son los modelos destilados que merecen la pena en 2026, del más ligero al más exigente, con su consumo de memoria orientativo en Q4_K_M.
- DeepSeek-R1-Distill-Qwen-1.5B
- ≈ 1,5 GB. La apuesta por lo diminuto: funciona incluso en CPU o en un portátil pequeño. Impresionante en matemáticas para su tamaño.
- DeepSeek-R1-Distill-Qwen-7B
- ≈ 5 GB, en una tarjeta de 8 GB. El punto de entrada ideal para descubrir el razonamiento destilado en el día a día.
- DeepSeek-R1-Distill-Qwen-14B
- ≈ 9 GB, adecuado para una RTX 3060 de 12 GB o una 4070. La mejor relación entre capacidad de razonamiento y hardware asequible.
- DeepSeek-R1-Distill-Qwen-32B
- ≈ 19 GB, para una RTX 4090 de 24 GB. El más cercano al modelo maestro si tu VRAM lo permite.
Si estás empezando, comienza con la versión 7B o 14B: muestran las ventajas de la destilación en una sola tarjeta de consumo, sin la complejidad de las configuraciones grandes. La 1.5B es un excelente entorno de pruebas para entender el comportamiento de razonamiento incluso sin GPU.
#Probar un modelo destilado en 3 minutos
Si Ollama ya está instalado y escucha en su puerto predeterminado (http://localhost:11434), dos comandos bastan para apreciar qué aporta la destilación frente a un modelo clásico del mismo tamaño.
- 01Descargar y ejecutar un modelo destiladoDescarga un R1-Distill y conversa con él. La primera ejecución descarga el modelo (unos pocos GB según el tamaño elegido).
- 02Plantear un problema de razonamientoDale un problema de matemáticas o lógica en varios pasos. Observa su cadena de pensamiento: desarrolla un razonamiento antes de concluir.
- 03Comparar con el modelo no destiladoArranca el Qwen clásico del mismo tamaño y plantea la misma pregunta. El modelo destilado debería razonar de forma más estructurada, con la misma VRAM y velocidad.
#Para ir más allá
La destilación se entiende mejor al relacionarla con otros conceptos básicos de la IA local. Estas guías amplían directamente el contenido de esta guía:
- Instalar DeepSeek R1 con Ollama
- Pasos para ejecutar las versiones destiladas de 7B/14B/32B localmente, con los requisitos de VRAM según el tamaño.
- MoE explicado: por qué un 30B-A3B funciona como un modelo pequeño
- El otro gran recurso arquitectónico que permite ejecutar grandes modelos en local, complementario a la destilación.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Una vez elegido tu modelo destilado, la cuantización determina su consumo final de memoria en tu tarjeta.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.