LLM 7B, 30B, 70B: qué significan estos tamaños ?
En Hugging Face o Ollama, cada modelo lleva un número: 1B, 7B, 32B, 70B. Esta cifra —el número de miles de millones de parámetros— determina lo que el modelo sabe hacer, la VRAM que exige y su velocidad. Pero un LLM de 7B reciente puede superar a uno de 70B de hace dos años, y «más grande» no quiere decir «mejor para ti». Esta guía explica qué es un parámetro, qué aporta realmente cada nivel y cómo equilibrar tamaño, cuantización y hardware sin caer en las trampas del marketing.
#¿Qué es exactamente un parámetro?
Un parámetro es un número. Nada más: un valor numérico, a menudo codificado en 16 bits, aprendido durante el entrenamiento. Un modelo «7B» contiene 7 mil millones. Estos números son los pesos de las conexiones entre las neuronas artificiales de la red: codifican todo lo que el modelo «sabe»: la gramática, los hechos, las expresiones, las asociaciones de ideas.
La analogía más precisa es la de las sinapsis. Un parámetro es como la fuerza de una conexión entre dos neuronas del cerebro. Más conexiones hay, más capacidad tiene la red para memorizar matices y patrones sutiles. Un modelo de 1 mil millones de parámetros tiene aproximadamente 1 mil millones de estos ajustes; uno de 70B tiene sesenta y una vez más. Cada parámetro es mínimo y simple por sí solo; es su cantidad y su disposición la que produce el lenguaje.
Concretamente, estos parámetros ocupan espacio. En 16 bits (FP16), cada parámetro pesa 2 bytes: un modelo de 7B ocupa así aproximadamente 14 GB en precisión completa. Es este tamaño en disco y en memoria el que determina si el modelo cabe en tu máquina —volveremos a este tema con la cuantización, que comprime estos pesos.
#La escala real de las capacidades, desde 1B hasta 70B
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Las capacidades no aumentan de forma lineal con el tamaño: avanzan por escalones. Al superar cierto umbral de parámetros, aparecen de golpe nuevas aptitudes: es lo que se conoce como capacidades emergentes. Esto es lo que se observa en la práctica en los modelos recientes.
- 1B – 3B
- Completado de texto, reformulación simple, clasificación, extracción de palabras clave. Útil en móviles o en entornos edge, pero con un razonamiento frágil y alucinaciones frecuentes en cuanto aumenta la complejidad.
- 7B – 8B
- El primer nivel realmente útil. Conversación coherente, resumen fiable, código simple, seguimiento de instrucciones correcto. Es el punto de entrada de un LLM local serio.
- 13B – 14B
- Mejor rendimiento en tareas largas, menos errores factuales, código más sólido. Un nivel de refinamiento por encima del 7B, sin disparar el consumo de VRAM.
- 30B – 34B
- Razonamiento en múltiples pasos más fiable, matices en las respuestas, buena calidad de código y traducción. El punto óptimo entre calidad y costo para un uso exigente en local.
- 70B
- Lo mejor de la gama de consumo. Razonamiento cercano al de los modelos en la nube en muchas tareas, respuestas detalladas y con matices. Requiere un equipo potente o recurrir al offload.
Recuerda: cada duplicación del tamaño aporta una mejora real, pero cada vez menor. El salto de 1B a 7B es espectacular; el de 30B a 70B es real, pero mucho más sutil, y solo tiene sentido si tu tarea lo requiere.
#Lo que un LLM de 7B sabe hacer que uno de 1B no sabe hacer
Es la comparación más ilustrativa, porque la brecha es enorme pese a una diferencia de tamaño aparentemente modesta. Un 1B repite patrones; un 7B empieza a razonar. Pasar de uno al otro desbloquea capacidades concretas que notas inmediatamente al usar el modelo.
- Seguir una instrucción en varias partes
- Un modelo de 1B a menudo olvida la segunda mitad de tu solicitud. Un modelo de 7B sigue una instrucción del tipo «resume este texto en 3 puntos, luego tradúcelos al inglés».
- Razonamiento en cadena
- Un problema lógico o matemático de dos o tres pasos sigue fuera del alcance de un 1B; un 7B lo descompone correctamente en una buena parte de los casos.
- Coherencia en un texto largo
- El modelo de 1B pierde el hilo después de unos pocos párrafos. El de 7B mantiene el contexto, el tono y los nombres propios en una respuesta completa.
- Código funcional
- Un modelo de 7B especializado escribe funciones correctas y corrige errores simples; un modelo de 1B produce principalmente código que 'parece' código.
- Menos alucinaciones
- Sin eliminarlas, el 7B inventa mucho menos y sabe decir que no sabe con mayor frecuencia.
#Tamaño y VRAM: la tabla que importa
La cuestión práctica no es «¿cuál es el mejor modelo?», sino «¿qué modelo cabe en mi tarjeta?». La VRAM necesaria depende directamente del número de parámetros. Estas son las cifras de referencia con cuantización Q4_K_M, el formato recomendado por defecto, que divide el tamaño aproximadamente entre cuatro respecto al FP16.
- 3B ≈ 2 GB
- Funciona en cualquier equipo, incluso con una tarjeta gráfica de gama de entrada o solo con CPU. Ideal para dispositivos móviles y tareas sencillas.
- 7B ≈ 5 GB
- Funciona con holgura en una RTX 3060 de 12 GB o una RTX 4070 de 12 GB. La mejor relación entre capacidad y accesibilidad.
- 14B ≈ 9 GB
- Cabe en 12 GB de VRAM con un contexto razonable y funciona con holgura en 16 GB.
- 32B ≈ 19 GB
- Busca una RTX 4090 de 24 GB, o una tarjeta de 16 GB con un poco de offload en RAM.
- 70B ≈ 40 GB
- Fuera del alcance de una sola tarjeta de consumo: dos GPU, descarga a la RAM o al SSD, o un Mac Apple Silicon con abundante memoria unificada (M4 Pro de 48 GB).
#Tamaño vs cuantización: el verdadero equilibrio
Con una VRAM limitada, tienes dos opciones: elegir un modelo más pequeño o uno más grande pero más comprimido. La cuantización reduce la precisión de los parámetros —de 16 bits a 4 u 8 bits— para que el modelo quepa en menos memoria, a costa de una ligera pérdida de calidad.
La regla empírica validada por el uso: un modelo más grande con una cuantización más agresiva casi siempre supera a un modelo más pequeño con precisión completa, a igualdad de VRAM. Un 13B en Q4 cabe en la misma memoria que un 7B en Q8 y suele resultar más capaz. El número de parámetros pesa más que los últimos bits de precisión.
- Q4_K_M
- Recomendado por defecto. Pérdida mínima de calidad, memoria dividida por ~4. Opción por defecto para casi todos los usos.
- Q5_K_M
- Un nivel más de calidad a cambio de un poco más de VRAM. Buen equilibrio si la memoria lo permite.
- Q8_0
- Casi indistinguible del FP16. Reservar para modelos pequeños o tarjetas con mucha memoria.
- FP16
- Precisión completa, el doble de tamaño que Q8. Útil sobre todo para el fine-tuning, rara vez necesario para la inferencia.
#¿Por qué un modelo pequeño y reciente supera a uno grande y antiguo?
Es el punto que más confunde a los principiantes: un LLM de 7B de 2026 puede superar a uno de 70B de 2023. El tamaño es solo uno de los factores de la calidad, y no siempre el más decisivo. Otros tres factores han mejorado enormemente.
- Calidad de los datos
- Los modelos recientes se entrenaron con corpus mejor filtrados, desduplicados y enriquecidos con datos sintéticos de alta calidad. A igual tamaño, aprenden mucho más.
- Volumen de entrenamiento
- Los modelos 7B modernos ven decenas de billones de tokens, muchos más que los grandes modelos antiguos. Una red pequeña muy entrenada supera a una red grande insuficientemente entrenada.
- Arquitectura y postentrenamiento
- Mejores arquitecturas, alineación mediante RLHF, entrenamiento específico para el razonamiento: todas estas mejoras son independientes del número de parámetros.
La destilación también juega un papel clave: se transfiere el conocimiento de un modelo muy grande a uno pequeño, que hereda parte de sus capacidades con una fracción de su tamaño. Así, un 7B o 8B destilado razona como un modelo mucho más pesado. Consecuencia práctica: siempre mira la fecha de lanzamiento y los benchmarks recientes, nunca solo el número de parámetros.
#Cómo elegir el tamaño en la práctica
El tamaño adecuado es el que cabe en tu hardware y cubre tus necesidades de uso. Empieza por el modelo reciente más grande que tu VRAM admita en Q4 y luego ajusta según la necesidad real de velocidad o de matices.
- 01Mide tu VRAMIdentifica la memoria de tu GPU (o la RAM unificada en Mac). Es el límite absoluto que descarta de entrada los modelos demasiado grandes.
- 02Busca el modelo reciente de mayor tamaño que quepa en Q4Con 12 GB, un modelo reciente de 14B. Con 24 GB, uno de 32B. Con 8 GB, un buen modelo de 7B/8B. Prefiere siempre un modelo recién lanzado a uno antiguo más grande.
- 03Ajusta según el usoChat cotidiano y velocidad: mantente en 7B–14B. Razonamiento, código exigente, traducción precisa: pasa a 30B+ si la memoria lo permite.
- 04Comprueba la velocidadSi el rendimiento en tokens por segundo te frustra, baja un nivel. Un 7B rápido suele superar a un 32B lento para uso interactivo.
#Comparar dos tamaños en 5 minutos
La mejor forma de notar la diferencia es ejecutar modelos de dos tamaños distintos en tu propia máquina y compararlos. Si Ollama está instalado y escucha en su puerto predeterminado (http://localhost:11434), bastan dos comandos.
Plantea la misma pregunta de razonamiento a los dos (por ejemplo, un pequeño problema lógico en varias etapas) y compara la calidad de las respuestas y la tasa de generación mostrada por --verbose. Verás concretamente dónde se sitúa el equilibrio entre capacidad y velocidad en tu hardware.
#Para ir más allá
El tamaño se entiende mejor al relacionarlo con otros conceptos básicos del uso de modelos en local. Estas guías amplían directamente esta guía:
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- La otra mitad de la decisión sobre la memoria: cómo comprimir un modelo sin degradarlo, con una guía visual.
- MoE explicado: por qué un 30B-A3B funciona como un modelo pequeño
- La notación con dos números que rompe la relación entre tamaño y velocidad: una lectura para justo después de esta guía.
- Destilación: cómo los modelos pequeños heredan de los grandes
- Para entender profundamente por qué un modelo pequeño reciente puede superar a uno grande y antiguo.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.