Principiante 8 minConceptos

LLM 7B, 30B, 70B: qué significan estos tamaños ?

En Hugging Face o Ollama, cada modelo lleva un número: 1B, 7B, 32B, 70B. Esta cifra —el número de miles de millones de parámetros— determina lo que el modelo sabe hacer, la VRAM que exige y su velocidad. Pero un LLM de 7B reciente puede superar a uno de 70B de hace dos años, y «más grande» no quiere decir «mejor para ti». Esta guía explica qué es un parámetro, qué aporta realmente cada nivel y cómo equilibrar tamaño, cuantización y hardware sin caer en las trampas del marketing.

Por Clara M.·Actualización 2026-09-21·Probado en Windows, macOS y Linux

#¿Qué es exactamente un parámetro?

Un parámetro es un número. Nada más: un valor numérico, a menudo codificado en 16 bits, aprendido durante el entrenamiento. Un modelo «7B» contiene 7 mil millones. Estos números son los pesos de las conexiones entre las neuronas artificiales de la red: codifican todo lo que el modelo «sabe»: la gramática, los hechos, las expresiones, las asociaciones de ideas.

La analogía más precisa es la de las sinapsis. Un parámetro es como la fuerza de una conexión entre dos neuronas del cerebro. Más conexiones hay, más capacidad tiene la red para memorizar matices y patrones sutiles. Un modelo de 1 mil millones de parámetros tiene aproximadamente 1 mil millones de estos ajustes; uno de 70B tiene sesenta y una vez más. Cada parámetro es mínimo y simple por sí solo; es su cantidad y su disposición la que produce el lenguaje.

i
¿Por qué la «B»?
La B significa billion en inglés, es decir, mil millones. 7B = 7 mil millones de parámetros. Este número no dice nada sobre la calidad de los datos de entrenamiento ni sobre la arquitectura: solo sobre el tamaño bruto de la red.

Concretamente, estos parámetros ocupan espacio. En 16 bits (FP16), cada parámetro pesa 2 bytes: un modelo de 7B ocupa así aproximadamente 14 GB en precisión completa. Es este tamaño en disco y en memoria el que determina si el modelo cabe en tu máquina —volveremos a este tema con la cuantización, que comprime estos pesos.

#La escala real de las capacidades, desde 1B hasta 70B

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Las capacidades no aumentan de forma lineal con el tamaño: avanzan por escalones. Al superar cierto umbral de parámetros, aparecen de golpe nuevas aptitudes: es lo que se conoce como capacidades emergentes. Esto es lo que se observa en la práctica en los modelos recientes.

1B – 3B
Completado de texto, reformulación simple, clasificación, extracción de palabras clave. Útil en móviles o en entornos edge, pero con un razonamiento frágil y alucinaciones frecuentes en cuanto aumenta la complejidad.
7B – 8B
El primer nivel realmente útil. Conversación coherente, resumen fiable, código simple, seguimiento de instrucciones correcto. Es el punto de entrada de un LLM local serio.
13B – 14B
Mejor rendimiento en tareas largas, menos errores factuales, código más sólido. Un nivel de refinamiento por encima del 7B, sin disparar el consumo de VRAM.
30B – 34B
Razonamiento en múltiples pasos más fiable, matices en las respuestas, buena calidad de código y traducción. El punto óptimo entre calidad y costo para un uso exigente en local.
70B
Lo mejor de la gama de consumo. Razonamiento cercano al de los modelos en la nube en muchas tareas, respuestas detalladas y con matices. Requiere un equipo potente o recurrir al offload.

Recuerda: cada duplicación del tamaño aporta una mejora real, pero cada vez menor. El salto de 1B a 7B es espectacular; el de 30B a 70B es real, pero mucho más sutil, y solo tiene sentido si tu tarea lo requiere.

#Lo que un LLM de 7B sabe hacer que uno de 1B no sabe hacer

Es la comparación más ilustrativa, porque la brecha es enorme pese a una diferencia de tamaño aparentemente modesta. Un 1B repite patrones; un 7B empieza a razonar. Pasar de uno al otro desbloquea capacidades concretas que notas inmediatamente al usar el modelo.

Seguir una instrucción en varias partes
Un modelo de 1B a menudo olvida la segunda mitad de tu solicitud. Un modelo de 7B sigue una instrucción del tipo «resume este texto en 3 puntos, luego tradúcelos al inglés».
Razonamiento en cadena
Un problema lógico o matemático de dos o tres pasos sigue fuera del alcance de un 1B; un 7B lo descompone correctamente en una buena parte de los casos.
Coherencia en un texto largo
El modelo de 1B pierde el hilo después de unos pocos párrafos. El de 7B mantiene el contexto, el tono y los nombres propios en una respuesta completa.
Código funcional
Un modelo de 7B especializado escribe funciones correctas y corrige errores simples; un modelo de 1B produce principalmente código que 'parece' código.
Menos alucinaciones
Sin eliminarlas, el 7B inventa mucho menos y sabe decir que no sabe con mayor frecuencia.
→
Umbral 7B
Si tu máquina lo permite, comienza siempre con un 7B/8B en lugar de un 3B. El aumento de fiabilidad es desproporcionado respecto al costo adicional en VRAM (alrededor de 5 GB en Q4).

#Tamaño y VRAM: la tabla que importa

La cuestión práctica no es «¿cuál es el mejor modelo?», sino «¿qué modelo cabe en mi tarjeta?». La VRAM necesaria depende directamente del número de parámetros. Estas son las cifras de referencia con cuantización Q4_K_M, el formato recomendado por defecto, que divide el tamaño aproximadamente entre cuatro respecto al FP16.

3B ≈ 2 GB
Funciona en cualquier equipo, incluso con una tarjeta gráfica de gama de entrada o solo con CPU. Ideal para dispositivos móviles y tareas sencillas.
7B ≈ 5 GB
Funciona con holgura en una RTX 3060 de 12 GB o una RTX 4070 de 12 GB. La mejor relación entre capacidad y accesibilidad.
14B ≈ 9 GB
Cabe en 12 GB de VRAM con un contexto razonable y funciona con holgura en 16 GB.
32B ≈ 19 GB
Busca una RTX 4090 de 24 GB, o una tarjeta de 16 GB con un poco de offload en RAM.
70B ≈ 40 GB
Fuera del alcance de una sola tarjeta de consumo: dos GPU, descarga a la RAM o al SSD, o un Mac Apple Silicon con abundante memoria unificada (M4 Pro de 48 GB).
!
No olvidar el contexto
Estas cifras corresponden únicamente a los pesos del modelo. La ventana de contexto (la caché KV) consume VRAM adicional, y cuanto mayor es, más consume. Prevé un margen de entre 1 y unos pocos GB por encima del tamaño del modelo.

#Tamaño vs cuantización: el verdadero equilibrio

Con una VRAM limitada, tienes dos opciones: elegir un modelo más pequeño o uno más grande pero más comprimido. La cuantización reduce la precisión de los parámetros —de 16 bits a 4 u 8 bits— para que el modelo quepa en menos memoria, a costa de una ligera pérdida de calidad.

La regla empírica validada por el uso: un modelo más grande con una cuantización más agresiva casi siempre supera a un modelo más pequeño con precisión completa, a igualdad de VRAM. Un 13B en Q4 cabe en la misma memoria que un 7B en Q8 y suele resultar más capaz. El número de parámetros pesa más que los últimos bits de precisión.

Q4_K_M
Recomendado por defecto. Pérdida mínima de calidad, memoria dividida por ~4. Opción por defecto para casi todos los usos.
Q5_K_M
Un nivel más de calidad a cambio de un poco más de VRAM. Buen equilibrio si la memoria lo permite.
Q8_0
Casi indistinguible del FP16. Reservar para modelos pequeños o tarjetas con mucha memoria.
FP16
Precisión completa, el doble de tamaño que Q8. Útil sobre todo para el fine-tuning, rara vez necesario para la inferencia.
→
La elección en una frase
Con la misma memoria, prefiere un modelo más grande en Q4 a uno más pequeño en Q8. No bajes por debajo de Q4 a menos que sea necesario: por debajo, la calidad cae rápidamente.

#¿Por qué un modelo pequeño y reciente supera a uno grande y antiguo?

Es el punto que más confunde a los principiantes: un LLM de 7B de 2026 puede superar a uno de 70B de 2023. El tamaño es solo uno de los factores de la calidad, y no siempre el más decisivo. Otros tres factores han mejorado enormemente.

Calidad de los datos
Los modelos recientes se entrenaron con corpus mejor filtrados, desduplicados y enriquecidos con datos sintéticos de alta calidad. A igual tamaño, aprenden mucho más.
Volumen de entrenamiento
Los modelos 7B modernos ven decenas de billones de tokens, muchos más que los grandes modelos antiguos. Una red pequeña muy entrenada supera a una red grande insuficientemente entrenada.
Arquitectura y postentrenamiento
Mejores arquitecturas, alineación mediante RLHF, entrenamiento específico para el razonamiento: todas estas mejoras son independientes del número de parámetros.

La destilación también juega un papel clave: se transfiere el conocimiento de un modelo muy grande a uno pequeño, que hereda parte de sus capacidades con una fracción de su tamaño. Así, un 7B o 8B destilado razona como un modelo mucho más pesado. Consecuencia práctica: siempre mira la fecha de lanzamiento y los benchmarks recientes, nunca solo el número de parámetros.

!
La trampa del marketing
«Mayor tamaño = mejor» no es cierto como regla absoluta. La calidad de un modelo depende tanto de sus datos, su entrenamiento y su arquitectura como de su tamaño. Desconfía de las comparaciones que solo comparan las cantidades de parámetros, expresadas en miles de millones.

#Cómo elegir el tamaño en la práctica

El tamaño adecuado es el que cabe en tu hardware y cubre tus necesidades de uso. Empieza por el modelo reciente más grande que tu VRAM admita en Q4 y luego ajusta según la necesidad real de velocidad o de matices.

  1. 01
    Mide tu VRAM
    Identifica la memoria de tu GPU (o la RAM unificada en Mac). Es el límite absoluto que descarta de entrada los modelos demasiado grandes.
  2. 02
    Busca el modelo reciente de mayor tamaño que quepa en Q4
    Con 12 GB, un modelo reciente de 14B. Con 24 GB, uno de 32B. Con 8 GB, un buen modelo de 7B/8B. Prefiere siempre un modelo recién lanzado a uno antiguo más grande.
  3. 03
    Ajusta según el uso
    Chat cotidiano y velocidad: mantente en 7B–14B. Razonamiento, código exigente, traducción precisa: pasa a 30B+ si la memoria lo permite.
  4. 04
    Comprueba la velocidad
    Si el rendimiento en tokens por segundo te frustra, baja un nivel. Un 7B rápido suele superar a un 32B lento para uso interactivo.

#Comparar dos tamaños en 5 minutos

La mejor forma de notar la diferencia es ejecutar modelos de dos tamaños distintos en tu propia máquina y compararlos. Si Ollama está instalado y escucha en su puerto predeterminado (http://localhost:11434), bastan dos comandos.

Terminal
# Un petit modèle rapide
ollama run llama3.2:3b --verbose

# Le même prompt sur un modèle plus gros
ollama run llama3.1:8b --verbose

Plantea la misma pregunta de razonamiento a los dos (por ejemplo, un pequeño problema lógico en varias etapas) y compara la calidad de las respuestas y la tasa de generación mostrada por --verbose. Verás concretamente dónde se sitúa el equilibrio entre capacidad y velocidad en tu hardware.

i
Leer tokens/segundo
La opción --verbose muestra al final de la respuesta el número de tokens por segundo. Es la medida objetiva para decidir entre dos tamaños en tu propia GPU.

#Para ir más allá

El tamaño se entiende mejor al relacionarlo con otros conceptos básicos del uso de modelos en local. Estas guías amplían directamente esta guía:

Elegir tu cuantización (Q4, Q5, Q8, FP16)
La otra mitad de la decisión sobre la memoria: cómo comprimir un modelo sin degradarlo, con una guía visual.
MoE explicado: por qué un 30B-A3B funciona como un modelo pequeño
La notación con dos números que rompe la relación entre tamaño y velocidad: una lectura para justo después de esta guía.
Destilación: cómo los modelos pequeños heredan de los grandes
Para entender profundamente por qué un modelo pequeño reciente puede superar a uno grande y antiguo.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.