Principiante 9 minBases

LLM: ¿qué es? Definición simple y fonctionnement

¿Qué es un LLM en realidad? En una frase: un programa que ha leído una cantidad gigantesca de texto y que, a partir de lo que ha aprendido, predice la palabra siguiente más plausible —y así, repetidamente, hasta formar una respuesta. Esta guía explica sin jerga cómo se entrena un gran modelo de lenguaje, cómo genera texto token por token y la diferencia entre un LLM en la nube (ChatGPT, Gemini) y un LLM local que puedes ejecutar en tu propia máquina.

Por Mohamed Meguedmi·Actualización 2026-09-02·Probado en Windows, macOS y Linux

#¿Qué es un LLM? Definición sencilla

LLM es el acrónimo de Large Language Model, en francés «grand modèle de langage». La palabra «large» (grande) hace referencia al tamaño: estos modelos contienen miles de millones de parámetros, una especie de ajustes numéricos que se modifican durante el entrenamiento. «Language model» (modelo de lenguaje) significa que el programa modela el lenguaje: ha aprendido qué tan probable es una determinada secuencia de palabras en una determinada situación.

En concreto, un LLM solo hace una cosa: a partir de un fragmento de texto, predice lo que viene después. Tú escribes «La capital de Francia es» y él calcula que la palabra más probable después de esta frase es «París». Toda la magia aparente de un asistente como ChatGPT proviene de este mecanismo repetido miles de veces: redactar un correo, resumir un documento o escribir código no es más que una larga secuencia de «¿cuál es la siguiente palabra más probable?».

i
En una imagen
Imagina la escritura predictiva de tu teléfono, pero entrenada con billones de palabras en lugar de tus SMS. Un LLM es ese teclado predictivo llevado al extremo: lo suficientemente potente como para mantener una conversación coherente.

#Los tokens: cómo un LLM lee y escribe

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Un LLM no ve palabras ni letras como nosotros. Trabaja con tokens: fragmentos de texto. Un token puede ser una palabra corta completa (« chat »), una parte de palabra (« anti », « constitution »), un signo de puntuación o un espacio. En promedio, en francés, un token corresponde a aproximadamente 3 o 4 caracteres, es decir, alrededor de ¾ de una palabra.

Antes de procesar tu mensaje, el modelo lo divide en tokens (se llama tokenización), luego convierte cada token en una lista de números. Todo lo que calcula, lo calcula con esos números. Cuando responde, genera un token a la vez y luego los reconvierte en texto legible. Es por eso por lo que hablamos de generación «token por token».

Token
La unidad básica que maneja el modelo: una palabra corta, un fragmento de palabra o un símbolo.
Contexto
La cantidad de tokens que el modelo puede «tener en mente» a la vez (pregunta + historial + respuesta). Se habla de ventana de contexto, a menudo de 4.000, 32.000 o incluso cientos de miles de tokens.
Referencia práctica
Una página de texto ≈ 500 a 700 tokens. 1.000 tokens ≈ 750 palabras. La facturación en la nube y la velocidad local se miden ambas en tokens.
→
Por qué importa
El tamaño de contexto es un límite físico: si tu documento supera el tamaño de contexto, el modelo solo ve una parte. Entender los tokens ayuda a saber por qué un LLM «olvida» el comienzo de una conversación muy larga.

#El entrenamiento: cómo aprende un LLM

Un LLM no se programa regla por regla. Se entrena. Se le presentan enormes volúmenes de texto (páginas web, libros, código, artículos) y se le pide que adivine la siguiente palabra en cada posición. Al principio, casi siempre se equivoca. Con cada error, un algoritmo ajusta ligeramente sus miles de millones de parámetros para que la siguiente predicción sea un poco mejor. Repetido miles de millones de veces, este proceso hace emerger una comprensión estadística de la gramática, los hechos y el razonamiento.

Esta fase se desarrolla en dos grandes etapas. El preentrenamiento construye la cultura general del modelo a partir del texto en bruto. Después, el ajuste fino (fine-tuning) y la alineación le enseñan a seguir instrucciones y a responder de forma útil y cortés, a menudo con la ayuda de comentarios humanos. Un modelo «instruct» o «chat» ha pasado por esta segunda etapa; es el que se utiliza para conversar.

Parámetros (los « mil millones »)
Los valores internos que se ajustan durante el entrenamiento. Un modelo «7B» tiene 7 mil millones de parámetros; uno «70B» tiene 70 mil millones. Cuantos más parámetros tenga, más capaz será y más memoria necesitará.
Pesos (weights)
El otro nombre de los parámetros, una vez fijados. Descargar un modelo es descargar sus pesos: un archivo grande de varios gigabytes.
Datos de entrenamiento
El texto leído durante el entrenamiento. El modelo no lo almacena palabra por palabra: retiene regularidades estadísticas.
i
Entrenamiento ≠ uso
El entrenamiento cuesta millones de euros y semanas de cálculo en miles de GPUs: nadie lo vuelve a hacer en casa. Una vez publicados los pesos, en cambio, usarlos (la inferencia) es posible en un simple PC. Esa es la promesa del LLM local.

#Inferencia: generar texto token por token

Una vez entrenado, usar el modelo se llama inferencia. Envías un texto (el prompt) y el modelo produce su respuesta token a token. Aquí está el ciclo exacto: lee todo el texto disponible, calcula el token siguiente más probable, lo añade a la secuencia, vuelve a leer todo — prompt más el nuevo token — y vuelve a empezar. Se detiene cuando genera un token especial de final o alcanza el límite fijado.

Por eso, en una interfaz de chat, la respuesta se muestra palabra por palabra en tiempo real: presencias literalmente la generación. La velocidad se mide en tokens por segundo. En un LLM local, depende de tu hardware: una buena GPU genera decenas de tokens por segundo; un procesador por sí solo, muchos menos.

El modelo no elige siempre el token más probable de forma rígida. Un ajuste llamado temperatura introduce una parte de azar controlado: con una temperatura baja, las respuestas son previsibles y factuales; con una temperatura alta, son más creativas y variadas. Es este mismo mecanismo el que explica por qué un LLM puede dar dos respuestas diferentes a la misma pregunta.

!
La trampa de las alucinaciones
Un LLM predice lo que es plausible, no lo que es verdadero. Cuando no «sabe», genera de todos modos la continuación más probable, que puede ser falsa pero estar formulada con seguridad. Esto es lo que se llama una alucinación: hay que tenerlo siempre presente cuando se trata de hechos, cifras y citas.

#Lo que no es un LLM

Entender el funcionamiento evita los malentendidos comunes. Un LLM no es una base de datos: no busca una respuesta almacenada, la reconstruye estadísticamente. No está conectado a internet por defecto: solo conoce lo que ha leído hasta su fecha de entrenamiento, a menos que se le conecte una herramienta de búsqueda o RAG. Y no «entiende» en el sentido humano: modela el lenguaje extremadamente bien, lo cual basta para ser útil, pero sigue siendo una predicción, no una conciencia.


#Modelos LLM en la nube vs LLM locales: la verdadera diferencia

Existen dos formas de usar un LLM. En el caso de un LLM en la nube, el modelo corre en los servidores de una empresa (OpenAI para ChatGPT, Google para Gemini, Anthropic para Claude). Envías tu texto por internet, sus GPUs calculan la respuesta y te la devuelven. No descargas nada; a cambio, tus datos pasan por un tercero y dependes de una suscripción y de una conexión.

En el caso de un LLM local, descargas los pesos de un modelo de pesos abiertos (Llama, Qwen, Mistral, Gemma…) y lo ejecutas en tu propio ordenador. La inferencia se realiza íntegramente en tu equipo: no sale ningún dato, no hay suscripción y funciona incluso sin conexión. La contrapartida es que necesitas hardware suficiente y que los mejores modelos abiertos suelen seguir un escalón por detrás de los modelos propietarios más grandes en la nube.

Confidencialidad
Nube: tus prompts se envían al proveedor. Local: todo permanece en tu máquina.
Coste
Nube: suscripción mensual o pago por token. Local: uso gratuito una vez adquirido el hardware.
Sin conexión
Nube: conexión obligatoria. Local: funciona sin internet una vez descargado el modelo.
Potencia
Nube: acceso a los modelos más grandes sin necesidad de hardware. Local: limitado por tu GPU/RAM, pero muy potente incluso con una tarjeta de 12 GB.
Control
Nube: el proveedor puede cambiar el modelo o las reglas. Local: el modelo es tuyo y no cambia sin tu consentimiento.

#¿Por qué existe el LLM local?

Si la nube es tan práctica, ¿por qué ejecutar un LLM en casa? Tres razones principales. Primero, la confidencialidad: documentos médicos, contratos, código propietario, notas personales; muchas personas y empresas se niegan a enviar estos contenidos a servidores de terceros. Después, la independencia: sin suscripción, sin límite de mensajes, sin interrupciones si el servicio cambia de precio o desaparece. Y el control técnico: un modelo local se puede configurar, se integra con tus propias herramientas y funciona tanto en un avión como en una zona sin red.

Lo que hizo posible todo esto fue la cuantización: una técnica que comprime los pesos del modelo para que quepan en memoria sin perder demasiada calidad. Gracias a ella, un modelo que requería un servidor ahora puede ejecutarse en un ordenador de juego. El formato Q4_K_M ofrece el equilibrio recomendado para empezar; Q5_K_M, Q8_0 y FP16 ofrecen más precisión a costa de más memoria.

i
Indicador de VRAM en Q4
¿Cuánta memoria para qué modelo? 3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Una RTX 3060 de 12 GB ejecuta cómodamente un 7B o 14B; una RTX 4090 de 24 GB o un Mac Apple Silicon de 48 GB están orientados a modelos grandes.

#Probar un LLM en casa en 10 minutos

La mejor forma de entender un LLM es ejecutar uno. La pila más sencilla consta de dos partes: Ollama, un demonio que descarga y ejecuta los modelos (escucha en http://localhost:11434), y una interfaz como Open WebUI o LM Studio para conversar en una ventana de chat. Estos son los pasos mínimos en la línea de comandos, con un modelo pequeño que funciona incluso sin una GPU dedicada.

  1. 01
    Instalar Ollama
    Descarga el instalador desde ollama.com para Windows, macOS o Linux y ejecútalo. Una vez instalado, Ollama funciona en segundo plano y expone su API local en el puerto 11434.
  2. 02
    Descargar y ejecutar un modelo
    Un solo comando descarga los pesos y luego abre el chat directamente en el terminal. La primera ejecución descarga unos cuantos gigabytes; las siguientes son instantáneas.
  3. 03
    Conversar
    Pregunta algo y mira cómo aparece la respuesta token por token: ves la inferencia en directo. Escribe /bye para salir de la conversación.
  4. 04
    Verificar que todo sea local
    Apaga el Wi-Fi y vuelve a hacer una pregunta. El modelo sigue respondiendo: la prueba de que el cálculo se realiza al 100 % en tu máquina.
Terminal
# Lancer un petit modèle rapide (≈2 Go, tourne même sans GPU)
ollama run llama3.2:3b

# Pour un modèle plus capable si vous avez ~5 Go de VRAM
ollama run qwen3

# Vérifier les modèles installés et que le daemon répond
ollama list
curl http://localhost:11434/api/tags
→
Los nombres de etiquetas evolucionan
Los tags exactos (llama3.2:3b, qwen3…) y los tamaños disponibles cambian regularmente en la biblioteca de Ollama. Consulta ollama.com/library para conocer el nombre exacto y el tamaño en GB de cada variante antes de descargarla.

#Para ir más allá

Ahora sabes qué es un LLM y cómo funciona. Estas guías amplían cada concepto tratado aquí:

Empezar con Ollama
« Ollama ¿qué es y cómo funciona? » detalla la instalación, los comandos básicos (run, pull, list) y el hardware necesario para comenzar.
Entender los tokens
« Entender la ventana de contexto » explica cómo el modelo « ve » tus mensajes y por qué olvida conversaciones largas.
Elegir tu cuantización
«Elegir la cuantización (Q4, Q5, Q8, FP16)» ayuda a encontrar el equilibrio adecuado entre calidad y memoria para tu tarjeta.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.