LLM: ¿qué es? Definición simple y fonctionnement
¿Qué es un LLM en realidad? En una frase: un programa que ha leído una cantidad gigantesca de texto y que, a partir de lo que ha aprendido, predice la palabra siguiente más plausible —y así, repetidamente, hasta formar una respuesta. Esta guía explica sin jerga cómo se entrena un gran modelo de lenguaje, cómo genera texto token por token y la diferencia entre un LLM en la nube (ChatGPT, Gemini) y un LLM local que puedes ejecutar en tu propia máquina.
#¿Qué es un LLM? Definición sencilla
LLM es el acrónimo de Large Language Model, en francés «grand modèle de langage». La palabra «large» (grande) hace referencia al tamaño: estos modelos contienen miles de millones de parámetros, una especie de ajustes numéricos que se modifican durante el entrenamiento. «Language model» (modelo de lenguaje) significa que el programa modela el lenguaje: ha aprendido qué tan probable es una determinada secuencia de palabras en una determinada situación.
En concreto, un LLM solo hace una cosa: a partir de un fragmento de texto, predice lo que viene después. Tú escribes «La capital de Francia es» y él calcula que la palabra más probable después de esta frase es «París». Toda la magia aparente de un asistente como ChatGPT proviene de este mecanismo repetido miles de veces: redactar un correo, resumir un documento o escribir código no es más que una larga secuencia de «¿cuál es la siguiente palabra más probable?».
#Los tokens: cómo un LLM lee y escribe
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Un LLM no ve palabras ni letras como nosotros. Trabaja con tokens: fragmentos de texto. Un token puede ser una palabra corta completa (« chat »), una parte de palabra (« anti », « constitution »), un signo de puntuación o un espacio. En promedio, en francés, un token corresponde a aproximadamente 3 o 4 caracteres, es decir, alrededor de ¾ de una palabra.
Antes de procesar tu mensaje, el modelo lo divide en tokens (se llama tokenización), luego convierte cada token en una lista de números. Todo lo que calcula, lo calcula con esos números. Cuando responde, genera un token a la vez y luego los reconvierte en texto legible. Es por eso por lo que hablamos de generación «token por token».
- Token
- La unidad básica que maneja el modelo: una palabra corta, un fragmento de palabra o un símbolo.
- Contexto
- La cantidad de tokens que el modelo puede «tener en mente» a la vez (pregunta + historial + respuesta). Se habla de ventana de contexto, a menudo de 4.000, 32.000 o incluso cientos de miles de tokens.
- Referencia práctica
- Una página de texto ≈ 500 a 700 tokens. 1.000 tokens ≈ 750 palabras. La facturación en la nube y la velocidad local se miden ambas en tokens.
#El entrenamiento: cómo aprende un LLM
Un LLM no se programa regla por regla. Se entrena. Se le presentan enormes volúmenes de texto (páginas web, libros, código, artículos) y se le pide que adivine la siguiente palabra en cada posición. Al principio, casi siempre se equivoca. Con cada error, un algoritmo ajusta ligeramente sus miles de millones de parámetros para que la siguiente predicción sea un poco mejor. Repetido miles de millones de veces, este proceso hace emerger una comprensión estadística de la gramática, los hechos y el razonamiento.
Esta fase se desarrolla en dos grandes etapas. El preentrenamiento construye la cultura general del modelo a partir del texto en bruto. Después, el ajuste fino (fine-tuning) y la alineación le enseñan a seguir instrucciones y a responder de forma útil y cortés, a menudo con la ayuda de comentarios humanos. Un modelo «instruct» o «chat» ha pasado por esta segunda etapa; es el que se utiliza para conversar.
- Parámetros (los « mil millones »)
- Los valores internos que se ajustan durante el entrenamiento. Un modelo «7B» tiene 7 mil millones de parámetros; uno «70B» tiene 70 mil millones. Cuantos más parámetros tenga, más capaz será y más memoria necesitará.
- Pesos (weights)
- El otro nombre de los parámetros, una vez fijados. Descargar un modelo es descargar sus pesos: un archivo grande de varios gigabytes.
- Datos de entrenamiento
- El texto leído durante el entrenamiento. El modelo no lo almacena palabra por palabra: retiene regularidades estadísticas.
#Inferencia: generar texto token por token
Una vez entrenado, usar el modelo se llama inferencia. Envías un texto (el prompt) y el modelo produce su respuesta token a token. Aquí está el ciclo exacto: lee todo el texto disponible, calcula el token siguiente más probable, lo añade a la secuencia, vuelve a leer todo — prompt más el nuevo token — y vuelve a empezar. Se detiene cuando genera un token especial de final o alcanza el límite fijado.
Por eso, en una interfaz de chat, la respuesta se muestra palabra por palabra en tiempo real: presencias literalmente la generación. La velocidad se mide en tokens por segundo. En un LLM local, depende de tu hardware: una buena GPU genera decenas de tokens por segundo; un procesador por sí solo, muchos menos.
El modelo no elige siempre el token más probable de forma rígida. Un ajuste llamado temperatura introduce una parte de azar controlado: con una temperatura baja, las respuestas son previsibles y factuales; con una temperatura alta, son más creativas y variadas. Es este mismo mecanismo el que explica por qué un LLM puede dar dos respuestas diferentes a la misma pregunta.
#Lo que no es un LLM
Entender el funcionamiento evita los malentendidos comunes. Un LLM no es una base de datos: no busca una respuesta almacenada, la reconstruye estadísticamente. No está conectado a internet por defecto: solo conoce lo que ha leído hasta su fecha de entrenamiento, a menos que se le conecte una herramienta de búsqueda o RAG. Y no «entiende» en el sentido humano: modela el lenguaje extremadamente bien, lo cual basta para ser útil, pero sigue siendo una predicción, no una conciencia.
#Modelos LLM en la nube vs LLM locales: la verdadera diferencia
Existen dos formas de usar un LLM. En el caso de un LLM en la nube, el modelo corre en los servidores de una empresa (OpenAI para ChatGPT, Google para Gemini, Anthropic para Claude). Envías tu texto por internet, sus GPUs calculan la respuesta y te la devuelven. No descargas nada; a cambio, tus datos pasan por un tercero y dependes de una suscripción y de una conexión.
En el caso de un LLM local, descargas los pesos de un modelo de pesos abiertos (Llama, Qwen, Mistral, Gemma…) y lo ejecutas en tu propio ordenador. La inferencia se realiza íntegramente en tu equipo: no sale ningún dato, no hay suscripción y funciona incluso sin conexión. La contrapartida es que necesitas hardware suficiente y que los mejores modelos abiertos suelen seguir un escalón por detrás de los modelos propietarios más grandes en la nube.
- Confidencialidad
- Nube: tus prompts se envían al proveedor. Local: todo permanece en tu máquina.
- Coste
- Nube: suscripción mensual o pago por token. Local: uso gratuito una vez adquirido el hardware.
- Sin conexión
- Nube: conexión obligatoria. Local: funciona sin internet una vez descargado el modelo.
- Potencia
- Nube: acceso a los modelos más grandes sin necesidad de hardware. Local: limitado por tu GPU/RAM, pero muy potente incluso con una tarjeta de 12 GB.
- Control
- Nube: el proveedor puede cambiar el modelo o las reglas. Local: el modelo es tuyo y no cambia sin tu consentimiento.
#¿Por qué existe el LLM local?
Si la nube es tan práctica, ¿por qué ejecutar un LLM en casa? Tres razones principales. Primero, la confidencialidad: documentos médicos, contratos, código propietario, notas personales; muchas personas y empresas se niegan a enviar estos contenidos a servidores de terceros. Después, la independencia: sin suscripción, sin límite de mensajes, sin interrupciones si el servicio cambia de precio o desaparece. Y el control técnico: un modelo local se puede configurar, se integra con tus propias herramientas y funciona tanto en un avión como en una zona sin red.
Lo que hizo posible todo esto fue la cuantización: una técnica que comprime los pesos del modelo para que quepan en memoria sin perder demasiada calidad. Gracias a ella, un modelo que requería un servidor ahora puede ejecutarse en un ordenador de juego. El formato Q4_K_M ofrece el equilibrio recomendado para empezar; Q5_K_M, Q8_0 y FP16 ofrecen más precisión a costa de más memoria.
#Probar un LLM en casa en 10 minutos
La mejor forma de entender un LLM es ejecutar uno. La pila más sencilla consta de dos partes: Ollama, un demonio que descarga y ejecuta los modelos (escucha en http://localhost:11434), y una interfaz como Open WebUI o LM Studio para conversar en una ventana de chat. Estos son los pasos mínimos en la línea de comandos, con un modelo pequeño que funciona incluso sin una GPU dedicada.
- 01Instalar OllamaDescarga el instalador desde ollama.com para Windows, macOS o Linux y ejecútalo. Una vez instalado, Ollama funciona en segundo plano y expone su API local en el puerto 11434.
- 02Descargar y ejecutar un modeloUn solo comando descarga los pesos y luego abre el chat directamente en el terminal. La primera ejecución descarga unos cuantos gigabytes; las siguientes son instantáneas.
- 03ConversarPregunta algo y mira cómo aparece la respuesta token por token: ves la inferencia en directo. Escribe /bye para salir de la conversación.
- 04Verificar que todo sea localApaga el Wi-Fi y vuelve a hacer una pregunta. El modelo sigue respondiendo: la prueba de que el cálculo se realiza al 100 % en tu máquina.
#Para ir más allá
Ahora sabes qué es un LLM y cómo funciona. Estas guías amplían cada concepto tratado aquí:
- Empezar con Ollama
- « Ollama ¿qué es y cómo funciona? » detalla la instalación, los comandos básicos (run, pull, list) y el hardware necesario para comenzar.
- Entender los tokens
- « Entender la ventana de contexto » explica cómo el modelo « ve » tus mensajes y por qué olvida conversaciones largas.
- Elegir tu cuantización
- «Elegir la cuantización (Q4, Q5, Q8, FP16)» ayuda a encontrar el equilibrio adecuado entre calidad y memoria para tu tarjeta.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.