Entender la ventana de contexto
La ventana de contexto es el número máximo de tokens que el modelo procesa a la vez: instrucción del sistema, historial, documentos adjuntos y respuesta en curso de generación, todo sumado. Consume memoria, porque cada token mantiene una entrada en la caché KV. En Ollama, el valor predeterminado es de 4096 tokens en una tarjeta con menos de 24 GiB de VRAM: a menudo es esa ventana, y no el modelo, la que limita lo que puedes hacerle leer.
Si la ventana es demasiado corta, hace que se olvide el inicio de una conversación o que se trunque un documento. Si es demasiado grande, satura la VRAM y lo ralentiza todo. Esta guía explica qué contiene, calcula su consumo de memoria a partir de la arquitectura de un modelo real y muestra cómo ajustarla sin sorpresas desagradables.
#Qué contiene la ventana de contexto
Según la documentación de Ollama, la longitud de contexto es el número máximo de tokens a los que el modelo tiene acceso en memoria. Todo se suma dentro de este único límite: el mensaje del sistema, el historial de la conversación, los archivos o fragmentos de documentos que pegues, tu última pregunta y la respuesta que el modelo está escribiendo. En un modelo de razonamiento, los tokens de reflexión también cuentan. Cuando el total supera la ventana, hay que prescindir de algo: las herramientas suelen recortar el principio o rechazar la solicitud. El modelo no tiene memoria fuera de esta ventana, salvo que un sistema externo (resumen, RAG) vuelva a proporcionarle información.
#El token: la unidad que llena la ventana
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Un token no es una palabra: es un fragmento de texto definido por el tokenizer del modelo, a menudo una sílaba o una palabra común. Una palabra rara o larga ocupa varios. El francés consume generalmente más tokens que el inglés para un contenido equivalente, porque la mayoría de los tokenizers están entrenados principalmente en inglés. La relación exacta varía de un modelo a otro: en lugar de confiar en una regla orientativa, mide. La API de Ollama devuelve prompt_eval_count, el número de tokens del prompt, en cada solicitud.
- Regla práctica
- Una página A4 de texto francés denso representa alrededor de mil tokens, según el tokenizer: compruébalo con prompt_eval_count en tu propio documento.
- Un libro
- Varios cientos de miles de tokens: fuera del alcance de una ventana de 32.000 o 64.000 tokens sin dividir el texto.
- Una respuesta
- Un modelo de razonamiento puede generar miles de tokens de reflexión que consumen la ventana antes de producir la respuesta visible.
#¿Qué tamaño de ventana elegir?
Ollama fija su valor predeterminado según la memoria de vídeo: aproximadamente 4 000 tokens (4k) con menos de 24 GiB de VRAM, 32k entre 24 y 48 GiB, y 256k a partir de 48 GiB. La misma página recomienda al menos 64 000 tokens para tareas que exigen un gran contexto, como la búsqueda web, los agentes y las herramientas de programación. Los modelos recientes anuncian máximos mucho más altos: el catálogo QuelLLM indica, por ejemplo, aproximadamente 256 000 tokens para Kimi K2.5 y aproximadamente 1 millón para Kimi K3, DeepSeek V4 Flash y GLM 5.2. Pero un máximo anunciado no es un contexto utilizable en tu máquina: las limitaciones de memoria, y a veces de calidad, lo impiden.
| Uso | Ventana indicativa | Nota |
|---|---|---|
| Conversación breve, preguntas-respuestas | 4.096 a 8.192 tokens | Es suficiente si no pegas documentos |
| Resumen o análisis de un artículo | 16 000 a 32 000 tokens | Revisa el número de tokens del texto |
| Asistente de código en un repositorio | 64 000 tokens o más | Recomendado por Ollama para las herramientas de programación |
| Agente con herramientas y búsqueda web | 64 000 tokens o más | Cada llamada a herramienta reintegra texto |
| Corpus muy grande | No busques la ventana | Recurre a un RAG en lugar de enviarlo todo |
Hay dos errores frecuentes al dimensionar la ventana de contexto. Primero, la ventana debe incluir la respuesta: si ocupas 31.000 de los 32.000 tokens con un documento, apenas queda espacio para responder, y un modelo de razonamiento se detendrá en plena reflexión. Segundo, en una conversación, el historial crece con cada turno: una ventana que basta para el primer mensaje puede saturarse en el vigésimo. Por tanto, prevé el peor caso de tu uso, no el caso medio, y deja un margen de aproximadamente una quinta parte de la ventana.
#¿Cuánta memoria consume el contexto?
Cada token presente en la ventana deja en cada capa del modelo una clave y un valor, almacenados en la caché KV. El coste por token se calcula a partir de cuatro valores de la arquitectura: el número de capas, el número de cabezas clave-valor, la dimensión de una cabeza y el tamaño de un número (2 bytes en FP16). La fórmula es: 2 (clave y valor) × capas × cabezas KV × dimensión de cabeza × 2 bytes. Atención: son las cabezas clave-valor las que cuentan, no las cabezas de atención, ya que en los modelos recientes varias cabezas de atención comparten las mismas cabezas clave-valor (grouped-query attention). El cálculo con las cabezas de atención sobreestima la caché por un factor de cuatro para el modelo siguiente.
Tomemos Qwen3-8B, cuya ficha oficial indica 36 capas y 8 cabezas clave-valor (frente a 32 cabezas de consulta); la configuración pública establece la dimensión de cada cabeza en 128. El coste es de 2 × 36 × 8 × 128 × 2 = 147 456 bytes por token, es decir, 144 KiB.
| Contexto | Caché KV (FP16) | Caché KV (q8_0, aproximadamente la mitad) |
|---|---|---|
| 4 096 tokens | 0,56 GiB | 0,28 GiB |
| 8 192 tokens | 1,13 GiB | 0,56 GiB |
| 16 384 tokens | 2,25 GiB | 1,13 GiB |
| 32 768 tokens | 4,50 GiB | 2,25 GiB |
| 131 072 tokens (con YaRN, según la ficha) | 18,00 GiB | 9,00 GiB |
Dos mecanismos reducen la caché. El primero es la cuantización de la caché: las preguntas frecuentes de Ollama indican que el tipo q8_0 consume aproximadamente la mitad de la memoria de FP16 con una pérdida muy pequeña, y q4_0 aproximadamente un cuarto con una pérdida más visible en contextos grandes; ambos requieren que Flash Attention esté activada. El segundo consiste en reducir la ventana a lo que necesitas. Nuestra guía sobre la caché KV detalla los ajustes.
#Ajustar la longitud de contexto
#En Ollama
Ollama permite fijar la longitud por defecto al iniciar el servidor, cambiarla para una sesión o especificarla petición por petición a través de la API.
Después de cargarlo, ejecuta ollama ps: la columna CONTEXT muestra la longitud asignada y la columna PROCESSOR indica la distribución entre GPU y CPU. Si una parte pasa a la CPU, reduce el contexto o elige un modelo más pequeño.
#En LM Studio
En LM Studio, la longitud de contexto se ajusta al cargar el modelo, en los parámetros de carga. Cambiar el valor obliga a recargar el modelo. Revisa la estimación de memoria mostrada antes de confirmar.
#Un procedimiento de ajuste en cuatro pasos
- 01Medir la necesidad realEnvía tu documento o tu historial típico y lee prompt_eval_count. Añade la longitud de la respuesta esperada y la del razonamiento, si el modelo lo genera.
- 02Elegir la ventanaToma el valor más pequeño que contenga este total con un margen del 20 %, al menos 64 000 tokens si usas un agente o una herramienta de programación, como recomienda Ollama.
- 03Verificar la memoriaCarga el modelo con esta ventana y ejecuta ollama ps. El procesador debe mostrar 100 % GPU; de lo contrario, reduce la ventana, cuantiza la caché o cambia de modelo.
- 04Probar la capacidad de recordarColoca un hecho concreto en medio de un texto largo y pide al modelo que lo identifique. Si el modelo no lo encuentra, la ventana anunciada supera la que realmente aprovecha, y es necesario dividir el texto en fragmentos o recurrir a un RAG.
#Una ventana grande no implica una lectura fiel
Un estudio de 2023, « Lost in the Middle », muestra que el rendimiento de los modelos puede degradarse notablemente según la posición de la información en el contexto: suele ser mejor cuando la información se encuentra al principio o al final, y empeora cuando está en el medio, incluso para modelos anunciados como de largo contexto. El benchmark RULER, publicado en 2024, va más lejos: casi todos los modelos probados pierden mucha precisión cuando la longitud aumenta, y solo la mitad de ellos mantiene un nivel satisfactorio a 32 000 tokens, mientras que todos anunciaban 32 000 o más.
Estos trabajos estudian modelos de su época y no permiten sacar conclusiones sobre los modelos de 2026, varios de los cuales están entrenados específicamente para contextos largos. Pero la pauta sigue siendo válida: coloca la instrucción y los hechos cruciales al principio, recuerda la pregunta al final y haz mediciones con tus documentos antes de confiar en una ventana anunciada de varios cientos de miles de tokens. La prueba más sencilla consiste en introducir un dato concreto en medio de un texto largo de tu ámbito y luego volver a preguntar por él: si el modelo lo recupera en cada intento, la ventana es aprovechable para tu uso; si no lo encuentra, reduce el texto enviado o divídelo en fragmentos.
#Cuando el contenido supera el límite
- Resumir a medida que avanza la conversación
- Haz que se genere un resumen del intercambio cada pocos turnos y vuelve a empezar con ese resumen al principio del contexto: pierdes detalles, pero mantienes el hilo.
- Dividir el documento
- Un PDF largo se procesa por sección, luego se agrupan las respuestas parciales. La guía sobre chunking detalla los tamaños útiles.
- Pasar a un RAG
- Cuando el corpus supera ampliamente la ventana, se recuperan unos pocos pasajes relevantes en lugar de enviarlo todo.
- Elegir un modelo con una ventana de contexto más amplia
- Solo si la memoria lo permite: consulta el cálculo del caché KV más arriba antes de duplicar la ventana.
¿Qué es la ventana de contexto de un LLM?+
¿Cuál es la ventana de contexto predeterminada de Ollama?+
¿Cómo aumentar el contexto de un modelo local?+
¿Cuánta VRAM consume un contexto de 32 000 tokens?+
¿Un contexto más grande hace que el modelo sea más inteligente?+
¿Se necesita RAG o una ventana de contexto amplia para analizar documentos?+
#Para ir más allá
- Cuantizar la caché KV: ahorrar VRAM
- Tokens y tokenización: comprender lo que consume un LLM
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- ¿Qué es el RAG y cómo funciona?
- Estrategias de chunking
- Calculadora de VRAM
- Fuente: documentación de Ollama, longitud de contexto
- Fuente: preguntas frecuentes de Ollama (caché KV, Flash Attention)
- Fuente: Lost in the Middle (arXiv 2023)
- Fuente: RULER, benchmark de contexto largo (arXiv 2024)
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.