Principiante 11 minConfiguración

Entender la ventana de contexto

Respuesta directa

La ventana de contexto es el número máximo de tokens que el modelo procesa a la vez: instrucción del sistema, historial, documentos adjuntos y respuesta en curso de generación, todo sumado. Consume memoria, porque cada token mantiene una entrada en la caché KV. En Ollama, el valor predeterminado es de 4096 tokens en una tarjeta con menos de 24 GiB de VRAM: a menudo es esa ventana, y no el modelo, la que limita lo que puedes hacerle leer.

Si la ventana es demasiado corta, hace que se olvide el inicio de una conversación o que se trunque un documento. Si es demasiado grande, satura la VRAM y lo ralentiza todo. Esta guía explica qué contiene, calcula su consumo de memoria a partir de la arquitectura de un modelo real y muestra cómo ajustarla sin sorpresas desagradables.

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux

#Qué contiene la ventana de contexto

Según la documentación de Ollama, la longitud de contexto es el número máximo de tokens a los que el modelo tiene acceso en memoria. Todo se suma dentro de este único límite: el mensaje del sistema, el historial de la conversación, los archivos o fragmentos de documentos que pegues, tu última pregunta y la respuesta que el modelo está escribiendo. En un modelo de razonamiento, los tokens de reflexión también cuentan. Cuando el total supera la ventana, hay que prescindir de algo: las herramientas suelen recortar el principio o rechazar la solicitud. El modelo no tiene memoria fuera de esta ventana, salvo que un sistema externo (resumen, RAG) vuelva a proporcionarle información.

i
Ventana y memoria no son lo mismo
Un asistente que «se acuerda» de una conversación de ayer no lo hace gracias a la ventana: la aplicación vuelve a leer un historial o una base de datos y lo copia en el prompt. La ventana es el límite de lo que puede caber en ella en un momento dado.

#El token: la unidad que llena la ventana

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Un token no es una palabra: es un fragmento de texto definido por el tokenizer del modelo, a menudo una sílaba o una palabra común. Una palabra rara o larga ocupa varios. El francés consume generalmente más tokens que el inglés para un contenido equivalente, porque la mayoría de los tokenizers están entrenados principalmente en inglés. La relación exacta varía de un modelo a otro: en lugar de confiar en una regla orientativa, mide. La API de Ollama devuelve prompt_eval_count, el número de tokens del prompt, en cada solicitud.

Contar los tokens reales de un prompt
curl http://localhost:11434/api/generate -d '{"model":"qwen3:8b","prompt":"Bonjour le monde","stream":false}'
# lisez prompt_eval_count et eval_count dans la réponse JSON
Regla práctica
Una página A4 de texto francés denso representa alrededor de mil tokens, según el tokenizer: compruébalo con prompt_eval_count en tu propio documento.
Un libro
Varios cientos de miles de tokens: fuera del alcance de una ventana de 32.000 o 64.000 tokens sin dividir el texto.
Una respuesta
Un modelo de razonamiento puede generar miles de tokens de reflexión que consumen la ventana antes de producir la respuesta visible.

#¿Qué tamaño de ventana elegir?

Ollama fija su valor predeterminado según la memoria de vídeo: aproximadamente 4 000 tokens (4k) con menos de 24 GiB de VRAM, 32k entre 24 y 48 GiB, y 256k a partir de 48 GiB. La misma página recomienda al menos 64 000 tokens para tareas que exigen un gran contexto, como la búsqueda web, los agentes y las herramientas de programación. Los modelos recientes anuncian máximos mucho más altos: el catálogo QuelLLM indica, por ejemplo, aproximadamente 256 000 tokens para Kimi K2.5 y aproximadamente 1 millón para Kimi K3, DeepSeek V4 Flash y GLM 5.2. Pero un máximo anunciado no es un contexto utilizable en tu máquina: las limitaciones de memoria, y a veces de calidad, lo impiden.

¿Qué ventana para qué uso?
UsoVentana indicativaNota
Conversación breve, preguntas-respuestas4.096 a 8.192 tokensEs suficiente si no pegas documentos
Resumen o análisis de un artículo16 000 a 32 000 tokensRevisa el número de tokens del texto
Asistente de código en un repositorio64 000 tokens o másRecomendado por Ollama para las herramientas de programación
Agente con herramientas y búsqueda web64 000 tokens o másCada llamada a herramienta reintegra texto
Corpus muy grandeNo busques la ventanaRecurre a un RAG en lugar de enviarlo todo

Hay dos errores frecuentes al dimensionar la ventana de contexto. Primero, la ventana debe incluir la respuesta: si ocupas 31.000 de los 32.000 tokens con un documento, apenas queda espacio para responder, y un modelo de razonamiento se detendrá en plena reflexión. Segundo, en una conversación, el historial crece con cada turno: una ventana que basta para el primer mensaje puede saturarse en el vigésimo. Por tanto, prevé el peor caso de tu uso, no el caso medio, y deja un margen de aproximadamente una quinta parte de la ventana.

#¿Cuánta memoria consume el contexto?

Cada token presente en la ventana deja en cada capa del modelo una clave y un valor, almacenados en la caché KV. El coste por token se calcula a partir de cuatro valores de la arquitectura: el número de capas, el número de cabezas clave-valor, la dimensión de una cabeza y el tamaño de un número (2 bytes en FP16). La fórmula es: 2 (clave y valor) × capas × cabezas KV × dimensión de cabeza × 2 bytes. Atención: son las cabezas clave-valor las que cuentan, no las cabezas de atención, ya que en los modelos recientes varias cabezas de atención comparten las mismas cabezas clave-valor (grouped-query attention). El cálculo con las cabezas de atención sobreestima la caché por un factor de cuatro para el modelo siguiente.

Tomemos Qwen3-8B, cuya ficha oficial indica 36 capas y 8 cabezas clave-valor (frente a 32 cabezas de consulta); la configuración pública establece la dimensión de cada cabeza en 128. El coste es de 2 × 36 × 8 × 128 × 2 = 147 456 bytes por token, es decir, 144 KiB.

Caché KV de Qwen3-8B en FP16 (cálculo basado en su configuración)
ContextoCaché KV (FP16)Caché KV (q8_0, aproximadamente la mitad)
4 096 tokens0,56 GiB0,28 GiB
8 192 tokens1,13 GiB0,56 GiB
16 384 tokens2,25 GiB1,13 GiB
32 768 tokens4,50 GiB2,25 GiB
131 072 tokens (con YaRN, según la ficha)18,00 GiB9,00 GiB
!
La trampa de la tarjeta de 8 GB
Qwen3-8B en Q4 ocupa aproximadamente 5 GB para sus pesos. Con 32.768 tokens de contexto, la caché KV añade 4,5 GiB, lo que eleva el total a aproximadamente 9,5 GB incluso antes de contar los búferes de cálculo. En una tarjeta de 8 GB, parte del modelo pasa entonces a ejecutarse en la CPU y la generación se ralentiza considerablemente, sin un mensaje de error claro. Compruébalo con ollama ps.

Dos mecanismos reducen la caché. El primero es la cuantización de la caché: las preguntas frecuentes de Ollama indican que el tipo q8_0 consume aproximadamente la mitad de la memoria de FP16 con una pérdida muy pequeña, y q4_0 aproximadamente un cuarto con una pérdida más visible en contextos grandes; ambos requieren que Flash Attention esté activada. El segundo consiste en reducir la ventana a lo que necesitas. Nuestra guía sobre la caché KV detalla los ajustes.

#Ajustar la longitud de contexto

#En Ollama

Ollama permite fijar la longitud por defecto al iniciar el servidor, cambiarla para una sesión o especificarla petición por petición a través de la API.

Tres formas de fijar el contexto en Ollama
# Valeur par défaut pour tout le serveur
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

# Pour une session interactive
>>> /set parameter num_ctx 16384

# Pour un modèle personnalisé (Modelfile)
FROM qwen3:8b
PARAMETER num_ctx 16384

Después de cargarlo, ejecuta ollama ps: la columna CONTEXT muestra la longitud asignada y la columna PROCESSOR indica la distribución entre GPU y CPU. Si una parte pasa a la CPU, reduce el contexto o elige un modelo más pequeño.

#En LM Studio

En LM Studio, la longitud de contexto se ajusta al cargar el modelo, en los parámetros de carga. Cambiar el valor obliga a recargar el modelo. Revisa la estimación de memoria mostrada antes de confirmar.

#Un procedimiento de ajuste en cuatro pasos

  1. 01
    Medir la necesidad real
    Envía tu documento o tu historial típico y lee prompt_eval_count. Añade la longitud de la respuesta esperada y la del razonamiento, si el modelo lo genera.
  2. 02
    Elegir la ventana
    Toma el valor más pequeño que contenga este total con un margen del 20 %, al menos 64 000 tokens si usas un agente o una herramienta de programación, como recomienda Ollama.
  3. 03
    Verificar la memoria
    Carga el modelo con esta ventana y ejecuta ollama ps. El procesador debe mostrar 100 % GPU; de lo contrario, reduce la ventana, cuantiza la caché o cambia de modelo.
  4. 04
    Probar la capacidad de recordar
    Coloca un hecho concreto en medio de un texto largo y pide al modelo que lo identifique. Si el modelo no lo encuentra, la ventana anunciada supera la que realmente aprovecha, y es necesario dividir el texto en fragmentos o recurrir a un RAG.

#Una ventana grande no implica una lectura fiel

Un estudio de 2023, « Lost in the Middle », muestra que el rendimiento de los modelos puede degradarse notablemente según la posición de la información en el contexto: suele ser mejor cuando la información se encuentra al principio o al final, y empeora cuando está en el medio, incluso para modelos anunciados como de largo contexto. El benchmark RULER, publicado en 2024, va más lejos: casi todos los modelos probados pierden mucha precisión cuando la longitud aumenta, y solo la mitad de ellos mantiene un nivel satisfactorio a 32 000 tokens, mientras que todos anunciaban 32 000 o más.

Estos trabajos estudian modelos de su época y no permiten sacar conclusiones sobre los modelos de 2026, varios de los cuales están entrenados específicamente para contextos largos. Pero la pauta sigue siendo válida: coloca la instrucción y los hechos cruciales al principio, recuerda la pregunta al final y haz mediciones con tus documentos antes de confiar en una ventana anunciada de varios cientos de miles de tokens. La prueba más sencilla consiste en introducir un dato concreto en medio de un texto largo de tu ámbito y luego volver a preguntar por él: si el modelo lo recupera en cada intento, la ventana es aprovechable para tu uso; si no lo encuentra, reduce el texto enviado o divídelo en fragmentos.

#Cuando el contenido supera el límite

Resumir a medida que avanza la conversación
Haz que se genere un resumen del intercambio cada pocos turnos y vuelve a empezar con ese resumen al principio del contexto: pierdes detalles, pero mantienes el hilo.
Dividir el documento
Un PDF largo se procesa por sección, luego se agrupan las respuestas parciales. La guía sobre chunking detalla los tamaños útiles.
Pasar a un RAG
Cuando el corpus supera ampliamente la ventana, se recuperan unos pocos pasajes relevantes en lugar de enviarlo todo.
Elegir un modelo con una ventana de contexto más amplia
Solo si la memoria lo permite: consulta el cálculo del caché KV más arriba antes de duplicar la ventana.
FAQ
¿Qué es la ventana de contexto de un LLM?+
Es el número máximo de tokens que el modelo procesa a la vez: mensaje de sistema, historial, documentos adjuntos, pregunta y respuesta en curso. Más allá, el inicio se recorta o la solicitud se rechaza. La ventana limita lo que el modelo puede leer, no lo que aprendió durante su entrenamiento.
¿Cuál es la ventana de contexto predeterminada de Ollama?+
Depende de la memoria de vídeo: 4k tokens con menos de 24 GiB de VRAM, 32k entre 24 y 48 GiB, 256k por encima de 48 GiB. Ollama recomienda al menos 64.000 tokens para agentes, búsqueda web y herramientas de codificación. Puedes modificarla con OLLAMA_CONTEXT_LENGTH o num_ctx.
¿Cómo aumentar el contexto de un modelo local?+
Establece OLLAMA_CONTEXT_LENGTH al iniciar el servidor, usa /set parameter num_ctx en una sesión interactiva o declara PARAMETER num_ctx en un Modelfile. Comprueba después con ollama ps que el modelo siga íntegramente en la GPU: un contexto más largo consume más memoria y puede hacer que parte del modelo pase a ejecutarse en la CPU.
¿Cuánta VRAM consume un contexto de 32 000 tokens?+
Depende de la arquitectura. Para Qwen3-8B, la caché KV en FP16 alcanza aproximadamente 4,5 GiB a 32.768 tokens, además de los pesos. La fórmula es: 2 × capas × cabezas KV × dimensión de cabeza × 2 bytes por token. La cuantización q8_0 de la caché reduce este costo aproximadamente a la mitad.
¿Un contexto más grande hace que el modelo sea más inteligente?+
No. Le permite leer más texto, no razonar mejor. Al contrario, los estudios «Lost in the Middle» y RULER muestran que la precisión puede bajar cuando el contexto se alarga. Elige la ventana necesaria para tu tarea, no la más grande posible.
¿Se necesita RAG o una ventana de contexto amplia para analizar documentos?+
Si el documento cabe en la ventana con un margen y tienes memoria suficiente, enviarlo completo es más sencillo. Si supera ese límite, o para consultar una base de muchos archivos, el RAG consume menos recursos y suele ser más fiable, ya que solo envía los pasajes útiles.

#Para ir más allá

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.