llms.txt: el estándar para que ChatGPT y Perplexity
El archivo llms.txt es una convención sencilla: un archivo Markdown colocado en la raíz de tu sitio que presenta su contenido de forma legible para una IA. El objetivo es ayudar a modelos como ChatGPT, Perplexity o Claude a entender tu sitio y, en el mejor de los casos, a citarlo correctamente. Esta guía cubre la especificación exacta, la diferencia con llms-full.txt, la implementación paso a paso y lo que realmente cambia para la visibilidad en las respuestas de IA (el GEO), sin exagerar sus beneficios.
#¿Por qué existe llms.txt?
Una página web moderna es un infierno para una máquina que intenta analizarla: menús, banners de cookies, scripts, bloques publicitarios, HTML anidado. Un humano filtra todo eso sin pensar; un modelo de lenguaje, en cambio, debe adivinar dónde está el contenido útil y tiene una ventana de contexto limitada. Resultado: cuando una IA lee tu página, gran parte de su presupuesto de tokens se consume en ruido.
llms.txt responde a este problema. Es un archivo de texto en formato Markdown, servido en la raíz de tu dominio (en la dirección /llms.txt), que proporciona a una IA un mapa claro y conciso de tu sitio: de qué trata y a qué páginas acudir para obtener los detalles. La idea está directamente inspirada en robots.txt (que indica a los crawlers dónde pueden ir) y en sitemap.xml (que enumera las URL), pero está pensada para la lectura por un LLM en lugar de por un robot de indexación tradicional.
#La especificación llms.txt
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
El formato es deliberadamente minimalista y se basa por completo en Markdown estándar, siguiendo un orden preciso para que un programa pueda interpretarlo:
- Un título H1
- El nombre del sitio o del proyecto. Es el único elemento obligatorio de la especificación.
- Un bloque de cita
- Una frase de resumen (precedida por >) que describe el sitio. Muy recomendada: a menudo es lo primero que lee la IA.
- Párrafos de formato libre
- Cero o varios bloques de texto (sin título) para dar contexto: a quién va dirigido el sitio, cómo leerlo, convenciones posibles.
- Secciones H2
- Cada H2 incluye una lista de enlaces en formato Markdown hacia tus páginas importantes, en el formato [Título](url): nota opcional que describe la página.
- Una sección «Optional»
- Un H2 llamado exactamente Optional cuyos enlaces se indican como secundarios: una IA apresurada puede ignorarlos para ahorrar contexto.
#llms.txt vs llms-full.txt
Los dos archivos no sirven para lo mismo y no hay obligación de tener los dos.
- llms.txt
- Un índice. Corto, estructurado, lista tus páginas con descripciones breves. La IA lo lee para entender la arquitectura del sitio y luego busca las páginas que le interesan. Es el archivo que debes crear primero.
- llms-full.txt
- El contenido completo del sitio (o de la documentación) concatenado en un único archivo Markdown grande. La IA puede ingerirlo de una sola vez, sin realizar otras solicitudes. Útil para una documentación técnica que se quiere cargar completa en un contexto largo.
En la práctica: llms.txt para un sitio editorial como un blog o un catálogo de guías; llms-full.txt como complemento si tu contenido es documentación que se quiere poder «pegar» completa en un LLM. Ten en cuenta que llms-full.txt puede alcanzar rápidamente varios megabytes: genéralo solo si tiene sentido en tu caso.
#Crear tu archivo paso a paso
- 01Listar tus páginas que realmente importanNo incluyas todo. Selecciona entre 10 y 50 páginas que concentren lo que aportas: guías principales, páginas de producto, documentación clave. El objetivo es un índice con una alta concentración de información relevante, no una copia del sitemap.
- 02Escribir el encabezadoUn H1 con el nombre del sitio, seguido de un bloque de cita de una frase que resuma con precisión lo que se encuentra en tu sitio. Cíñete a los hechos: la IA a menudo reproducirá esta frase tal cual para presentarte.
- 03Agrupar los enlaces por sección H2Una sección por tema (por ejemplo, «Instalación», «Hardware», «RAG»). Para cada enlace, añade después de los dos puntos una nota breve que diga qué aporta la página. Estas notas son lo que ayuda a la IA a elegir la página correcta.
- 04Añadir una sección OptionalColoca allí las páginas de servicio (aviso legal, contacto, sobre nosotros) para que la IA sepa que son secundarias.
- 05Validar el MarkdownVerifica que se trate de Markdown válido y que todos los enlaces sean absolutos y funcionen. Un error de sintaxis hace que el archivo pierda su utilidad.
#Desplegar en un sitio estático o WordPress
El archivo debe ser accesible en la dirección exacta https://votre-domaine.fr/llms.txt, servido en texto plano (Content-Type text/plain o text/markdown). El método depende de tu alojamiento.
En un sitio estático (Hugo, Astro, Eleventy, un simple directorio HTML), es trivial: coloca el archivo llms.txt en la raíz del directorio publicado (a menudo public/ o static/), en el mismo lugar que robots.txt. Se servirá automáticamente.
En WordPress, no hay un campo dedicado. Tres opciones: subir el archivo a la raíz mediante FTP/SFTP (al lado de wp-config.php); usar una extensión SEO reciente (varias, entre ellas versiones de Yoast y Rank Math, saben generar un llms.txt); o añadir una regla que sirva el archivo desde un endpoint. La vía FTP sigue siendo la más sencilla y previsible.
#GEO: ser citado por los motores de respuesta IA
El GEO (Generative Engine Optimization) es a ChatGPT, Perplexity o los AI Overviews de Google lo que el SEO es a la búsqueda tradicional: el conjunto de prácticas para aparecer —y ser citado— en las respuestas generadas por una IA. El cambio fundamental es sencillo: en un motor de respuestas, el usuario lee una síntesis y hace clic mucho menos. Lo que importa ya no es solo estar en la primera página, sino ser la fuente que la IA utiliza y a la que atribuye la información.
llms.txt sigue esta lógica: ofrecer a los modelos un acceso limpio a un contenido bien dividido y claramente descrito. Pero seamos precisos sobre la cadena de causalidad, porque ahí es donde muchos artículos exageran.
- Lo que realmente ayuda al GEO
- Un contenido factual, estructurado en secciones claras, con respuestas directas al principio de la página y datos con fecha y fuentes. Los motores de respuesta premian eso, con o sin llms.txt.
- El papel de llms.txt
- Facilitar la comprensión de la estructura de tu sitio y proporcionar descripciones que la IA puede reutilizar. Esto facilita la lectura por parte de las máquinas; no es una señal mágica de posicionamiento.
#Lo que llms.txt no hace (seamos honestos)
Dos limitaciones estructurales que hay que tener en cuenta. En primer lugar, llms.txt no bloquea a nadie ni obliga a nadie: un crawler que no lo conozca sigue leyendo tu HTML normalmente; para controlar el acceso de los robots de IA, hay que configurar robots.txt (y las directivas user-agent de los crawlers de IA), no llms.txt. En segundo lugar, un archivo nunca compensa un contenido débil: si tus páginas son vagas o están desactualizadas, un buen índice no las hará citables.
Entonces, ¿por qué desplegarlo? Porque el costo es casi nulo, porque el ejercicio te obliga a clarificar la arquitectura y las descripciones de tu sitio (lo que también beneficia a tus lectores humanos y al SEO clásico), y porque, si la adopción despega, ya estarás listo. Es un seguro a bajo precio, no una varita mágica.
#Experiencia real: quelllm.fr lo despliega
Publicamos un llms.txt en la raíz de quelllm.fr desde hace varios meses. En concreto, se genera durante la compilación a partir de nuestro catálogo de guías: cada guía se convierte en una línea, agrupada por categoría (Instalación, Hardware, RAG…), con su descripción extraída del campo meta. Esto garantiza que el archivo nunca quede obsoleto mientras exista una guía.
- Lo que hemos observado
- Imposible atribuir de forma clara un aumento en las citas únicamente al archivo: demasiadas variables cambian al mismo tiempo (nuevos contenidos, notoriedad, evolución de los motores). Por eso no se afirmará un efecto cuantificado.
- El verdadero beneficio medible
- El ejercicio de generación nos ha obligado a disponer de descripciones breves, exactas y sin jerga para cada guía. Esta depuración ha resultado útil en todas partes: etiquetas meta, vistas previas en las búsquedas y coherencia editorial.
- El costo
- Una vez escrito el script de generación, cero mantenimiento. Es esta relación beneficio/costo la que justifica mantenerlo, independientemente de su impacto GEO exacto.
Nuestra posición: despliégalo para mantener todo en orden y anticiparte, no porque te prometan citas. Y dedica la mayor parte de tus esfuerzos a lo que realmente importa: la calidad y la estructura del propio contenido.
#Para ir más allá
Estas guías amplían los conceptos tratados aquí sobre la forma en que las IA recuperan y citan información:
- Entender el RAG
- « ¿Qué es el RAG y cómo funciona?» explica cómo una IA busca contenido externo para responder — la mecánica misma que llms.txt busca facilitar.
- Fiabilidad y citas
- «Alucinaciones: por qué tu LLM local inventa y cómo limitarlo» muestra por qué el uso de fuentes y la estructura importan tanto para obtener respuestas fiables.
- Notebooks de fuentes
- «NotebookLM en local: alternativas open-source» ilustra de forma concreta las preguntas y respuestas con citas basadas en un corpus de fuentes.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.