Intermedio 11 minStack

Docling: convertir PDF para una IA locale

Respuesta directa

Docling es una biblioteca libre (licencia MIT, proyecto de IBM Research alojado por la LF AI & Data Foundation) que convierte PDF, DOCX, PPTX, XLSX, HTML, EPUB, imágenes y audio en markdown o JSON estructurado, reconstruyendo la disposición de la página, el orden de lectura y las tablas. Se ejecuta íntegramente en local, con o sin GPU, y se conecta directamente a LangChain, LlamaIndex, Crew AI o Haystack para alimentar un pipeline de RAG documental.

El PDF es la entrada más difícil de cualquier cadena de procesamiento documental local: dos columnas leídas de lado a lado, un encabezado que corta una frase en dos, una tabla de cifras reducida a una columna de números sin sus etiquetas. Docling es una biblioteca libre publicada por IBM Research, hoy alojada en la LF AI & Data Foundation, que analiza la disposición de la página, reconstruye el orden de lectura y recupera la estructura de las tablas, para después exportarlo todo en markdown, HTML o JSON. Todo en tu máquina, sin API, que es precisamente el requisito cuando los documentos son contratos o expedientes médicos.

Por Mohamed Meguedmi·Actualización 2026-09-28·Probado en Windows, macOS y Linux

#La etapa que determina todo lo demás

Cuando un asistente documental responde mal, se culpa al modelo. La causa casi siempre está en una etapa anterior. Un informe exportado a partir de una plantilla de empresa y procesado por un extractor de texto rudimentario se convierte en un flujo en el que el encabezado de página interrumpe un párrafo, el diseño en dos columnas se lee horizontalmente y una tabla de resultados se transforma en una secuencia de números sin contexto. Estos fragmentos se codifican después, se recuperan y se presentan al modelo como hechos: lee un sinsentido y lo reproduce con seguridad. Ningún modelo de embedding, ningún reranker ni ningún prompt puede subsanar una conversión fallida en las primeras etapas de la cadena: este es el punto que la mayoría de los tutoriales de RAG local pasan por alto al centrarse en la elección del modelo de lenguaje.

Docling aborda directamente esta etapa descuidada. IBM Research publicó el proyecto como código abierto en julio de 2024 bajo licencia MIT, lo que permite un uso comercial sin regalías ni copyleft. Superó rápidamente las 10 000 estrellas en GitHub y a principios de 2025 figuraba entre los repositorios más seguidos del mundo; a finales de septiembre de 2026, el repositorio oficial contaba con más de 68 000 estrellas y su última versión estable, la v2.130.0, se había publicado el 22 de septiembre de 2026.

#Lo que hace Docling

El kit RAG Local

Tus documentos, tu IA: un RAG local fiable sobre tus PDF, notas y correos — sin enviar nada a la nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
Análisis de la maquetación
Identifica las zonas de una página y su naturaleza, para que una leyenda no se pegue a un párrafo y un pie de página no aparezca en medio de una frase.
Orden de lectura
Reconstruye la secuencia que seguiría una persona, lo que por fin permite aprovechar los documentos organizados en columnas.
Estructura de las tablas
Identifica filas, columnas y celdas fusionadas, y las exporta como verdaderas tablas en lugar de líneas de texto.
Reconocimiento óptico cuando sea necesario
Las páginas escaneadas sin capa de texto pasan por OCR en lugar de incorporarse sin contenido textual.
Comprensión de gráficos
Los gráficos circulares, histogramas y curvas pueden convertirse en tablas de datos o en una descripción textual, en lugar de ignorarse por completo.
Un único modelo de documento
Una representación interna común, varios formatos de exportación (markdown, HTML, DocTags, JSON sin pérdida): el resto del proceso ignora si la entrada era un PDF o un archivo ofimático.

Además del PDF, Docling admite DOCX, PPTX, XLSX, HTML, EPUB, imágenes (PNG, TIFF, JPEG…), correos electrónicos (EML, MSG) e incluso audio (WAV, MP3) mediante un pipeline de transcripción, lo cual es importante porque un corpus real nunca es homogéneo. En cuanto a las integraciones, la biblioteca se conecta con LangChain, LlamaIndex, Crew AI y Haystack con unas pocas líneas de código, lo que evita tener que escribir tú mismo el código de conversión dentro de un pipeline de agentes.

#Las tablas, la verdadera razón para tomarse la molestia

En un documento profesional, las cifras casi siempre están en tablas, y es ahí donde la extracción simplista falla con más gravedad. Una línea que se convierte en «París 12 480 3,2» ha perdido los encabezados de columna que le daban sentido. La búsqueda devuelve luego un extracto de apariencia correcta, el modelo inventa la relación entre los valores y la respuesta es incorrecta de una manera difícil de detectar.

Docling encomienda esta tarea a un modelo especializado, TableFormer, que codifica la estructura de la tabla con un vocabulario especializado llamado OTSL (Optimized Table Structure Language) y maneja correctamente las celdas fusionadas y los encabezados de varios niveles. Según el artículo de investigación que dio origen a este formato, OTSL reduce a unos pocos tokens lo que una representación HTML equivalente expresa con más de 28 tokens, lo que reduce aproximadamente a la mitad la longitud media de la secuencia que se debe predecir y divide por dos el tiempo de inferencia en comparación con un modelo que generase HTML: un detalle de arquitectura invisible para el usuario final, pero que explica por qué el reconocimiento de tablas de Docling sigue siendo utilizable con grandes volúmenes sin una GPU dedicada exclusivamente a este uso. Hay dos modos disponibles en las opciones del pipeline: FAST, más rápido pero menos preciso con tablas complejas, y ACCURATE, recomendado cuando las tablas contienen celdas fusionadas o varios niveles de encabezado. Conservar la estructura, incluso en markdown, mantiene el vínculo entre cada valor y su encabezado. En un corpus donde las respuestas esperadas son cifras, esto justifica por sí solo un conversor más pesado que un simple extractor de texto.

!
Controla cinco documentos a mano
Antes de ingerir un corpus completo, convierte cinco documentos representativos y lee el markdown generado, revisando con atención las tablas y los saltos de página. Diez minutos aquí evitan una semana culpando al modelo.

#Los motores OCR disponibles

Docling no incluye un motor OCR único: coordina varios motores intercambiables según el tipo de documento. EasyOCR y Tesseract (a través de tesserocr o de la línea de comandos) cubren la mayoría de los casos; RapidOCR acepta modelos personalizados; OcrMac utiliza el reconocimiento nativo de macOS cuando está disponible. La elección se realiza en las opciones del pipeline, no en el código de tu aplicación, lo que permite cambiar de motor sin modificar la lógica de ingestión.

En la práctica, un pipeline de ingestión en producción comienza casi siempre por probar Tesseract en una muestra: si produce un texto limpio, no hay razón para asumir el coste de EasyOCR. Pasar a EasyOCR se justifica sobre todo con documentos escaneados de baja calidad, formularios parcialmente manuscritos o idiomas en los que Tesseract falla. RapidOCR y OcrMac siguen siendo opciones de nicho, reservadas respectivamente para un modelo OCR propio ya entrenado y para un equipo Mac aislado sin dependencias externas que instalar.

Elegir un motor OCR según el documento
MotorPunto fuerteCaso de uso típico
TesseractRápido con texto nítidoDocumentos digitales ya escaneados correctamente
EasyOCRMás robusto con documentos escaneados de baja calidad y escritura no estándar, GPU opcional mediante use_gpuArchivos, formularios, corpus heterogéneos
RapidOCRAcepta modelos personalizadosNecesidades específicas (idioma poco común, ámbito especializado)
OcrMacUtiliza el motor nativo de macOS, sin dependencias adicionalesEstación de trabajo Mac, volúmenes pequeños

#La segmentación que sigue la estructura

Un punto que la mayoría de las guías de RAG local no explican: Docling no se limita a convertir, sino que también propone una segmentación adaptada a lo que acaba de reconstruir. Su HybridChunker parte de la jerarquía del documento (títulos, secciones) y luego ajusta el tamaño de cada fragmento según el tokenizer real del modelo de embeddings elegido: los bloques demasiado largos se dividen respetando los límites de los elementos en lugar de cortar una frase por la mitad, y los bloques demasiado cortos que comparten el mismo título se fusionan. El tokenizer proporcionado debe estar alineado con el del modelo de embeddings utilizado posteriormente; de lo contrario, el tamaño real de los fragmentos (en tokens) deja de corresponder a lo que espera el índice vectorial. Se trata de una segmentación basada en la estructura, que puede compararse con una segmentación por bloques de caracteres que no tiene en cuenta los límites de las frases: ver nuestra guía sobre estrategias de chunking para conocer las ventajas y los inconvenientes de ambos enfoques.

#El coste computacional

Orden de magnitud según la configuración
ConfiguraciónVelocidad de procesamientoCuándo basta
Procesador solo, sin OCREl más lento: unos segundos por página complejaCorpus pequeños, conversiones puntuales
Solo procesador, con OCRMás lento aún, el OCR dominaAlgunos documentos escaneados
Con GPUMucho más rápido en el análisis de páginas y tablas y en el OCR con EasyOCRMiles de páginas, ingestión repetida

La consecuencia práctica: se convierte por lotes, una sola vez, y se conserva el resultado. Reindexar solo tiene sentido si cambia la fuente. Y en una máquina que también sirve un modelo de lenguaje, ambos compiten por la misma GPU mediante las opciones de aceleración del pipeline: ingerir un corpus mientras los usuarios hacen preguntas ralentiza ambos procesos.

#Su lugar en la cadena

  1. 01
    Convertir
    Docling convierte tus archivos en markdown o JSON estructurado, con las tablas intactas.
  2. 02
    Dividir en fragmentos
    Con HybridChunker, siguiendo la estructura recuperada y el tokenizer del modelo de embeddings, en lugar de dividir el texto cada mil caracteres. Aquí es donde se vuelve a sacar provecho del conversor.
  3. 03
    Codificar y almacenar
    Un modelo de embedding local convierte fragmentos en vectores, almacenados en una base vectorial como Qdrant.
  4. 04
    Responder
    Un modelo local redacta a partir de los pasajes recuperados, mediante Ollama o un servidor de inferencia local.

#Dónde sigue habiendo dificultades

Los documentos escaneados de mala calidad
La precisión del OCR en una fotocopia torcida es una limitación física, no del software.
Las maquetaciones con muchos elementos gráficos
Revistas, texto que rodea una figura, formularios: difíciles para todos los convertidores.
Escritura manuscrita
Fuera del alcance de esta categoría de herramientas.
Gráficos complejos
La comprensión de gráficos cubre los casos habituales (gráficos circulares, de barras y de líneas); un gráfico muy específico —un mapa, un diagrama técnico o un esquema de arquitectura— puede todavía reproducirse únicamente mediante su leyenda, sin los valores subyacentes.
Costo de entrada
Instalar los modelos de maquetación, tablas y OCR supone descargar varios gigabytes en el primer inicio; en una máquina aislada sin acceso a la red, hay que descargarlos previamente.

#FAQ

¿Es Docling gratuito?+
Sí: es un proyecto de código abierto publicado por IBM Research en julio de 2024 con licencia MIT y actualmente alojado por la LF AI & Data Foundation. La licencia permite el uso comercial sin pagar regalías ni tener la obligación de volver a publicar tu propio código. La herramienta se ejecuta localmente, sin clave de API ni cargos por página o documento convertido.
¿Se necesita una GPU?+
No, Docling funciona con el procesador. Pero su análisis de la disposición de la página, el reconocimiento de tablas y el motor EasyOCR se basan en modelos que pueden ejecutarse en la GPU mediante accelerator_options: una GPU reduce considerablemente el tiempo de conversión de un corpus grande. Para unas decenas de documentos, el procesador es más que suficiente.
¿Sabe leer PDF escaneados?+
Sí, a través de uno de sus motores de OCR (EasyOCR, Tesseract, RapidOCR o OcrMac según la plataforma), que debe activarse para documentos sin capa de texto. La calidad depende entonces del escaneo: un documento nítido a 300 puntos por pulgada se reconoce bien; una fotocopia torcida, mucho peor.
¿Qué diferencia hay entre los modos FAST y ACCURATE de TableFormer?+
FAST prioriza la velocidad y es adecuado para tablas simples con una sola fila de encabezado. ACCURATE es más lento, pero se recomienda en cuanto el documento contiene celdas fusionadas o encabezados en varios niveles, lo cual es frecuente en informes financieros o fichas técnicas.
¿Docling o un simple extractor de texto?+
Un extractor simple es más rápido y adecuado para texto limpio en una sola columna. Docling se justifica en diseños complejos, tablas y corpus heterogéneos que mezclan PDF, Office y documentos escaneados; es decir, en la mayoría de los documentos reales de empresa.
¿Docling se integra con LangChain o LlamaIndex?+
Sí, el proyecto ofrece integraciones listas para usar con LangChain, LlamaIndex, Crew AI y Haystack. En concreto, esto evita que tengas que escribir tú mismo el conector entre la conversión de documentos y el resto del pipeline de RAG: el documento convertido por Docling llega directamente en el formato esperado por el cargador de documentos de estos frameworks, listo para dividirse en fragmentos y luego indexarse.
¿Salen los datos de mi máquina?+
No, la conversión es completamente local una vez descargados los modelos de análisis de la estructura de página, reconocimiento de tablas y OCR: no se necesita ninguna llamada de red durante el procesamiento de un documento. Esa es precisamente la ventaja para los documentos confidenciales —contratos, historiales médicos o documentos contables— que deben permanecer en tu ordenador o en un servidor que controlas, sin pasar por una API de terceros.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.