La guía de referencia · 16 capítulos · scripts incluidos · actualizaciones de por vida

Un RAG local que
realmente funciona bien

El kit RAG Local : La guía de referencia para construir un RAG confiable con tus propios documentos — PDF, notas, correos, bibliografía de Zotero — sin enviar nada a la nube. El RAG que funciona de forma fiable con 300 PDF, no la demo que funciona una de cada tres veces.

Obtener el kit — 24 €

24 € · pago único · actualizaciones de por vida incluidas

✓ Acceso inmediato (en línea + PDF) ✓ Pago seguro con Stripe ✓ Garantía de reembolso de 30 días ✓ Edición en constante actualización (actualizaciones de por vida)

Ver los 16 capítulos →

¿Qué es el kit RAG Local?

El kit RAG Local es una guía de referencia de 16 capítulos (103 páginas) con 20 scripts y plantillas, y un espacio en línea de por vida. Está dirigido a profesionales, investigadores y desarrolladores que se manejan bien con la línea de comandos, en un PC (8-16 GB de VRAM) o un Mac mini M4 de 24 GB. Resultado: un pipeline RAG completo —ingestión, chunking, embeddings en francés, índice, búsqueda híbrida, reranking— medido con un protocolo de recall@k, no solo probado con tres ejemplos.

  • 16 capítulos (103 páginas) y 20 scripts, plantillas y comparativas para descargar.
  • 2 perfiles cubiertos: PC 8-16 GB de VRAM, o Mac mini M4 24 GB.
  • Bases vectoriales cubiertas: ChromaDB, Qdrant y LanceDB, a elegir.
  • Comparación de embeddings en francés: bge-m3 y nomic-embed-text-v2-moe.
  • Protocolo de medición de recall@k en un conjunto de 30 a 50 preguntas.
  • 24 € en un pago único, actualizaciones de por vida incluidas y garantía de satisfacción o devolución del dinero durante 30 días.
Portada del kit RAG Local — RAG Local

✓ Para ti si…

eres profesional, investigador o desarrollador, te manejas bien con la línea de comandos (Python es útil para la mayoría de los capítulos, pero no es obligatorio), ya utilizas IA local (Ollama/LM Studio, quizá el kit de IA Local) y quieres un RAG que vaya más allá de pulsar un botón para trabajar con decenas o cientos de documentos: contratos, bibliografía de Zotero, correspondencia, wiki interna.

✗ No es para ti si…

solo quieres hacer una pregunta sobre tres PDF de vez en cuando (eso ya lo cubre el kit IA Local, capítulo 8); buscas RAG documental para alimentar un copiloto de código (eso corresponde al kit Copiloto Local); o lo despliegas para varios usuarios en una empresa con restricciones del RGPD (el kit IA Local en Empresa).

24 € Pago único · actualizaciones de por vida incluidas Garantía de 30 días — si no te convence, te devolvemos el dinero con un solo correo 7 guías RAG dispersas en el sitio + horas de ensamblaje. Este kit: 24 €, el pipeline ya ensamblado y probado.

¿Por qué puedes confiar en ello?

Esta guía está escrita y mantenida por el equipo de QuelLLM.fr — 250 modelos indexados, 335 guías en francés, actualizados cada mañana — que también opera plataformas de IA en producción todo el año (RegulIA, IAPRO). Cada comando, modelo y licencia de esta guía se verifica con la fuente oficial en la fecha de edición (y se vuelve a verificar en cada edición), en las configuraciones de máquinas que nosotros mismos utilizamos (PC con 8-16 GB de VRAM, Mac mini M4 con 24 GB); todos los scripts del paquete compilan y se revisan uno a uno. Lo que lees está condensado, verificado y va al grano. No es una recopilación de tutoriales encontrados al azar. ¿Quién está detrás de QuelLLM? →

El problema

Ya tienes un asistente de IA local, quizá incluso un RAG que funciona con unos clics (AnythingLLM, Open WebUI). Arrastras un PDF, haces una pregunta y te responde; hasta que un día responde algo que no viene al caso o, peor aún, inventa una cita que no existe en el documento. Con 300 PDF, una biblioteca entera de Zotero o años de correspondencia, ese sistema de unos pocos clics deja de ser suficiente: una fragmentación ingenua, ninguna cita verificable y, sobre todo nunca se mide nada — confías en él basándote en tres ejemplos, no en un protocolo.

La información básica ya está disponible gratis en el sitio, repartida entre 7 guías (ChromaDB, chunking, búsqueda híbrida BM25, Zotero, embeddings en francés, reranking, LlamaIndex). El kit es EL método de referencia: el pipeline completo ensamblado y probado — ingestión, chunking medido, embeddings FR, índice escalable, búsqueda híbrida, reranking y un método para verificar que realmente funciona — no una recopilación de tutoriales que tengas que contrastar por tu cuenta.

El RAG ensamblado y medido vs el RAG con un clic de botón vs pegarlo todo en el LLM

La misma necesidad —consultar tus documentos—, tres formas de satisfacerla. Una comparativa honesta:

RAG ensamblado (este kit)RAG con un clicPegarlo todo en el LLM
Aguarda en cientos de documentosSíLimitadoNo
Citas verificables de forma sistemáticaSí, requeridaRaramente confiableNo
Búsqueda híbrida (identificadores, nombres propios)Sí (BM25 + vectorial)NoNo aplicable
Calidad medida (recall@k antes/después)Sí, protocolo proporcionadoNoNo
ImplementaciónVarias sesiones, pipeline limpioAlgunos minutosInmediato
Confidencialidad (100 % local)SíSíSegún el LLM utilizado
Coste0 €/mes una vez instalado0 €/mesContexto costoso más allá de unos pocos documentos

Hacerlo con un clic sigue siendo la opción adecuada para un uso ocasional con tres documentos (es el kit IA Local, cap. 8). Este kit toma el relevo cuando el corpus, lo que está en juego o la fiabilidad exigida superan lo que se puede lograr con un clic.

Lo que obtienes

Herramientas: ChromaDB, Qdrant, LanceDB, LlamaIndex, LangChain, Open WebUI Knowledge, AnythingLLM. Embeddings: bge-m3, nomic-embed-text-v2-moe. 100 % local, 0 €/mes una vez instalado.

Los 16 capítulos del kit

103 páginas, desde las bases del pipeline hasta un RAG medido y hecho fiable. No hay nada que saltarse: cada capítulo remite a los siguientes.

Parte 1 — Fundamentos de un RAG que funciona
  • Tu RAG actual miente (o por qué existe este kit)
  • Anatomía de un pipeline RAG que funciona
  • Elegir tu stack: script, framework o interfaz avanzada
Parte 2 — Ingestión: más allá del PDF elegante
  • OCR, limpieza, deduplicación: ingerir lo que realmente tenemos
  • Zotero: conectar tu bibliografía con un RAG que realmente cite
  • Correos y correspondencia: un corpus que solemos olvidar incorporar al RAG
  • Chunking: las 5 estrategias y cómo medir cuál gana
Parte 3 — El motor: embeddings, índice, recuperación
  • Embeddings multilingües FR: ¿cuál elegir y cómo verificar?
  • Índice vectorial local: ChromaDB, Qdrant, LanceDB — ¿cuál en 2026
  • Búsqueda híbrida: cuando la búsqueda puramente vectorial no basta
  • Reranking: el cross-encoder que corrige el retrieval
Parte 4 — Orquestar, medir, hacer más fiable
  • LlamaIndex y LangChain en local: construir más allá de un script escrito a mano
  • Open WebUI Knowledge y AnythingLLM en uso avanzado
  • Evaluar tu RAG: conjunto de preguntas, citas, alucinaciones
  • Costo, velocidad, resolución de problemas por máquina
  • RAG en funcionamiento — y lo que sigue

Edición en constante actualización: cada actualización amplía este índice (registro de actualizaciones con fechas, cap. 16): no tendrás que volver a comprar nada cuando salga la próxima versión.

Trois resultados rápidos incluso antes de abrir un terminal

El Capítulo 1 no se limita a establecer el contexto: te da tres mejoras medibles en tu instalación actual, cada una en menos de 30 minutos.

1 · Revisa tu RAG actual

La lista de verificación de 10 puntos detecta en 10 minutos el punto más débil de tu instalación actual (o la ausencia de instalación).

2 · Cambia de embedder con un solo comando

ollama pull bge-m3, cambias el modelo de embeddings en AnythingLLM u Open WebUI y comparas el antes y el después.

3 · Exige una cita verificable

Una cláusula de citación estricta añadida a una pregunta ya planteada — y tú verificas que el pasaje citado exista realmente.

4 · Luego construye el pipeline completo

Ingestión, chunking medido, embeddings FR, índice, híbrido, reranking: las partes 2 a 4 te guían paso a paso.

24 €
Pago único · actualizaciones de por vida incluidas
7 guías RAG dispersas en el sitio, horas de ensamblaje y pruebas. Este kit: 24 € una sola vez, pipeline ya ensamblado.
Garantía de satisfacción o reembolso de 30 días — basta con un correo electrónico.
  • El espacio en línea de por vida: 16 capítulos siempre actualizados (índice completo más arriba)
  • La guía PDF (103 páginas) + los 20 archivos (scripts, plantillas, comparativas — Zotero, chunking, híbrido, reranking, evaluación…) para descargar
  • Los 2 perfiles de referencia (PC 8-16 GB, Mac 24 GB) y el árbol de resolución de problemas de RAG
  • Todas las ediciones futuras, de por vida — aparecen en tu espacio
  • Acceso inmediato tras el pago, clave de acceso enviada por email
Me llevo el kit — 24 €

Pago seguro mediante Stripe. Factura PDF enviada automáticamente · IVA no aplicable, art. 293 B del CGI.

Me llevo el kit — 24 €

La verdad sin adornos

Un RAG local montado y evaluado cubre muy bien tus propios documentos, pero no es la solución para todo. Una guía de referencia debe ofrecerte este panorama sincero:

Este kit ganaconfidencialidad total · cita verificable · funciona con cientos de documentos · calidad medida, no supuesta · 0 €/mes una vez montado
Las soluciones de un solo clic o la nube mantienen la ventajauso ocasional con 2-3 documentos · puesta en marcha inmediata sin scripts · despliegue multiusuario en una empresa · orquestación de agentes de varias etapas

Al final, tú sabes hacer

Edición vivante — como todos los kits QuelLLM

«Actualizaciones de por vida» no es un lema: el kit sigue el ecosistema RAG (embedders, bases vectoriales, frameworks) por ti, sin hacerte pagar nada más.

CHANGELOG.md — incluido en el pack

v2026.09 (edición actual) — primera edición del kit: 16 capítulos, 2 perfiles de referencia (PC con 8-16 GB de VRAM, Mac mini M4 con 24 GB), 20 archivos (scripts, plantillas, comparativas).

Las próximas ediciones (nuevos embedders, bases vectoriales, frameworks) se añaden aquí, con sus fechas, y llegan a tu espacio sin que tengas que volver a pagar nada.

Preguntas frecuentes

¿Cuál es la diferencia con el kit IA Local, que ya tiene un capítulo RAG?

El kit de IA local (Cap. 8) te instala un RAG con un clic en AnythingLLM o Open WebUI: arrastrar un PDF, hacer una pregunta; funciona para un uso ocasional. Este kit comienza donde termina ese capítulo: chunking medido, comparación de embeddings en francés, un índice vectorial que funciona a gran escala, búsqueda híbrida, reranking y, sobre todo, un método para verificar que tu RAG responda correctamente, no solo que responda. Aquí no se vuelve a explicar ningún contenido del Cap. 8, solo los ajustes avanzados y los componentes que faltan en la solución de un clic.

¿Cuál es la diferencia con las 7 guías RAG gratuitas del sitio?

Las guías gratuitas de QuelLLM.fr cubren cada componente por separado (ChromaDB por sí solo, chunking por sí solo, búsqueda híbrida BM25 por sí sola, Zotero por sí solo…). El kit ensambla el pipeline completo en orden (ingestión → chunking → embeddings → índice → búsqueda híbrida → reranking → generación → cita → medición), conecta lo que cada guía por separado no conecta y proporciona los 20 archivos probados (scripts, plantillas, comparativas) que ninguna guía por separado ofrece: lo que se paga es el ensamblaje y los scripts, no la información básica.

¿Se necesita saber programar en Python para seguir este kit?

Python 3.10+ es útil y te sirve para la mayoría de los capítulos (del cap. 4 al cap. 12): los scripts se proporcionan para adaptarlos, no para escribirlos desde cero. El capítulo 13 (Open WebUI Knowledge, AnythingLLM en ajustes avanzados) sigue siendo accesible sin escribir una línea de código. Este kit presupone que te manejas con soltura en la línea de comandos; si empiezas desde cero en IA local, comienza por el kit de IA Local.

¿Cuánto tiempo se necesita para obtener un primer resultado concreto?

El Capítulo 1 ofrece 3 mejoras rápidas que requieren menos de 30 minutos cada una y pueden aplicarse a un RAG ya en funcionamiento (auditoría rápida, cambio de embedder con un solo comando, exigencia de una cita verificable): obtienes una mejora medible incluso antes de abordar el pipeline completo. Construir un pipeline completo sobre tu propio corpus (Partes 2 a 4) requiere varias sesiones, no una hora.

¿En qué máquina funciona?

Dos perfiles de referencia, identificados en cada ejemplo: un PC con entre 8 y 16 GB de VRAM (el modelo de generación recomendado cambia según el extremo del intervalo) o un Mac Apple Silicon con 24 GB de memoria unificada. En un RAG, el cuello de botella casi nunca es la generación, sino la ingestión (OCR, embeddings) y el tamaño del índice; los dos perfiles cubren la mayor parte de las configuraciones profesionales y de desarrollo reales.

¿Mis documentos siguen siendo confidenciales?

Ese es precisamente el principio: el pipeline (ingestión, embeddings, índice, generación) funciona completamente en tu máquina y nada se envía a terceros. El Capítulo 15 aborda específicamente lo que esto cambia para un corpus de correos o documentos sensibles. Para un despliegue multiusuario en una empresa (RGPD, AI Act, arquitectura de servidor), el kit adecuado es IA Local en Empresa (quelllm.fr/kit-ia-entreprise), no este.

¿El kit cubre los agentes o la automatización?

El Capítulo 12 muestra el RAG utilizado como herramienta por un agente mínimo (un agente, dos herramientas): justo lo suficiente para entender el principio, con una referencia explícita al kit de Agentes Locales (quelllm.fr/kit-agents-locaux) para la orquestación de múltiples pasos, MCP o n8n. Ese no es el tema de este kit.

¿Y si no me convence después de la compra?

Si no estás satisfecho, te devolvemos el dinero durante 30 días; basta un correo electrónico, sin necesidad de justificarlo — como en todos los kits de QuelLLM.

¿Cómo se entrega y por cuánto tiempo?

Acceso inmediato tras el pago: tu espacio en línea de por vida (siempre con la última edición) + el PDF y el zip de los 20 archivos para descargar, que serán tuyos para siempre. Las futuras actualizaciones (nuevos embedders, nuevas bases vectoriales, frameworks que evolucionan) aparecen en tu espacio sin que tengas que volver a pagar nada.

¿Puedo obtener una factura?

Sí, automáticamente. En cuanto se realiza el pago (Stripe), recibes por correo electrónico tu recibo de Stripe y tu factura PDF a nombre de Falcon Consulting (editor de QuelLLM), con tus datos — indica tu empresa o tu SIREN en el campo correspondiente en el momento del pago. IVA no aplicable, art. 293 B del CGI.

¿El kit sigue actualizado? Las bases vectoriales y los frameworks RAG evolucionan rápidamente.

Ese es el principio de las actualizaciones de por vida: cuando un embedder cambia de estado, una base de datos vectorial madura o un framework rompe la compatibilidad, la edición se actualiza en consecuencia, como ocurre con los otros kits QuelLLM. El capítulo 16 también explica cómo comprobar por ti mismo si un dato citado sigue vigente entre dos ediciones.

¿Y si quiero varios kits de QuelLLM?

El paquete «todos los kits, de por vida» agrupa todos los kits actuales y futuros por 49 €. Si ya has comprado un kit por 24 €, la actualización al paquete te cuesta 25 €, no 49 € — el cupón se aplica automáticamente.

¿Qué es exactamente el RAG?

RAG (generación aumentada por recuperación) significa que un LLM buscará la información en tus propios documentos antes de responder, en lugar de responder solo con lo que aprendió durante su entrenamiento —con, en principio, una cita verificable de la fuente. El kit RAG Local construye este pipeline completo, medido, a partir de tus PDF, tu bibliografía o tus correos.

¿Cómo conectar Ollama a un RAG?

Ollama sirve como motor de generación (y a menudo también de embeddings) en un pipeline RAG: una herramienta con interfaz de botones como AnythingLLM o Open WebUI Knowledge se conecta directamente a él para un uso ocasional. Para un pipeline que funciona con cientos de documentos, el kit RAG Local muestra cómo conectar Ollama a ChromaDB o Qdrant, con un script probado en lugar de depender solo de una interfaz.

¿Qué LLM elegir para un RAG local?

La elección importa menos que el flujo de procesamiento que lo rodea: un modelo generalista que tu máquina pueda ejecutar basta para la generación, siempre que la recuperación previa (chunking, embeddings, búsqueda híbrida, reranking) le proporcione los fragmentos adecuados para leer. El kit RAG Local detalla esta cadena completa, no solo la elección del modelo final.

Construye un RAG fiable.

La guía de referencia, desde el primer PDF incorporado hasta un RAG medido y fiable que abarque toda tu biblioteca — sin enviar nada a la nube. Hoy, no «algún día».

Obtener el kit — 24 €