La guía de referencia · 16 capítulos · scripts incluidos · actualizaciones de por vida
Un RAG local que
realmente funciona bien
El kit RAG Local : La guía de referencia para construir un RAG confiable con tus propios documentos — PDF, notas, correos, bibliografía de Zotero — sin enviar nada a la nube. El RAG que funciona de forma fiable con 300 PDF, no la demo que funciona una de cada tres veces.
Obtener el kit — 24 €24 € · pago único · actualizaciones de por vida incluidas
¿Qué es el kit RAG Local?
El kit RAG Local es una guía de referencia de 16 capítulos (103 páginas) con 20 scripts y plantillas, y un espacio en línea de por vida. Está dirigido a profesionales, investigadores y desarrolladores que se manejan bien con la línea de comandos, en un PC (8-16 GB de VRAM) o un Mac mini M4 de 24 GB. Resultado: un pipeline RAG completo —ingestión, chunking, embeddings en francés, índice, búsqueda híbrida, reranking— medido con un protocolo de recall@k, no solo probado con tres ejemplos.
- 16 capítulos (103 páginas) y 20 scripts, plantillas y comparativas para descargar.
- 2 perfiles cubiertos: PC 8-16 GB de VRAM, o Mac mini M4 24 GB.
- Bases vectoriales cubiertas: ChromaDB, Qdrant y LanceDB, a elegir.
- Comparación de embeddings en francés: bge-m3 y nomic-embed-text-v2-moe.
- Protocolo de medición de recall@k en un conjunto de 30 a 50 preguntas.
- 24 € en un pago único, actualizaciones de por vida incluidas y garantía de satisfacción o devolución del dinero durante 30 días.
✓ Para ti si…
eres profesional, investigador o desarrollador, te manejas bien con la línea de comandos (Python es útil para la mayoría de los capítulos, pero no es obligatorio), ya utilizas IA local (Ollama/LM Studio, quizá el kit de IA Local) y quieres un RAG que vaya más allá de pulsar un botón para trabajar con decenas o cientos de documentos: contratos, bibliografía de Zotero, correspondencia, wiki interna.
✗ No es para ti si…
solo quieres hacer una pregunta sobre tres PDF de vez en cuando (eso ya lo cubre el kit IA Local, capítulo 8); buscas RAG documental para alimentar un copiloto de código (eso corresponde al kit Copiloto Local); o lo despliegas para varios usuarios en una empresa con restricciones del RGPD (el kit IA Local en Empresa).
¿Por qué puedes confiar en ello?
Esta guía está escrita y mantenida por el equipo de QuelLLM.fr — 250 modelos indexados, 335 guías en francés, actualizados cada mañana — que también opera plataformas de IA en producción todo el año (RegulIA, IAPRO). Cada comando, modelo y licencia de esta guía se verifica con la fuente oficial en la fecha de edición (y se vuelve a verificar en cada edición), en las configuraciones de máquinas que nosotros mismos utilizamos (PC con 8-16 GB de VRAM, Mac mini M4 con 24 GB); todos los scripts del paquete compilan y se revisan uno a uno. Lo que lees está condensado, verificado y va al grano. No es una recopilación de tutoriales encontrados al azar. ¿Quién está detrás de QuelLLM? →
El problema
Ya tienes un asistente de IA local, quizá incluso un RAG que funciona con unos clics (AnythingLLM, Open WebUI). Arrastras un PDF, haces una pregunta y te responde; hasta que un día responde algo que no viene al caso o, peor aún, inventa una cita que no existe en el documento. Con 300 PDF, una biblioteca entera de Zotero o años de correspondencia, ese sistema de unos pocos clics deja de ser suficiente: una fragmentación ingenua, ninguna cita verificable y, sobre todo nunca se mide nada — confías en él basándote en tres ejemplos, no en un protocolo.
La información básica ya está disponible gratis en el sitio, repartida entre 7 guías (ChromaDB, chunking, búsqueda híbrida BM25, Zotero, embeddings en francés, reranking, LlamaIndex). El kit es EL método de referencia: el pipeline completo ensamblado y probado — ingestión, chunking medido, embeddings FR, índice escalable, búsqueda híbrida, reranking y un método para verificar que realmente funciona — no una recopilación de tutoriales que tengas que contrastar por tu cuenta.
El RAG ensamblado y medido vs el RAG con un clic de botón vs pegarlo todo en el LLM
La misma necesidad —consultar tus documentos—, tres formas de satisfacerla. Una comparativa honesta:
| RAG ensamblado (este kit) | RAG con un clic | Pegarlo todo en el LLM | |
|---|---|---|---|
| Aguarda en cientos de documentos | Sí | Limitado | No |
| Citas verificables de forma sistemática | Sí, requerida | Raramente confiable | No |
| Búsqueda híbrida (identificadores, nombres propios) | Sí (BM25 + vectorial) | No | No aplicable |
| Calidad medida (recall@k antes/después) | Sí, protocolo proporcionado | No | No |
| Implementación | Varias sesiones, pipeline limpio | Algunos minutos | Inmediato |
| Confidencialidad (100 % local) | Sí | Sí | Según el LLM utilizado |
| Coste | 0 €/mes una vez instalado | 0 €/mes | Contexto costoso más allá de unos pocos documentos |
Hacerlo con un clic sigue siendo la opción adecuada para un uso ocasional con tres documentos (es el kit IA Local, cap. 8). Este kit toma el relevo cuando el corpus, lo que está en juego o la fiabilidad exigida superan lo que se puede lograr con un clic.
Lo que obtienes
- Tu espacio en línea, de por vida — los 16 capítulos disponibles para leer en la web, siempre en su última edición.
- Guía completa en PDF (103 páginas) — el mismo contenido, tuyo para siempre, sin conexión.
- 20 archivos listos para usar (scripts, plantillas, comparativas) — cambio de OCR a visión, pipeline de Zotero con citas, análisis de archivos mbox, 3 estrategias de chunking, comparativas de embeddings y bases vectoriales, búsqueda híbrida RRF, incorporación de un reranker, pipelines de LlamaIndex y agente de LangChain, script de medición de recall@k, árbol de resolución de problemas.
- 2 perfiles de referencia — PC con 8-16 GB de VRAM, Mac mini M4 con 24 GB: en cada ejemplo encuentras tu configuración, nunca un caso que no se aplique a ti.
- Protocolo de medición (Cap. 14) — construir un conjunto de 30-50 preguntas, medir un recall@k antes/después de un cambio, detectar una alucinación sin cita válida siguiendo un protocolo real, no basándose en una impresión.
- Edición en actualización continua — cada actualización (nuevos embedders, bases vectoriales, frameworks) aparece en tu espacio, de por vida, sin tener que volver a pagar nada.
Herramientas: ChromaDB, Qdrant, LanceDB, LlamaIndex, LangChain, Open WebUI Knowledge, AnythingLLM. Embeddings: bge-m3, nomic-embed-text-v2-moe. 100 % local, 0 €/mes una vez instalado.
Los 16 capítulos del kit
103 páginas, desde las bases del pipeline hasta un RAG medido y hecho fiable. No hay nada que saltarse: cada capítulo remite a los siguientes.
- Tu RAG actual miente (o por qué existe este kit)
- Anatomía de un pipeline RAG que funciona
- Elegir tu stack: script, framework o interfaz avanzada
- OCR, limpieza, deduplicación: ingerir lo que realmente tenemos
- Zotero: conectar tu bibliografía con un RAG que realmente cite
- Correos y correspondencia: un corpus que solemos olvidar incorporar al RAG
- Chunking: las 5 estrategias y cómo medir cuál gana
- Embeddings multilingües FR: ¿cuál elegir y cómo verificar?
- Índice vectorial local: ChromaDB, Qdrant, LanceDB — ¿cuál en 2026
- Búsqueda híbrida: cuando la búsqueda puramente vectorial no basta
- Reranking: el cross-encoder que corrige el retrieval
- LlamaIndex y LangChain en local: construir más allá de un script escrito a mano
- Open WebUI Knowledge y AnythingLLM en uso avanzado
- Evaluar tu RAG: conjunto de preguntas, citas, alucinaciones
- Costo, velocidad, resolución de problemas por máquina
- RAG en funcionamiento — y lo que sigue
Edición en constante actualización: cada actualización amplía este índice (registro de actualizaciones con fechas, cap. 16): no tendrás que volver a comprar nada cuando salga la próxima versión.
Trois resultados rápidos incluso antes de abrir un terminal
El Capítulo 1 no se limita a establecer el contexto: te da tres mejoras medibles en tu instalación actual, cada una en menos de 30 minutos.
1 · Revisa tu RAG actual
La lista de verificación de 10 puntos detecta en 10 minutos el punto más débil de tu instalación actual (o la ausencia de instalación).
2 · Cambia de embedder con un solo comando
ollama pull bge-m3, cambias el modelo de embeddings en AnythingLLM u Open WebUI y comparas el antes y el después.
3 · Exige una cita verificable
Una cláusula de citación estricta añadida a una pregunta ya planteada — y tú verificas que el pasaje citado exista realmente.
4 · Luego construye el pipeline completo
Ingestión, chunking medido, embeddings FR, índice, híbrido, reranking: las partes 2 a 4 te guían paso a paso.
- El espacio en línea de por vida: 16 capítulos siempre actualizados (índice completo más arriba)
- La guía PDF (103 páginas) + los 20 archivos (scripts, plantillas, comparativas — Zotero, chunking, híbrido, reranking, evaluación…) para descargar
- Los 2 perfiles de referencia (PC 8-16 GB, Mac 24 GB) y el árbol de resolución de problemas de RAG
- Todas las ediciones futuras, de por vida — aparecen en tu espacio
- Acceso inmediato tras el pago, clave de acceso enviada por email
Pago seguro mediante Stripe. Factura PDF enviada automáticamente · IVA no aplicable, art. 293 B del CGI.
La verdad sin adornos
Un RAG local montado y evaluado cubre muy bien tus propios documentos, pero no es la solución para todo. Una guía de referencia debe ofrecerte este panorama sincero:
Al final, tú sabes hacer
- Construir un pipeline RAG completo — ingestión, fragmentación, embeddings en francés, índice, búsqueda híbrida, reordenamiento, generación con citas.
- Conectar Zotero, tu correspondencia por correo electrónico o PDF escaneados a un RAG que cita realmente sus fuentes.
- Elegir chunking, embedder y base vectorial con conocimiento de causa, no por defecto.
- Medir un recall@k antes/después de un cambio, en lugar de creer que «funciona mejor».
- Pasar de un script hecho a mano a un framework (LlamaIndex/LangChain) o aprovechar los ajustes avanzados de AnythingLLM/Open WebUI según tus necesidades.
Edición vivante — como todos los kits QuelLLM
«Actualizaciones de por vida» no es un lema: el kit sigue el ecosistema RAG (embedders, bases vectoriales, frameworks) por ti, sin hacerte pagar nada más.
v2026.09 (edición actual) — primera edición del kit: 16 capítulos, 2 perfiles de referencia (PC con 8-16 GB de VRAM, Mac mini M4 con 24 GB), 20 archivos (scripts, plantillas, comparativas).
Las próximas ediciones (nuevos embedders, bases vectoriales, frameworks) se añaden aquí, con sus fechas, y llegan a tu espacio sin que tengas que volver a pagar nada.
Preguntas frecuentes
¿Cuál es la diferencia con el kit IA Local, que ya tiene un capítulo RAG?
El kit de IA local (Cap. 8) te instala un RAG con un clic en AnythingLLM o Open WebUI: arrastrar un PDF, hacer una pregunta; funciona para un uso ocasional. Este kit comienza donde termina ese capítulo: chunking medido, comparación de embeddings en francés, un índice vectorial que funciona a gran escala, búsqueda híbrida, reranking y, sobre todo, un método para verificar que tu RAG responda correctamente, no solo que responda. Aquí no se vuelve a explicar ningún contenido del Cap. 8, solo los ajustes avanzados y los componentes que faltan en la solución de un clic.
¿Cuál es la diferencia con las 7 guías RAG gratuitas del sitio?
Las guías gratuitas de QuelLLM.fr cubren cada componente por separado (ChromaDB por sí solo, chunking por sí solo, búsqueda híbrida BM25 por sí sola, Zotero por sí solo…). El kit ensambla el pipeline completo en orden (ingestión → chunking → embeddings → índice → búsqueda híbrida → reranking → generación → cita → medición), conecta lo que cada guía por separado no conecta y proporciona los 20 archivos probados (scripts, plantillas, comparativas) que ninguna guía por separado ofrece: lo que se paga es el ensamblaje y los scripts, no la información básica.
¿Se necesita saber programar en Python para seguir este kit?
Python 3.10+ es útil y te sirve para la mayoría de los capítulos (del cap. 4 al cap. 12): los scripts se proporcionan para adaptarlos, no para escribirlos desde cero. El capítulo 13 (Open WebUI Knowledge, AnythingLLM en ajustes avanzados) sigue siendo accesible sin escribir una línea de código. Este kit presupone que te manejas con soltura en la línea de comandos; si empiezas desde cero en IA local, comienza por el kit de IA Local.
¿Cuánto tiempo se necesita para obtener un primer resultado concreto?
El Capítulo 1 ofrece 3 mejoras rápidas que requieren menos de 30 minutos cada una y pueden aplicarse a un RAG ya en funcionamiento (auditoría rápida, cambio de embedder con un solo comando, exigencia de una cita verificable): obtienes una mejora medible incluso antes de abordar el pipeline completo. Construir un pipeline completo sobre tu propio corpus (Partes 2 a 4) requiere varias sesiones, no una hora.
¿En qué máquina funciona?
Dos perfiles de referencia, identificados en cada ejemplo: un PC con entre 8 y 16 GB de VRAM (el modelo de generación recomendado cambia según el extremo del intervalo) o un Mac Apple Silicon con 24 GB de memoria unificada. En un RAG, el cuello de botella casi nunca es la generación, sino la ingestión (OCR, embeddings) y el tamaño del índice; los dos perfiles cubren la mayor parte de las configuraciones profesionales y de desarrollo reales.
¿Mis documentos siguen siendo confidenciales?
Ese es precisamente el principio: el pipeline (ingestión, embeddings, índice, generación) funciona completamente en tu máquina y nada se envía a terceros. El Capítulo 15 aborda específicamente lo que esto cambia para un corpus de correos o documentos sensibles. Para un despliegue multiusuario en una empresa (RGPD, AI Act, arquitectura de servidor), el kit adecuado es IA Local en Empresa (quelllm.fr/kit-ia-entreprise), no este.
¿El kit cubre los agentes o la automatización?
El Capítulo 12 muestra el RAG utilizado como herramienta por un agente mínimo (un agente, dos herramientas): justo lo suficiente para entender el principio, con una referencia explícita al kit de Agentes Locales (quelllm.fr/kit-agents-locaux) para la orquestación de múltiples pasos, MCP o n8n. Ese no es el tema de este kit.
¿Y si no me convence después de la compra?
Si no estás satisfecho, te devolvemos el dinero durante 30 días; basta un correo electrónico, sin necesidad de justificarlo — como en todos los kits de QuelLLM.
¿Cómo se entrega y por cuánto tiempo?
Acceso inmediato tras el pago: tu espacio en línea de por vida (siempre con la última edición) + el PDF y el zip de los 20 archivos para descargar, que serán tuyos para siempre. Las futuras actualizaciones (nuevos embedders, nuevas bases vectoriales, frameworks que evolucionan) aparecen en tu espacio sin que tengas que volver a pagar nada.
¿Puedo obtener una factura?
Sí, automáticamente. En cuanto se realiza el pago (Stripe), recibes por correo electrónico tu recibo de Stripe y tu factura PDF a nombre de Falcon Consulting (editor de QuelLLM), con tus datos — indica tu empresa o tu SIREN en el campo correspondiente en el momento del pago. IVA no aplicable, art. 293 B del CGI.
¿El kit sigue actualizado? Las bases vectoriales y los frameworks RAG evolucionan rápidamente.
Ese es el principio de las actualizaciones de por vida: cuando un embedder cambia de estado, una base de datos vectorial madura o un framework rompe la compatibilidad, la edición se actualiza en consecuencia, como ocurre con los otros kits QuelLLM. El capítulo 16 también explica cómo comprobar por ti mismo si un dato citado sigue vigente entre dos ediciones.
¿Y si quiero varios kits de QuelLLM?
El paquete «todos los kits, de por vida» agrupa todos los kits actuales y futuros por 49 €. Si ya has comprado un kit por 24 €, la actualización al paquete te cuesta 25 €, no 49 € — el cupón se aplica automáticamente.
¿Qué es exactamente el RAG?
RAG (generación aumentada por recuperación) significa que un LLM buscará la información en tus propios documentos antes de responder, en lugar de responder solo con lo que aprendió durante su entrenamiento —con, en principio, una cita verificable de la fuente. El kit RAG Local construye este pipeline completo, medido, a partir de tus PDF, tu bibliografía o tus correos.
¿Cómo conectar Ollama a un RAG?
Ollama sirve como motor de generación (y a menudo también de embeddings) en un pipeline RAG: una herramienta con interfaz de botones como AnythingLLM o Open WebUI Knowledge se conecta directamente a él para un uso ocasional. Para un pipeline que funciona con cientos de documentos, el kit RAG Local muestra cómo conectar Ollama a ChromaDB o Qdrant, con un script probado en lugar de depender solo de una interfaz.
¿Qué LLM elegir para un RAG local?
La elección importa menos que el flujo de procesamiento que lo rodea: un modelo generalista que tu máquina pueda ejecutar basta para la generación, siempre que la recuperación previa (chunking, embeddings, búsqueda híbrida, reranking) le proporcione los fragmentos adecuados para leer. El kit RAG Local detalla esta cadena completa, no solo la elección del modelo final.
Construye un RAG fiable.
La guía de referencia, desde el primer PDF incorporado hasta un RAG medido y fiable que abarque toda tu biblioteca — sin enviar nada a la nube. Hoy, no «algún día».
Obtener el kit — 24 €