Obsidian + LLM local: Copilot y Smart Connections con Ollama
Obsidian almacena tus notas en Markdown, en texto claro, en tu disco. Es el entorno ideal para un asistente de IA, siempre que no envíe todo tu vault a la nube. Esta guía conecta un LLM local mediante la combinación obsidian + ollama: configuración del plugin Copilot, chat con todas tus notas, búsqueda semántica con Smart Connections y todo ello con embeddings que permanecen en tu máquina.
#¿Por qué conectar un LLM local con Obsidian?
Una bóveda de Obsidian suele contener lo más personal que tenemos: un diario, notas de reuniones, investigación y borradores. Enviar este corpus a un servicio en la nube para «hablar con tus notas» equivale a confiar la totalidad de tu segunda memoria a un tercero. Un LLM local resuelve el problema de raíz: el modelo, los embeddings y el índice permanecen en tu disco.
En concreto, obsidian + ollama permite tres usos: generar y reformular texto directamente en el editor (autocompletado, resumen, traducción), consultar todo el vault en lenguaje natural («¿qué he anotado sobre el proyecto X?») y mostrar automáticamente las notas semánticamente próximas a la que estás escribiendo. Dos plugins cubren estas necesidades: Copilot para el chat y la generación, Smart Connections para la búsqueda por similitud.
- Confidencialidad
- Ninguna nota ni ningún embedding sale de la máquina. Ideal para un diario o datos de clientes.
- Sin conexión
- Funciona en tren o en avión, una vez descargados los modelos.
- Costo nulo
- Sin suscripción ni facturación por consulta, independientemente del volumen de notas.
- Control del modelo
- Tú eliges el tamaño, la cuantización y el contexto según tu hardware.
#Prerrequisitos
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
La configuración se basa en tres componentes: Obsidian, Ollama como daemon local y un plugin comunitario. No hace falta nada más: ni clave API ni cuenta.
- Obsidian 1.5+
- Versión de escritorio (Windows, macOS o Linux). Los plugins comunitarios no funcionan de la misma manera en móviles; esta guía está orientada a la versión de escritorio.
- Ollama instalado
- El servicio en segundo plano escucha por defecto en http://localhost:11434. Si aún no está instalado, consultar la guía de instalación de Ollama indicada al final del artículo.
- Un modelo de chat
- Por ejemplo, qwen3.5:9b con cuantización Q4_K_M (≈6,6 GB de VRAM), la opción de referencia para 8 GB en 2026 (256k de contexto, visión).
- Un modelo de embeddings
- nomic-embed-text o mxbai-embed-large, indispensables para el chat sobre la bóveda y para Smart Connections.
- RAM/VRAM
- 8 GB de VRAM son suficientes para un modelo moderno de 9B (Qwen 3.5 9B, ≈6,6 GB). Si usas solo la CPU, piensa más bien en un modelo de 2-3B (Qwen 3.5 2B o Granite 4.2 3B) y un poco de paciencia.
#Preparar Ollama para Obsidian
Antes de tocar Obsidian, se descargan los modelos y se verifica que el daemon responda. Ollama expone una API compatible con OpenAI en el puerto 11434, que los plugins pueden utilizar.
Un punto específico de Obsidian: los plugins funcionan en un contexto de tipo navegador (Electron), y las solicitudes hacia Ollama pueden ser bloqueadas por la política CORS. Es necesario, por tanto, autorizar a Obsidian para llamar a la API. Se define la variable de entorno OLLAMA_ORIGINS antes de lanzar el daemon.
#Configurar el plugin Copilot para usar Ollama
Copilot (por logancyang) es el plugin de chat y generación más completo para conectar un modelo local. También maneja tanto la reformulación en el editor como el chat conversacional y el modo «Vault QA». Aquí tienes los pasos de instalación.
- 01Instalar el pluginAjustes → Módulos complementarios de terceros → Explorar, buscar «Copilot» (logancyang), instalar y luego activar. Acepta primero el uso de plugins comunitarios si Obsidian te lo pide.
- 02Abrir los ajustes de CopilotEn Configuración → Copilot, sección «Model». Copilot ofrece proveedores predeterminados; selecciona Ollama como proveedor para el chat.
- 03Introducir la URL y el modeloURL base: http://localhost:11434. Nombre del modelo de chat: qwen3.5:9b (exactamente la etiqueta que muestra ollama list). Deja la clave API vacía, no es necesaria localmente.
- 04Configurar los embeddingsEn la sección «Embedding Model», elige de nuevo Ollama como proveedor e introduce nomic-embed-text. Esto hará posible el chat sobre todo el vault.
- 05ProbarAbre el panel Copilot (ícono en la barra lateral o comando «Copilot: Open Chat»), plantea una pregunta sencilla. Una respuesta local confirma que la conexión funciona.
Copilot también añade comandos contextuales: selecciona un fragmento, abre la paleta (Ctrl/Cmd+P) y ejecuta «Copilot: Summarize», «Simplify» o «Translate». El texto seleccionado se envía al modelo local y la respuesta se inserta o se muestra según el comando.
#Chatear con toda tu bóveda en local
El modo más potente de Copilot es el «Vault QA» (también llamado modo QA): en lugar de conversar únicamente con el modelo, consultas tus apuntes. En segundo plano, Copilot construye un índice vectorial de tu vault con el modelo de embeddings, luego encuentra los pasajes relevantes y los incluye en el prompt. Es RAG aplicado a tus apuntes personales.
- 01Activar el modo Vault QAEn el panel de chat Copilot, cambia el selector de modo de «Chat» a «Vault QA» (o «QA»).
- 02Construir el índiceEjecuta el comando « Copilot: Index (refresh) vault for QA ». El plugin recorre tus notas y calcula los embeddings mediante Ollama. El tiempo depende del tamaño del vault y del modelo.
- 03Hacer preguntas transversalesEjemplos: «Resume todo lo que anoté sobre la arquitectura hexagonal» o «¿En qué reuniones se habló del presupuesto Q3?». Las respuestas citan las notas originales.
- 04Reindexar después de grandes cambiosEl índice no es mágico: después de agregar muchas notas, vuelve a indexar para que se tengan en cuenta.
#Smart Connections para encontrar tus notas relacionadas
Smart Connections (de Brian Petro) responde a una necesidad diferente: en lugar de hacer preguntas, muestra continuamente las notas semánticamente próximas a la que estás editando. Es un panel lateral dinámico que muestra conexiones que nunca habrías establecido manualmente: el equivalente a una función automática de «related notes», basada en la similitud vectorial.
- 01Instalar Smart ConnectionsAjustes → Módulos complementarios de terceros → Explorar, buscar «Smart Connections», instalar y activar.
- 02Apuntar los embeddings a OllamaEn los ajustes del plugin, sección embeddings, elige Ollama como adaptador, URL http://localhost:11434 y modelo nomic-embed-text (o mxbai-embed-large para mayor precisión).
- 03Dejar que la indexación se realiceAl iniciarse por primera vez, Smart Connections calcula los embeddings de todas tus notas. El panel «Smart Connections» se va llenando después a medida que navegas.
- 04Opcional: el chat SmartSmart Connections incluye también un modo de chat (Smart Chat) que se basa en estos mismos embeddings y puede utilizar tu modelo de chat de Ollama para responder a partir de las notas similares.
La ventaja de Smart Connections frente a Copilot Vault QA es que funciona de forma pasiva y continua. No tienes que pedir nada: al escribir una nota sobre un tema, las notas antiguas relacionadas aparecen por sí solas, lo que favorece los hallazgos fortuitos en un vault grande. Los dos plugins son complementarios y pueden compartir el mismo modelo de embeddings de Ollama.
#Modelos recomendados según el tamaño de la bóveda
El modelo adecuado depende en primer lugar de tu hardware y luego del volumen de notas. Para la generación de texto, un modelo moderno de 8-9B en Q4_K_M (Qwen 3.5 9B) ofrece el mejor equilibrio calidad/VRAM para la mayoría de las configuraciones. Para los embeddings, nomic-embed-text es ligero y suficiente; mxbai-embed-large gana en precisión en grandes vaults, a costa de un índice más pesado.
- Bóveda pequeña (< 500 notas)
- Chat: qwen3.5:9b (Q4, ≈6,6 GB de VRAM). Embeddings: nomic-embed-text. Cabe en una RTX 3060 de 12 GB.
- Vault medio (500–3000 notas)
- Chat: qwen3.5:9b. Embeddings: mxbai-embed-large para una mejor relevancia de los enlaces. Las RTX 4070/4080 permiten trabajar con comodidad.
- Bóveda grande (> 3000 notas)
- Chat: Qwen 3.8 27B (qwen3.8:27b, ≈18 GB, 262k de contexto) para síntesis más finas. Embeddings: mxbai-embed-large. RTX 4090 24GB o Mac M4 Pro con memoria unificada.
- Sin GPU (solo CPU)
- Chat: un 2-3B (qwen3.5:2b, ≈1,9 GB, o granite4.2:3b muy ligero). Embeddings: nomic-embed-text, que sigue siendo rápido en CPU. Respuestas más lentas pero utilizables.
- Mac Apple Silicon
- La memoria unificada es una ventaja: un M4 Pro de 24 a 48 GB permite ejecutar un Qwen 3.8 27B y indexar embeddings sin problemas.
#Solución de problemas
La mayoría de los problemas se deben a tres causas: CORS, un nombre de modelo incorrecto o el daemon de Ollama detenido. Aquí tienes una comprobación rápida.
- « Conexión fallida » / error de red
- OLLAMA_ORIGINS no incluye Obsidian. Añade app://obsidian.md* y reinicia el daemon (no solo Obsidian).
- « model not found »
- La etiqueta introducida en el plugin no coincide. Revísala con ollama list y copia el nombre exacto, incluyendo la etiqueta (qwen3.5:9b, no qwen3.5).
- Respuestas vacías o truncadas
- Contexto demasiado corto. Aumenta num_ctx mediante un Modelfile o reduce el tamaño de las notas enviadas.
- Indexación muy lenta
- El modelo de embeddings se ejecuta en la CPU o el vault es enorme. Revisa ollama ps; considera nomic-embed-text, que es más ligero.
- Smart Connections vacío
- El índice no ha terminado de construirse, o el adaptador apunta a un modelo de chat en lugar de un modelo de embeddings.
#Para ir más allá
Una vez que Obsidian esté conectado a tu modelo local, estas guías del sitio ayudan a afinar el conjunto de herramientas y a entender los componentes internos:
- Instalar Ollama: Windows, macOS y Linux
- La base de todo el montaje: instalación limpia del daemon y gestión de los modelos.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para encontrar un equilibrio entre la calidad de generación y la VRAM disponible en tu tarjeta.
- AnythingLLM: RAG listo para producción en local
- Si quieres llevar el RAG más allá de Obsidian, con espacios de trabajo y API.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.