Intermedio 11 minObsidian

Obsidian + LLM local: Copilot y Smart Connections con Ollama

Obsidian almacena tus notas en Markdown, en texto claro, en tu disco. Es el entorno ideal para un asistente de IA, siempre que no envíe todo tu vault a la nube. Esta guía conecta un LLM local mediante la combinación obsidian + ollama: configuración del plugin Copilot, chat con todas tus notas, búsqueda semántica con Smart Connections y todo ello con embeddings que permanecen en tu máquina.

Por Léa B.·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué conectar un LLM local con Obsidian?

Una bóveda de Obsidian suele contener lo más personal que tenemos: un diario, notas de reuniones, investigación y borradores. Enviar este corpus a un servicio en la nube para «hablar con tus notas» equivale a confiar la totalidad de tu segunda memoria a un tercero. Un LLM local resuelve el problema de raíz: el modelo, los embeddings y el índice permanecen en tu disco.

En concreto, obsidian + ollama permite tres usos: generar y reformular texto directamente en el editor (autocompletado, resumen, traducción), consultar todo el vault en lenguaje natural («¿qué he anotado sobre el proyecto X?») y mostrar automáticamente las notas semánticamente próximas a la que estás escribiendo. Dos plugins cubren estas necesidades: Copilot para el chat y la generación, Smart Connections para la búsqueda por similitud.

Confidencialidad
Ninguna nota ni ningún embedding sale de la máquina. Ideal para un diario o datos de clientes.
Sin conexión
Funciona en tren o en avión, una vez descargados los modelos.
Costo nulo
Sin suscripción ni facturación por consulta, independientemente del volumen de notas.
Control del modelo
Tú eliges el tamaño, la cuantización y el contexto según tu hardware.

#Prerrequisitos

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

La configuración se basa en tres componentes: Obsidian, Ollama como daemon local y un plugin comunitario. No hace falta nada más: ni clave API ni cuenta.

Obsidian 1.5+
Versión de escritorio (Windows, macOS o Linux). Los plugins comunitarios no funcionan de la misma manera en móviles; esta guía está orientada a la versión de escritorio.
Ollama instalado
El servicio en segundo plano escucha por defecto en http://localhost:11434. Si aún no está instalado, consultar la guía de instalación de Ollama indicada al final del artículo.
Un modelo de chat
Por ejemplo, qwen3.5:9b con cuantización Q4_K_M (≈6,6 GB de VRAM), la opción de referencia para 8 GB en 2026 (256k de contexto, visión).
Un modelo de embeddings
nomic-embed-text o mxbai-embed-large, indispensables para el chat sobre la bóveda y para Smart Connections.
RAM/VRAM
8 GB de VRAM son suficientes para un modelo moderno de 9B (Qwen 3.5 9B, ≈6,6 GB). Si usas solo la CPU, piensa más bien en un modelo de 2-3B (Qwen 3.5 2B o Granite 4.2 3B) y un poco de paciencia.
i
Chat ≠ embeddings
Dos modelos distintos entran en juego. El modelo de chat genera las respuestas; el modelo de embeddings convierte tus notas en vectores para la búsqueda. No configures un modelo de chat donde se espera un modelo de embeddings, ni al revés: es el error más común.

#Preparar Ollama para Obsidian

Antes de tocar Obsidian, se descargan los modelos y se verifica que el daemon responda. Ollama expone una API compatible con OpenAI en el puerto 11434, que los plugins pueden utilizar.

Terminal
# Modèle de chat (généraliste, ~6,6 Go en Q4)
ollama pull qwen3.5:9b

# Modèle d'embeddings (obligatoire pour le RAG)
ollama pull nomic-embed-text

# Vérifier que le daemon tourne
ollama ps

Un punto específico de Obsidian: los plugins funcionan en un contexto de tipo navegador (Electron), y las solicitudes hacia Ollama pueden ser bloqueadas por la política CORS. Es necesario, por tanto, autorizar a Obsidian para llamar a la API. Se define la variable de entorno OLLAMA_ORIGINS antes de lanzar el daemon.

Linux / macOS
# Autoriser les origines Obsidian (app://) et relancer Ollama
export OLLAMA_ORIGINS="app://obsidian.md*"
ollama serve
Windows (PowerShell)
# Définir la variable puis relancer Ollama
setx OLLAMA_ORIGINS "app://obsidian.md*"
# Quitter Ollama depuis la barre système, puis le relancer
!
CORS: la causa número 1 de los errores de «conexión fallida»
Si Copilot o Smart Connections muestra un error de red mientras que ollama ps funciona, casi siempre falta OLLAMA_ORIGINS. En macOS con la app Ollama, usa launchctl setenv OLLAMA_ORIGINS "app://obsidian.md*" y vuelve a iniciar la aplicación.

#Configurar el plugin Copilot para usar Ollama

Copilot (por logancyang) es el plugin de chat y generación más completo para conectar un modelo local. También maneja tanto la reformulación en el editor como el chat conversacional y el modo «Vault QA». Aquí tienes los pasos de instalación.

  1. 01
    Instalar el plugin
    Ajustes → Módulos complementarios de terceros → Explorar, buscar «Copilot» (logancyang), instalar y luego activar. Acepta primero el uso de plugins comunitarios si Obsidian te lo pide.
  2. 02
    Abrir los ajustes de Copilot
    En Configuración → Copilot, sección «Model». Copilot ofrece proveedores predeterminados; selecciona Ollama como proveedor para el chat.
  3. 03
    Introducir la URL y el modelo
    URL base: http://localhost:11434. Nombre del modelo de chat: qwen3.5:9b (exactamente la etiqueta que muestra ollama list). Deja la clave API vacía, no es necesaria localmente.
  4. 04
    Configurar los embeddings
    En la sección «Embedding Model», elige de nuevo Ollama como proveedor e introduce nomic-embed-text. Esto hará posible el chat sobre todo el vault.
  5. 05
    Probar
    Abre el panel Copilot (ícono en la barra lateral o comando «Copilot: Open Chat»), plantea una pregunta sencilla. Una respuesta local confirma que la conexión funciona.

Copilot también añade comandos contextuales: selecciona un fragmento, abre la paleta (Ctrl/Cmd+P) y ejecuta «Copilot: Summarize», «Simplify» o «Translate». El texto seleccionado se envía al modelo local y la respuesta se inserta o se muestra según el comando.

→
Ventana de contexto
Para resumir notas largas, aumenta el contexto del modelo. Crea un Modelfile con PARAMETER num_ctx 8192 (o más) y vuelve a crear el modelo mediante ollama create. Un contexto demasiado corto trunca silenciosamente tus notas antes incluso de que el modelo las lea.

#Chatear con toda tu bóveda en local

El modo más potente de Copilot es el «Vault QA» (también llamado modo QA): en lugar de conversar únicamente con el modelo, consultas tus apuntes. En segundo plano, Copilot construye un índice vectorial de tu vault con el modelo de embeddings, luego encuentra los pasajes relevantes y los incluye en el prompt. Es RAG aplicado a tus apuntes personales.

  1. 01
    Activar el modo Vault QA
    En el panel de chat Copilot, cambia el selector de modo de «Chat» a «Vault QA» (o «QA»).
  2. 02
    Construir el índice
    Ejecuta el comando « Copilot: Index (refresh) vault for QA ». El plugin recorre tus notas y calcula los embeddings mediante Ollama. El tiempo depende del tamaño del vault y del modelo.
  3. 03
    Hacer preguntas transversales
    Ejemplos: «Resume todo lo que anoté sobre la arquitectura hexagonal» o «¿En qué reuniones se habló del presupuesto Q3?». Las respuestas citan las notas originales.
  4. 04
    Reindexar después de grandes cambios
    El índice no es mágico: después de agregar muchas notas, vuelve a indexar para que se tengan en cuenta.
i
El índice se mantiene en local
El índice vectorial se almacena en el directorio de configuración del plugin, dentro de tu vault. Nada se envía al exterior: Ollama calcula los embeddings en tu máquina y los guarda en tu disco.

#Smart Connections para encontrar tus notas relacionadas

Smart Connections (de Brian Petro) responde a una necesidad diferente: en lugar de hacer preguntas, muestra continuamente las notas semánticamente próximas a la que estás editando. Es un panel lateral dinámico que muestra conexiones que nunca habrías establecido manualmente: el equivalente a una función automática de «related notes», basada en la similitud vectorial.

  1. 01
    Instalar Smart Connections
    Ajustes → Módulos complementarios de terceros → Explorar, buscar «Smart Connections», instalar y activar.
  2. 02
    Apuntar los embeddings a Ollama
    En los ajustes del plugin, sección embeddings, elige Ollama como adaptador, URL http://localhost:11434 y modelo nomic-embed-text (o mxbai-embed-large para mayor precisión).
  3. 03
    Dejar que la indexación se realice
    Al iniciarse por primera vez, Smart Connections calcula los embeddings de todas tus notas. El panel «Smart Connections» se va llenando después a medida que navegas.
  4. 04
    Opcional: el chat Smart
    Smart Connections incluye también un modo de chat (Smart Chat) que se basa en estos mismos embeddings y puede utilizar tu modelo de chat de Ollama para responder a partir de las notas similares.

La ventaja de Smart Connections frente a Copilot Vault QA es que funciona de forma pasiva y continua. No tienes que pedir nada: al escribir una nota sobre un tema, las notas antiguas relacionadas aparecen por sí solas, lo que favorece los hallazgos fortuitos en un vault grande. Los dos plugins son complementarios y pueden compartir el mismo modelo de embeddings de Ollama.


#Modelos recomendados según el tamaño de la bóveda

El modelo adecuado depende en primer lugar de tu hardware y luego del volumen de notas. Para la generación de texto, un modelo moderno de 8-9B en Q4_K_M (Qwen 3.5 9B) ofrece el mejor equilibrio calidad/VRAM para la mayoría de las configuraciones. Para los embeddings, nomic-embed-text es ligero y suficiente; mxbai-embed-large gana en precisión en grandes vaults, a costa de un índice más pesado.

Bóveda pequeña (< 500 notas)
Chat: qwen3.5:9b (Q4, ≈6,6 GB de VRAM). Embeddings: nomic-embed-text. Cabe en una RTX 3060 de 12 GB.
Vault medio (500–3000 notas)
Chat: qwen3.5:9b. Embeddings: mxbai-embed-large para una mejor relevancia de los enlaces. Las RTX 4070/4080 permiten trabajar con comodidad.
Bóveda grande (> 3000 notas)
Chat: Qwen 3.8 27B (qwen3.8:27b, ≈18 GB, 262k de contexto) para síntesis más finas. Embeddings: mxbai-embed-large. RTX 4090 24GB o Mac M4 Pro con memoria unificada.
Sin GPU (solo CPU)
Chat: un 2-3B (qwen3.5:2b, ≈1,9 GB, o granite4.2:3b muy ligero). Embeddings: nomic-embed-text, que sigue siendo rápido en CPU. Respuestas más lentas pero utilizables.
Mac Apple Silicon
La memoria unificada es una ventaja: un M4 Pro de 24 a 48 GB permite ejecutar un Qwen 3.8 27B y indexar embeddings sin problemas.
→
Coherencia de los embeddings
No cambies de modelo de embeddings a la ligera: los vectores de un modelo no son comparables con los de otro. Si pasas de nomic-embed-text a mxbai-embed-large, tendrás que reindexar completamente el vault; de lo contrario, las similitudes se vuelven incoherentes.

#Solución de problemas

La mayoría de los problemas se deben a tres causas: CORS, un nombre de modelo incorrecto o el daemon de Ollama detenido. Aquí tienes una comprobación rápida.

« Conexión fallida » / error de red
OLLAMA_ORIGINS no incluye Obsidian. Añade app://obsidian.md* y reinicia el daemon (no solo Obsidian).
« model not found »
La etiqueta introducida en el plugin no coincide. Revísala con ollama list y copia el nombre exacto, incluyendo la etiqueta (qwen3.5:9b, no qwen3.5).
Respuestas vacías o truncadas
Contexto demasiado corto. Aumenta num_ctx mediante un Modelfile o reduce el tamaño de las notas enviadas.
Indexación muy lenta
El modelo de embeddings se ejecuta en la CPU o el vault es enorme. Revisa ollama ps; considera nomic-embed-text, que es más ligero.
Smart Connections vacío
El índice no ha terminado de construirse, o el adaptador apunta a un modelo de chat en lugar de un modelo de embeddings.
Terminal
# Vérifier les modèles disponibles et leurs tags exacts
ollama list

# Confirmer que le daemon répond et voir ce qui est chargé en mémoire
ollama ps

# Test brut de l'API embeddings (doit renvoyer un vecteur)
curl http://localhost:11434/api/embeddings -d '{
  "model": "nomic-embed-text",
  "prompt": "note de test"
}'

#Para ir más allá

Una vez que Obsidian esté conectado a tu modelo local, estas guías del sitio ayudan a afinar el conjunto de herramientas y a entender los componentes internos:

Instalar Ollama: Windows, macOS y Linux
La base de todo el montaje: instalación limpia del daemon y gestión de los modelos.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para encontrar un equilibrio entre la calidad de generación y la VRAM disponible en tu tarjeta.
AnythingLLM: RAG listo para producción en local
Si quieres llevar el RAG más allá de Obsidian, con espacios de trabajo y API.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.