IntelliJ y JetBrains + Ollama: el asistente de IA local en tu IDE
Conectar IntelliJ (o PyCharm, WebStorm, GoLand…) con Ollama permite disponer de un asistente de código al estilo de Copilot que funciona en tu máquina: chat sobre tu proyecto, autocompletado al final de la línea y refactorización, sin que una sola línea se envíe a un servidor de terceros. Esta guía te ayuda a elegir entre los plugins compatibles con Ollama, muestra cómo conectar todo mediante un «proxy AI» e indica qué modelos de código elegir según tu tarjeta gráfica.
#¿Por qué un LLM local en tu IDE?
Los asistentes en la nube (GitHub Copilot, JetBrains AI, Cursor) son prácticos, pero envían el contexto de tu código —a veces el archivo completo, a veces todo el repositorio— a servidores remotos. Para código sujeto a un NDA, software propietario o simplemente por principio, eso es inaceptable. Un LLM local conectado a IntelliJ soluciona el problema de raíz: el modelo se ejecuta en tu GPU, y ni el prompt ni el texto generado salen nunca de la máquina.
El otro argumento es el costo. Una suscripción a Copilot o JetBrains AI se paga mensualmente, indefinidamente. Una vez instalado Ollama y descargado un modelo de código, puedes completar código y conversar sin cuotas, sin facturación por token, incluso sin conexión. La contrapartida está en la calidad: un modelo local pequeño no iguala a un modelo de vanguardia en la nube, pero un Qwen 3.8 27B o un Devstral 24B se le acerca para el autocompletado y el chat habitual.
- Confidencialidad
- El código, los prompts y las respuestas permanecen en local. No se registra nada en la nube.
- Sin suscripción
- Sin costo recurrente una vez descargado el modelo. Uso ilimitado.
- Sin conexión
- Funciona en el tren, en una red aislada o detrás de un proxy empresarial estricto.
- Control del modelo
- Eliges el tamaño y la cuantización, y puedes cambiar de modelo según la tarea.
#Los plugins de JetBrains que hablan con Ollama
Esta guía te lleva al modelo. El kit te lleva al copiloto que programa en tu editor.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
El ecosistema JetBrains no ofrece soporte nativo universal para Ollama: hay que recurrir a un plugin del marketplace. Tres opciones cubren casi todas las necesidades, cada una con un punto fuerte diferente.
- ProxyAI (ex-CodeGPT)
- El más completo para uso local. Chat, autocompletado en línea, edición del texto seleccionado y un conector Ollama integrado. Es el «proxy AI» mencionado en el título: sirve de puente entre el IDE y el daemon Ollama.
- Continue
- De código abierto, muy configurable mediante un archivo de configuración. Chat, autocompletado y acciones sobre el código, con integración de Ollama como proveedor de primer nivel. Ideal si quieres ajustar cada modelo con precisión.
- JetBrains AI Assistant
- El asistente oficial de JetBrains. Desde 2025 puede conectarse a un modelo local mediante Ollama o LM Studio para funcionar sin conexión. Práctico si quieres seguir usando la herramienta de la propia JetBrains, pero menos flexible en el autocompletado local.
#Prerrequisitos
Se supone que Ollama ya está instalado y funcionando. El resto se reduce a un IDE JetBrains reciente y al menos un modelo de código descargado.
- Un IDE JetBrains 2024.1+
- IntelliJ IDEA, PyCharm, WebStorm, GoLand, Rider, PhpStorm… Los plugins mencionados se instalan en toda la gama a través de la misma marketplace.
- Ollama funcionando
- El daemon instalado y accesible en http://localhost:11434. Prueba con ollama list antes de configurar nada.
- Un modelo de chat/código
- qwen3.5:9b es un buen punto de partida versátil (256k de contexto, visión). En Q4_K_M cabe en aproximadamente 6,6 GB de VRAM.
- Se recomienda una GPU
- El autocompletado debe responder en menos de un segundo para ser útil. Una RTX 3060 de 12 GB ejecuta un 7B con soltura; sin GPU, limita el uso al chat, no al autocompletado.
#Configurar ProxyAI + Ollama
ProxyAI (anteriormente CodeGPT) es el camino más directo hacia un asistente local completo en JetBrains. Su conector de Ollama gestiona el chat, la edición del texto seleccionado y el autocompletado, sin clave de API ni cuenta.
- 01Instalar el pluginSettings → Plugins → Marketplace, busca «ProxyAI» (o «CodeGPT» según la versión) e instálalo. Reinicia el IDE si se te solicita.
- 02Elegir el proveedor OllamaSettings → Tools → ProxyAI → Providers. Selecciona Ollama (Local) como proveedor, en lugar de las opciones en la nube (OpenAI, Anthropic…).
- 03Verificar la URL del servidorEl campo Base URL debe apuntar a http://localhost:11434. Si Ollama está en otra máquina de la red, coloca su IP en lugar de localhost.
- 04Seleccionar el modeloEn la lista de modelos, elige el que has descargado (por ejemplo, qwen3.5:9b). ProxyAI consulta a Ollama para listar los modelos disponibles.
- 05Probar el chatAbre el panel ProxyAI (ícono en la barra lateral), plantea una pregunta sobre un archivo abierto. La respuesta debe llegar localmente, sin advertencia de conexión externa.
#Continue y el AI Assistant nativo
Si prefieres ajustar cada detalle, Continue expone su configuración en un archivo en lugar de en menús. Allí se declaran explícitamente el proveedor Ollama, el modelo de chat y, por separado, el modelo de completación. Requiere más texto, pero es mucho más preciso, especialmente para asignar un modelo pequeño y rápido a la autocompletación y uno más grande al chat.
En JetBrains AI Assistant, el procedimiento está más pautado: en los ajustes del asistente, activa el uso de modelos locales y configúralo para conectarse a Ollama. Es útil para mantener una sola herramienta, pero el asistente nativo sigue estando pensado principalmente para la nube de JetBrains; su autocompletado local es menos maduro que el de ProxyAI o Continue. Para un uso serio y 100 % local, recomendamos más bien estos dos últimos.
#¿Qué modelos de código elegir según tu VRAM?
La regla es simple: cuanto mayor es el modelo, mejores son sus respuestas, pero más VRAM consume y más lentamente responde. Las familias Qwen 3.5 / Qwen 3.8 cubren toda la gama y son una referencia en 2026 para la programación en local; Devstral 24B (especializado en agentes de programación) y Granite 4.2 son buenas alternativas. Estas son las cifras de referencia con cuantización Q4_K_M (el mejor equilibrio entre tamaño y calidad).
- Ligero 3B — ~2 GB VRAM
- granite4.2:3b. Resolución rápida de problemas, preguntas sencillas, consumo muy bajo de recursos. Funciona incluso en una GPU pequeña o en CPU para usos no interactivos.
- Polivalente 9B — ~6,6 GB de VRAM
- qwen3.5:9b. El punto de equilibrio: rendimiento correcto en chat, edición y refactorización, 256k de contexto y visión. Pensado para una RTX 3060 de 12 GB / 4070 de 12 GB.
- Confort 12B — ~7,6 GB VRAM
- gemma4:12b. Significativamente mejor en razonamiento y refactorizaciones de múltiples archivos, multimodal y bajo licencia Apache 2.0. Funciona bien en un RTX 4080 de 16 GB.
- De gama alta 27B — ~18 GB VRAM
- qwen3.8:27b. El más cercano a los modelos en la nube para programar en local (262k de contexto, visión). Requiere una RTX 4090 de 24 GB o un Mac con Apple Silicon y 32 GB o más de memoria unificada. Consejo: configura su razonamiento en «low»; tiende a razonar en exceso por defecto.
#Autocompletado local: atención al FIM
El autocompletado al estilo de Copilot se basa en el «fill-in-the-middle» (FIM): el modelo debe completar el código en un punto intermedio, conociendo lo que precede Y lo que sigue al cursor. No todos los modelos lo admiten. Las variantes instruct están entrenadas para el chat, no para el FIM; para el autocompletado, utiliza las variantes base, diseñadas específicamente para ello.
- Modelo base, no Instruct
- Para el autocompletado, elige qwen2.5-coder:7b-base, que sigue siendo la referencia FIM en 2026. Un modelo instruct generará sugerencias demasiado verbosas o fuera de formato.
- Rapidez ante todo
- En el autocompletado, la velocidad prima sobre el grado de refinamiento. Un modelo base dedicado que responde en menos de medio segundo es más útil que un modelo de chat grande que tarda 2 segundos.
- GPU casi obligatoria
- Sin aceleración por hardware, el autocompletado llega demasiado tarde para seguir el ritmo al que escribes. Reserva entonces la IA local para el chat.
#Lo que la IA local aún no hace en el IDE
La IA local ha avanzado, pero aún existen diferencias con los asistentes en la nube de gama alta. Conviene conocerlas para ajustar tus expectativas y evitar decepciones.
- El razonamiento sobre varios archivos
- Los repositorios grandes superan la ventana de contexto de los modelos locales. El modelo ve los archivos que le das, no toda tu arquitectura. Copilot Workspace o Cursor indexan todo el proyecto; en local, esto todavía se hace de forma artesanal.
- Modos de agente avanzados
- Hacer que el modelo ejecute comandos, lance pruebas e itere en bucle (como en Cline/Cursor Agent) requiere un modelo que maneje de forma fiable el uso de herramientas. Los modelos locales pequeños suelen fallar en estas tareas; hay que optar por un modelo especializado en programación (Devstral 24B, Qwen3-Coder 30B o GLM 4.7 Flash) y aceptar fallos.
- La calidad intrínseca al trabajar con código complejo
- En algoritmos avanzados o frameworks recientes poco representados en el entrenamiento, un modelo local de 8 a 12B sigue por detrás de un modelo de vanguardia en la nube.
- Una integración cuidada en el producto
- Detección automática del lenguaje de programación, numerosas acciones contextuales, resolución de PR… las herramientas locales están acortando distancias, pero siguen un paso por detrás de la experiencia refinada de los asistentes comerciales.
En la práctica, la ejecución local destaca en el autocompletado, el chat sobre un archivo, la explicación de código y la refactorización localizada. Para tareas complejas con agentes y el análisis de un repositorio completo, la nube mantiene la ventaja; de ahí el interés de conservar ambas opciones y elegir cuál usar según la sensibilidad del código.
#Solución de problemas
- El plugin no lista ningún modelo
- No consigue conectarse a Ollama. Comprueba que el daemon esté funcionando (ollama list) y que la URL sea http://localhost:11434. Si Ollama está en otra máquina, inícialo con OLLAMA_HOST=0.0.0.0 y apunta a su IP.
- « Connection refused »
- Ollama no está arrancado o un firewall bloquea el puerto 11434. Prueba con curl http://localhost:11434/api/tags desde la misma máquina que el IDE.
- El modelo no aparece en la lista
- La etiqueta no coincide. Copia el nombre exacto devuelto por ollama list, incluyendo la etiqueta (qwen3.5:9b y no qwen3.5).
- Respuestas muy lentas
- El modelo no cabe por completo en la GPU y pasa a ejecutarse parcialmente en la CPU. Cambia a un tamaño menor o a Q4_K_M y comprueba con nvidia-smi que la GPU se esté utilizando correctamente.
- Autocompletado vacío o absurdo
- Estás usando un modelo instruct para el FIM. Cambia a una variante -base (qwen2.5-coder:7b-base).
- El IDE se ralentiza durante la generación
- Dos modelos cargados saturan la VRAM. Reduce el tamaño de uno o activa solo un plugin a la vez.
#Para ir más allá
La calidad del asistente local en el IDE depende del daemon y de la GPU que lo hacen funcionar. Estas guías complementan la puesta en marcha.
- Instalar Ollama
- Base: instalar y arrancar el daemon que sirve tus modelos de código en el puerto 11434.
- Copilot gratuito local: Cline, Tabby & CodeGeeX en VS Code
- El equivalente para VS Code, para comparar los enfoques y los plugins entre distintos editores.
- Usar Ollama en Claude Code y Cursor
- Para conectar los mismos modelos locales en otros asistentes y decidir entre local y nube según la tarea.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.