Intermedio 20 minCaso de uso

Desplegar un chatbot de IA interno para pymes (de 0 a 50 collaborateurs)

Diriges una pyme de menos de 50 colaboradores y quieres ofrecer un asistente de IA a tus equipos sin enviar sus datos a OpenAI. Esta guía presenta un conjunto completo de componentes tecnológicos con cifras para desplegar un chatbot de IA interno en una pyme: hardware concreto, software de código abierto, SSO de Microsoft, un plan de 4 semanas, gestión del cambio y cálculo del ROI. Sin humo ni discursos de venta: la lista de compras y el calendario.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué un chatbot interno en lugar de ChatGPT Business?

ChatGPT Team cuesta 25 € por usuario y al mes. Para 30 colaboradores, eso supone 9.000 € al año, indefinidamente. Con el mismo presupuesto, compras una estación de trabajo que funciona durante 4 a 5 años, y tus conversaciones nunca salen de la oficina. Esa es la decisión central.

Pero el verdadero tema no es el precio. Es lo que os riesen poner en la ventana del chat. Un comercial que pide a un LLM externo que reformule una propuesta contiene un nombre de cliente, un monto, a veces una margen. Una área de recursos humanos que resume una entrevista revela una trayectoria profesional. Multiplica por 30 personas durante 12 meses — la fuga está garantizada, incluso con una política de buen uso.

Confidencialidad
Las conversaciones permanecen en tu red local. No hay tránsito por Cloud Act, no hay exposición a un subcontratista de EE.UU., no hay ajustes políticos que verificar cada trimestre.
Costo fijo
El hardware es un CAPEX amortizado durante 4-5 años. La suscripción SaaS es un OPEX que aumenta con el número de empleados.
Control
Tú eliges el modelo, ajustas el prompt del sistema y conectas tus documentos internos mediante un RAG. Nadie cambia tu herramienta a tus espaldas.
Cumplimiento
Es más sencillo justificar el cumplimiento del AI Act y del RGPD con un sistema on-premise que dependiendo de un proveedor extracomunitario.
i
A quién va dirigida esta guía
Pymes de 5 a 50 empleados, con o sin departamento interno de TI. Si en tu empresa sois 200 personas o más, algunas decisiones cambian (paso a vLLM, alta disponibilidad, gestión estructurada de tickets); esta guía sigue siendo válida como base.

#1. Presupuesto de hardware: la estación de trabajo entre 5.000 y 10.000 €

El kit IA Local en la Empresa

Desplegar una IA local en el trabajo: RGPD, AI Act, arquitectura multiusuario, costes, nota para la dirección.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Para atender simultáneamente a entre 30 y 50 usuarios con un modelo de 20B a 35B en calidad Q4_K_M, no necesitas un servidor DGX. Una estación de trabajo bien elegida soporta la carga. Aquí tienes tres configuraciones según el perfil.

#Perfil A — 10 a 20 usuarios (5.000 €)

GPU
1× RTX 4080 de 16 GB de segunda mano (precio variable) o RTX 5070 Ti de 16 GB nueva (≈ 1 400 € a finales de septiembre de 2026). Permite ejecutar un modelo de 20-24B en Q4_K_M con un contexto de 16k tokens.
CPU
AMD Ryzen 9 7900X o Intel Core i7-14700K. Poco crítico, pero 12+ núcleos ayudan en la preparación de embeddings.
RAM del sistema
64 GB DDR5. Suficiente para el sistema, Qdrant y la parte de la caché KV que no cabe en la memoria de la GPU.
Almacenamiento
2 TB NVMe Gen4. Modelos + base vectorial + copias de seguridad locales.
Modelo servido
Mistral Small 24B (generalista, bueno en francés) o gpt-oss 20B en Q4_K_M (~14 GB de VRAM). Latencia ~30 tok/s.

#Perfil B — 20 a 35 usuarios (7 500 €)

GPU
1× RTX 4090 de 24 GB: ya no se vende nueva; hay que buscarla de segunda mano (precio variable). El equilibrio ideal para servir un modelo de 27-30B en Q4_K_M.
CPU
Ryzen 9 7950X o Threadripper 7960X. Núcleos útiles para atender varias conversaciones simultáneas.
RAM del sistema
128 GB DDR5 ECC si es posible. El índice RAG crece rápidamente.
Almacenamiento
2 TB NVMe Gen4 + 4 TB SATA para archivado.
Modelo servido
Qwen 3.8 27B (el «cercano a Copilot» de 2026, 262k ctx) o Granite 4.2 30B en Q4_K_M (~18 GB de VRAM). Latencia ~20-25 tok/s.

#Perfil C — entre 35 y 50 usuarios (10 000 €)

Opción NVIDIA
2× RTX 4090 de 24 GB con paralelismo tensorial. Permite servir un modelo de 27-35B en Q8 con calidad plena (~30-40 GB de VRAM repartidos entre las tarjetas), o ejecutar dos modelos en paralelo, con una latencia aceptable.
Opción Apple
Mac Studio M4 Max o Ultra con 64 a 128 GB de memoria unificada. Excelente relación entre silencio y rendimiento, ideal para oficinas de planta abierta.
CPU
Threadripper 7970X / 7980X para configuraciones NVIDIA. Es crucial para gestionar 50 conexiones WebSocket simultáneas.
RAM del sistema
128 a 256 GB. Margen para el caché del sistema, Qdrant en RAM, y un posible modelo de embeddings adicional.
Modelo servido
Qwen 3.8 27B en Q8 o Qwen 3.6 35B-A3B (MoE rápido) en Q5_K_M. Latencia ~15-20 tok/s.
→
No especifiques demasiado el día 1
Comienza con el perfil A aunque seáis 40. La mayoría de los usuarios no hacen preguntas simultáneamente. Medirás el tiempo de espera real al cabo de 3 semanas y cambiarás la GPU por una más potente si es necesario. La placa base y la fuente de alimentación, en cambio, deben admitir una GPU más grande desde el principio.

#2. Pila técnica recomendada

Bastan cuatro componentes de código abierto. Ningún proveedor de software tiene derecho a supervisar su uso, no hay ninguna licencia que renovar y todo se ejecuta en Docker en la estación de trabajo.

Ollama
El demonio que carga y sirve el modelo. Escucha por defecto en http://localhost:11434. Detecta automáticamente la GPU NVIDIA y gestiona la cuantización. Licencia MIT.
Open WebUI
La interfaz web tipo ChatGPT. Soporte multiusuario nativo, RBAC, integración con OIDC para SSO, historial por usuario. Licencia BSD-3.
Qdrant
Base vectorial para RAG. Indexa tus documentos internos (procedimientos, contratos tipo, fichas de producto). Más rápido y más sencillo que pgvector para este volumen. Licencia Apache 2.
Traefik o Nginx
Proxy inverso para exponer Open WebUI mediante HTTPS en la LAN con un certificado interno, terminar TLS y enrutar las solicitudes hacia los backends.
docker-compose.yml — esqueleto mínimo
services:
  ollama:
    image: ollama/ollama:latest
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    volumes:
      - ollama_data:/root/.ollama
    restart: unless-stopped

  qdrant:
    image: qdrant/qdrant:latest
    volumes:
      - qdrant_data:/qdrant/storage
    restart: unless-stopped

  openwebui:
    image: ghcr.io/open-webui/open-webui:main
    environment:
      - OLLAMA_BASE_URL=http://ollama:11434
      - QDRANT_URL=http://qdrant:6333
      - ENABLE_OAUTH_SIGNUP=true
      - OAUTH_PROVIDER_NAME=Microsoft
      - MICROSOFT_CLIENT_ID=${ENTRA_CLIENT_ID}
      - MICROSOFT_CLIENT_SECRET=${ENTRA_CLIENT_SECRET}
      - MICROSOFT_CLIENT_TENANT_ID=${ENTRA_TENANT_ID}
    volumes:
      - openwebui_data:/app/backend/data
    depends_on:
      - ollama
      - qdrant
    restart: unless-stopped

volumes:
  ollama_data:
  qdrant_data:
  openwebui_data:

Este esquema es deliberadamente breve. Añadirás Traefik por delante para HTTPS y un volumen bind-mount para las copias de seguridad nocturnas en el NAS. Nada más.

#3. SSO con Microsoft Entra ID

La mayoría de las pymes tienen Microsoft 365. Conectar la autenticación del chatbot a Entra ID (antes Azure AD) elimina las cuentas huérfanas y garantiza que un empleado que deja la empresa pierda su acceso ese mismo día. Open WebUI admite OIDC con Microsoft de forma nativa.

  1. 01
    Crear un registro de aplicación (App registration)
    En el portal Entra ID, App registrations → New registration. Nombre: « Chatbot IA Interno ». Redirect URI: https://chatbot.votreboite.local/oauth/microsoft/callback (en Web).
  2. 02
    Recuperar los identificadores
    Anota el Application (client) ID y el Directory (tenant) ID. En Certificates & secrets, genera un Client secret con una caducidad de 24 meses y anótalo inmediatamente (no volverá a mostrarse nunca).
  3. 03
    Definir permisos
    API permissions → Microsoft Graph → Delegated: openid, profile, email, User.Read. No se necesitan Application permissions; el flujo es delegado.
  4. 04
    Restringir el acceso
    Enterprise applications → tu app → Properties → Assignment required = Yes. Luego, en Users and groups, añade el grupo «Todos los colaboradores» o un grupo piloto. Sin este paso, cualquier cuenta del tenant puede iniciar sesión.
  5. 05
    Inyectar en Open WebUI
    Copia CLIENT_ID, CLIENT_SECRET y TENANT_ID en el .env del docker-compose. Reinicia. El botón «Sign in with Microsoft» aparece en la página de inicio de sesión.
!
El error clásico: Assignment required
Si olvidas el paso 4, todos los usuarios de tu tenant de Microsoft podrían conectarse, lo que incluye todas las cuentas de invitados externos (clientes, proveedores de servicios). Revisa dos veces este ajuste antes de compartir la URL con los equipos.

#4. Plan de despliegue en 4 semanas

Este calendario presupone una persona de referencia técnica interna (director de sistemas de información, responsable de TI o proveedor de servicios) que dedica aproximadamente el 50 % de su tiempo al proyecto. No hace falta más para una pyme.

#Semana 1 — Hardware e instalación

J1-J2
Pedido de hardware (estación de trabajo, sistema de alimentación ininterrumpida de 1500 VA, conmutador gestionado si aún no está instalado).
J3-J4
Recepción, montaje si es necesario, instalación de Ubuntu Server LTS 24.04, drivers NVIDIA, Docker + NVIDIA Container Toolkit.
J5
Descarga de las imágenes de Docker, primera ejecución de ollama pull mistral-small y prueba de chat directamente en la CLI. Debes ver cómo se generan tokens.

#Semana 2 — Stack y integraciones

J6-J7
docker-compose up, configuration Open WebUI (admin, paramètres généraux, branding interne).
J8-J9
Configuración SSO Entra ID, prueba con 3 cuentas piloto, validación del flujo de login y logout.
J10
Proxy inverso Traefik con certificado interno mediante tu PKI o Let's Encrypt DNS-01 si el dominio es público. Prueba desde 2-3 equipos de la LAN.

#Semana 3 — RAG y piloto

J11-J12
Selección de 50 a 200 documentos internos relevantes (procedimientos, preguntas frecuentes, fichas comerciales). Indexación en Qdrant mediante Open WebUI o un script de Python.
J13-J14
Prompt de sistema adaptado a la identidad de la pyme: tono, temas permitidos, temas que se deben rechazar (asuntos sensibles de RR. HH., salarios, etc.). Prueba en los 3 pilotos.
J15
Acceso para un grupo piloto de 5-8 empleados representativos (1 de ventas, 1 de RR. HH., 1 de contabilidad, 1 de operaciones…). Recogida de comentarios estructurados.

#Semana 4 — Formación y cambio

J16-J17
Ajustes basados en los comentarios de la fase piloto (prompt de sistema, documentos RAG, parámetros de temperatura).
J18
Sesión de formación colectiva de 1 h 30 min: demostración, casos de uso por puesto de trabajo, reglas de uso y lo que NO se introduce en el chat (datos de salud, identificadores, etc.).
J19
Apertura progresiva a todos los colaboradores a través del grupo Entra ID. Anuncio interno.
J20
Implementación del monitoreo (Glances o Netdata para la estación de trabajo, registro de conversaciones agregado para identificar los temas solicitados).

#5. Formación y gestión del cambio

Un chatbot interno sin formación supone desperdiciar el 70 % de la inversión. Los empleados no saben qué preguntarle, lo comparan mentalmente con ChatGPT para el público general y concluyen que «es peor» tras dos intentos.

Formato
Una sesión colectiva de 1h30 por grupos de 10-15 personas. Sin presentaciones durante 1h. 20 minutos de demostración + 1h de práctica con sus temas reales.
Casos de uso por función
Prepara 3 prompts concretos por función (RRHH, comercio, contabilidad, operaciones, dirección). La gente los copia y adapta — es exactamente lo que queremos.
Reglas de uso
Indica claramente qué se puede pegar (textos internos, borradores, datos ya públicos) y qué no se debe pegar (datos de salud, condenas, datos bancarios asociados a personas identificadas, identificadores técnicos).
Referente
Designa 1 referente de IA por departamento. Es quien difunde las buenas prácticas en su departamento y comunica las carencias de conocimiento del RAG.
Seguimiento a los 30 días
Mide el uso. Si algunos departamentos no utilizan la herramienta, es una señal: les falta un caso de uso evidente o la formación no ha surtido efecto.
→
Lo que funciona mejor en la demo
Tres casos para mostrar primero: reformular un correo difícil, resumir un informe extenso de una reunión y traducir un documento técnico. Son casos de uso cuyo valor salta a la vista en 30 segundos.

#6. Cumplimiento del RGPD y de la AI Act

El hecho de que el sistema sea on-premise simplifica radicalmente el cumplimiento normativo, pero no lo hace innecesario. Las obligaciones del RGPD se aplican al tratamiento, no a su ubicación.

Registro de actividades de tratamiento
Añade una ficha para el chatbot interno. Finalidad: asistencia en redacción y búsqueda documental. Base legal: interés legítimo del empleador. Datos tratados: contenido de las conversaciones, identificador SSO.
Duración de conservación
Define una política clara: 90 días de historial de conversaciones por usuario, con eliminación automática una vez transcurrido ese plazo. Documéntala en las normas de uso.
Información a los empleados
Actualización de la política de uso de los recursos informáticos y de la nota informativa CSE/CSE. Menciona explícitamente que las conversaciones se almacenan y que el administrador técnico puede acceder a ellas en caso de incidente.
Ley de Inteligencia Artificial
Un chatbot interno de asistencia a la productividad cae en la categoría «riesgo limitado» (artículo 50). Obligación principal: informar al usuario de que está interactuando con una IA — la interfaz Open WebUI lo hace por defecto.
Seguridad técnica
Copias de seguridad cifradas de la base de datos de Open WebUI, acceso administrativo registrado, MFA obligatorio en las cuentas de Entra ID, actualización mensual de las imágenes Docker.
i
¿Se necesita DPIA?
Un análisis de impacto (DPIA) no es obligatorio para un caso de uso de productividad estándar, pero se recomienda si planeas conectar el RAG con datos sensibles (archivos de RRHH, datos de clientes identificables). En caso de duda, tu DPO decide.

#7. ROI: cálculo honesto

Tomemos una pyme de 30 empleados, con un despliegue del Perfil A por 5.000 €. En un horizonte de 3 años.

Costo de la alternativa SaaS
30 × 25 € × 12 meses × 3 años = 27.000 € (ChatGPT Team).
Costo interno
Estación de trabajo de 5 000 € + electricidad ~200 €/año + 5 días-hombre de instalación el 1er año (~3 500 €) + 2 días-hombre/año de mantenimiento (~1 400 €/año × 2 años) = ~11 500 € en 3 años.
Ahorro neto directo
~15 500 € en 3 años, es decir aproximadamente 5 200 € al año a partir del año 2.
Ganancias indirectas
Reducción del riesgo de fugas de datos (cuantificable señalando que una sola fuga evitada cubre con creces el coste del proyecto), mayor facilidad para cumplir el RGPD e independencia frente a las subidas de precios de los servicios SaaS.
Aumento de productividad
Estimación prudente: 15 minutos ahorrados por usuario y por día laborable. Con un coste laboral total de 35 €/h y 220 días, eso equivale a ~38 500 € al año para 30 personas. Esta cifra depende en gran medida de la adopción real: sé prudente al elaborar casos de negocio.
!
El error clásico del ROI de productividad
Contar con 1 hora ahorrada al día y multiplicar: es un error. La mayoría de los usuarios habituales ahorran entre 10 y 20 minutos al día, y el 40 % de las cuentas quedan inactivas al cabo de 2 meses. Haz una estimación amplia de la adopción (50-60 %) y conservadora del ahorro por usuario (15 min). El ROI sigue siendo claramente positivo.

#Para ir más allá

Esta guía establece las bases. A continuación, hay tres vías naturales: añadir un sistema RAG sólido basado en tus documentos internos para que el chatbot conozca tus procedimientos, reforzar la seguridad del despliegue multiusuario en la intranet y formalizar el cumplimiento del RGPD con un expediente bien preparado.

Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.