Desplegar un chatbot de IA interno para pymes (de 0 a 50 collaborateurs)
Diriges una pyme de menos de 50 colaboradores y quieres ofrecer un asistente de IA a tus equipos sin enviar sus datos a OpenAI. Esta guía presenta un conjunto completo de componentes tecnológicos con cifras para desplegar un chatbot de IA interno en una pyme: hardware concreto, software de código abierto, SSO de Microsoft, un plan de 4 semanas, gestión del cambio y cálculo del ROI. Sin humo ni discursos de venta: la lista de compras y el calendario.
#¿Por qué un chatbot interno en lugar de ChatGPT Business?
ChatGPT Team cuesta 25 € por usuario y al mes. Para 30 colaboradores, eso supone 9.000 € al año, indefinidamente. Con el mismo presupuesto, compras una estación de trabajo que funciona durante 4 a 5 años, y tus conversaciones nunca salen de la oficina. Esa es la decisión central.
Pero el verdadero tema no es el precio. Es lo que os riesen poner en la ventana del chat. Un comercial que pide a un LLM externo que reformule una propuesta contiene un nombre de cliente, un monto, a veces una margen. Una área de recursos humanos que resume una entrevista revela una trayectoria profesional. Multiplica por 30 personas durante 12 meses — la fuga está garantizada, incluso con una política de buen uso.
- Confidencialidad
- Las conversaciones permanecen en tu red local. No hay tránsito por Cloud Act, no hay exposición a un subcontratista de EE.UU., no hay ajustes políticos que verificar cada trimestre.
- Costo fijo
- El hardware es un CAPEX amortizado durante 4-5 años. La suscripción SaaS es un OPEX que aumenta con el número de empleados.
- Control
- Tú eliges el modelo, ajustas el prompt del sistema y conectas tus documentos internos mediante un RAG. Nadie cambia tu herramienta a tus espaldas.
- Cumplimiento
- Es más sencillo justificar el cumplimiento del AI Act y del RGPD con un sistema on-premise que dependiendo de un proveedor extracomunitario.
#1. Presupuesto de hardware: la estación de trabajo entre 5.000 y 10.000 €
Desplegar una IA local en el trabajo: RGPD, AI Act, arquitectura multiusuario, costes, nota para la dirección.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Para atender simultáneamente a entre 30 y 50 usuarios con un modelo de 20B a 35B en calidad Q4_K_M, no necesitas un servidor DGX. Una estación de trabajo bien elegida soporta la carga. Aquí tienes tres configuraciones según el perfil.
#Perfil A — 10 a 20 usuarios (5.000 €)
- GPU
- 1× RTX 4080 de 16 GB de segunda mano (precio variable) o RTX 5070 Ti de 16 GB nueva (≈ 1 400 € a finales de septiembre de 2026). Permite ejecutar un modelo de 20-24B en Q4_K_M con un contexto de 16k tokens.
- CPU
- AMD Ryzen 9 7900X o Intel Core i7-14700K. Poco crítico, pero 12+ núcleos ayudan en la preparación de embeddings.
- RAM del sistema
- 64 GB DDR5. Suficiente para el sistema, Qdrant y la parte de la caché KV que no cabe en la memoria de la GPU.
- Almacenamiento
- 2 TB NVMe Gen4. Modelos + base vectorial + copias de seguridad locales.
- Modelo servido
- Mistral Small 24B (generalista, bueno en francés) o gpt-oss 20B en Q4_K_M (~14 GB de VRAM). Latencia ~30 tok/s.
#Perfil B — 20 a 35 usuarios (7 500 €)
- GPU
- 1× RTX 4090 de 24 GB: ya no se vende nueva; hay que buscarla de segunda mano (precio variable). El equilibrio ideal para servir un modelo de 27-30B en Q4_K_M.
- CPU
- Ryzen 9 7950X o Threadripper 7960X. Núcleos útiles para atender varias conversaciones simultáneas.
- RAM del sistema
- 128 GB DDR5 ECC si es posible. El índice RAG crece rápidamente.
- Almacenamiento
- 2 TB NVMe Gen4 + 4 TB SATA para archivado.
- Modelo servido
- Qwen 3.8 27B (el «cercano a Copilot» de 2026, 262k ctx) o Granite 4.2 30B en Q4_K_M (~18 GB de VRAM). Latencia ~20-25 tok/s.
#Perfil C — entre 35 y 50 usuarios (10 000 €)
- Opción NVIDIA
- 2× RTX 4090 de 24 GB con paralelismo tensorial. Permite servir un modelo de 27-35B en Q8 con calidad plena (~30-40 GB de VRAM repartidos entre las tarjetas), o ejecutar dos modelos en paralelo, con una latencia aceptable.
- Opción Apple
- Mac Studio M4 Max o Ultra con 64 a 128 GB de memoria unificada. Excelente relación entre silencio y rendimiento, ideal para oficinas de planta abierta.
- CPU
- Threadripper 7970X / 7980X para configuraciones NVIDIA. Es crucial para gestionar 50 conexiones WebSocket simultáneas.
- RAM del sistema
- 128 a 256 GB. Margen para el caché del sistema, Qdrant en RAM, y un posible modelo de embeddings adicional.
- Modelo servido
- Qwen 3.8 27B en Q8 o Qwen 3.6 35B-A3B (MoE rápido) en Q5_K_M. Latencia ~15-20 tok/s.
#2. Pila técnica recomendada
Bastan cuatro componentes de código abierto. Ningún proveedor de software tiene derecho a supervisar su uso, no hay ninguna licencia que renovar y todo se ejecuta en Docker en la estación de trabajo.
- Ollama
- El demonio que carga y sirve el modelo. Escucha por defecto en http://localhost:11434. Detecta automáticamente la GPU NVIDIA y gestiona la cuantización. Licencia MIT.
- Open WebUI
- La interfaz web tipo ChatGPT. Soporte multiusuario nativo, RBAC, integración con OIDC para SSO, historial por usuario. Licencia BSD-3.
- Qdrant
- Base vectorial para RAG. Indexa tus documentos internos (procedimientos, contratos tipo, fichas de producto). Más rápido y más sencillo que pgvector para este volumen. Licencia Apache 2.
- Traefik o Nginx
- Proxy inverso para exponer Open WebUI mediante HTTPS en la LAN con un certificado interno, terminar TLS y enrutar las solicitudes hacia los backends.
Este esquema es deliberadamente breve. Añadirás Traefik por delante para HTTPS y un volumen bind-mount para las copias de seguridad nocturnas en el NAS. Nada más.
#3. SSO con Microsoft Entra ID
La mayoría de las pymes tienen Microsoft 365. Conectar la autenticación del chatbot a Entra ID (antes Azure AD) elimina las cuentas huérfanas y garantiza que un empleado que deja la empresa pierda su acceso ese mismo día. Open WebUI admite OIDC con Microsoft de forma nativa.
- 01Crear un registro de aplicación (App registration)En el portal Entra ID, App registrations → New registration. Nombre: « Chatbot IA Interno ». Redirect URI: https://chatbot.votreboite.local/oauth/microsoft/callback (en Web).
- 02Recuperar los identificadoresAnota el Application (client) ID y el Directory (tenant) ID. En Certificates & secrets, genera un Client secret con una caducidad de 24 meses y anótalo inmediatamente (no volverá a mostrarse nunca).
- 03Definir permisosAPI permissions → Microsoft Graph → Delegated: openid, profile, email, User.Read. No se necesitan Application permissions; el flujo es delegado.
- 04Restringir el accesoEnterprise applications → tu app → Properties → Assignment required = Yes. Luego, en Users and groups, añade el grupo «Todos los colaboradores» o un grupo piloto. Sin este paso, cualquier cuenta del tenant puede iniciar sesión.
- 05Inyectar en Open WebUICopia CLIENT_ID, CLIENT_SECRET y TENANT_ID en el .env del docker-compose. Reinicia. El botón «Sign in with Microsoft» aparece en la página de inicio de sesión.
#4. Plan de despliegue en 4 semanas
Este calendario presupone una persona de referencia técnica interna (director de sistemas de información, responsable de TI o proveedor de servicios) que dedica aproximadamente el 50 % de su tiempo al proyecto. No hace falta más para una pyme.
#Semana 1 — Hardware e instalación
- J1-J2
- Pedido de hardware (estación de trabajo, sistema de alimentación ininterrumpida de 1500 VA, conmutador gestionado si aún no está instalado).
- J3-J4
- Recepción, montaje si es necesario, instalación de Ubuntu Server LTS 24.04, drivers NVIDIA, Docker + NVIDIA Container Toolkit.
- J5
- Descarga de las imágenes de Docker, primera ejecución de ollama pull mistral-small y prueba de chat directamente en la CLI. Debes ver cómo se generan tokens.
#Semana 2 — Stack y integraciones
- J6-J7
- docker-compose up, configuration Open WebUI (admin, paramètres généraux, branding interne).
- J8-J9
- Configuración SSO Entra ID, prueba con 3 cuentas piloto, validación del flujo de login y logout.
- J10
- Proxy inverso Traefik con certificado interno mediante tu PKI o Let's Encrypt DNS-01 si el dominio es público. Prueba desde 2-3 equipos de la LAN.
#Semana 3 — RAG y piloto
- J11-J12
- Selección de 50 a 200 documentos internos relevantes (procedimientos, preguntas frecuentes, fichas comerciales). Indexación en Qdrant mediante Open WebUI o un script de Python.
- J13-J14
- Prompt de sistema adaptado a la identidad de la pyme: tono, temas permitidos, temas que se deben rechazar (asuntos sensibles de RR. HH., salarios, etc.). Prueba en los 3 pilotos.
- J15
- Acceso para un grupo piloto de 5-8 empleados representativos (1 de ventas, 1 de RR. HH., 1 de contabilidad, 1 de operaciones…). Recogida de comentarios estructurados.
#Semana 4 — Formación y cambio
- J16-J17
- Ajustes basados en los comentarios de la fase piloto (prompt de sistema, documentos RAG, parámetros de temperatura).
- J18
- Sesión de formación colectiva de 1 h 30 min: demostración, casos de uso por puesto de trabajo, reglas de uso y lo que NO se introduce en el chat (datos de salud, identificadores, etc.).
- J19
- Apertura progresiva a todos los colaboradores a través del grupo Entra ID. Anuncio interno.
- J20
- Implementación del monitoreo (Glances o Netdata para la estación de trabajo, registro de conversaciones agregado para identificar los temas solicitados).
#5. Formación y gestión del cambio
Un chatbot interno sin formación supone desperdiciar el 70 % de la inversión. Los empleados no saben qué preguntarle, lo comparan mentalmente con ChatGPT para el público general y concluyen que «es peor» tras dos intentos.
- Formato
- Una sesión colectiva de 1h30 por grupos de 10-15 personas. Sin presentaciones durante 1h. 20 minutos de demostración + 1h de práctica con sus temas reales.
- Casos de uso por función
- Prepara 3 prompts concretos por función (RRHH, comercio, contabilidad, operaciones, dirección). La gente los copia y adapta — es exactamente lo que queremos.
- Reglas de uso
- Indica claramente qué se puede pegar (textos internos, borradores, datos ya públicos) y qué no se debe pegar (datos de salud, condenas, datos bancarios asociados a personas identificadas, identificadores técnicos).
- Referente
- Designa 1 referente de IA por departamento. Es quien difunde las buenas prácticas en su departamento y comunica las carencias de conocimiento del RAG.
- Seguimiento a los 30 días
- Mide el uso. Si algunos departamentos no utilizan la herramienta, es una señal: les falta un caso de uso evidente o la formación no ha surtido efecto.
#6. Cumplimiento del RGPD y de la AI Act
El hecho de que el sistema sea on-premise simplifica radicalmente el cumplimiento normativo, pero no lo hace innecesario. Las obligaciones del RGPD se aplican al tratamiento, no a su ubicación.
- Registro de actividades de tratamiento
- Añade una ficha para el chatbot interno. Finalidad: asistencia en redacción y búsqueda documental. Base legal: interés legítimo del empleador. Datos tratados: contenido de las conversaciones, identificador SSO.
- Duración de conservación
- Define una política clara: 90 días de historial de conversaciones por usuario, con eliminación automática una vez transcurrido ese plazo. Documéntala en las normas de uso.
- Información a los empleados
- Actualización de la política de uso de los recursos informáticos y de la nota informativa CSE/CSE. Menciona explícitamente que las conversaciones se almacenan y que el administrador técnico puede acceder a ellas en caso de incidente.
- Ley de Inteligencia Artificial
- Un chatbot interno de asistencia a la productividad cae en la categoría «riesgo limitado» (artículo 50). Obligación principal: informar al usuario de que está interactuando con una IA — la interfaz Open WebUI lo hace por defecto.
- Seguridad técnica
- Copias de seguridad cifradas de la base de datos de Open WebUI, acceso administrativo registrado, MFA obligatorio en las cuentas de Entra ID, actualización mensual de las imágenes Docker.
#7. ROI: cálculo honesto
Tomemos una pyme de 30 empleados, con un despliegue del Perfil A por 5.000 €. En un horizonte de 3 años.
- Costo de la alternativa SaaS
- 30 × 25 € × 12 meses × 3 años = 27.000 € (ChatGPT Team).
- Costo interno
- Estación de trabajo de 5 000 € + electricidad ~200 €/año + 5 días-hombre de instalación el 1er año (~3 500 €) + 2 días-hombre/año de mantenimiento (~1 400 €/año × 2 años) = ~11 500 € en 3 años.
- Ahorro neto directo
- ~15 500 € en 3 años, es decir aproximadamente 5 200 € al año a partir del año 2.
- Ganancias indirectas
- Reducción del riesgo de fugas de datos (cuantificable señalando que una sola fuga evitada cubre con creces el coste del proyecto), mayor facilidad para cumplir el RGPD e independencia frente a las subidas de precios de los servicios SaaS.
- Aumento de productividad
- Estimación prudente: 15 minutos ahorrados por usuario y por día laborable. Con un coste laboral total de 35 €/h y 220 días, eso equivale a ~38 500 € al año para 30 personas. Esta cifra depende en gran medida de la adopción real: sé prudente al elaborar casos de negocio.
#Para ir más allá
Esta guía establece las bases. A continuación, hay tres vías naturales: añadir un sistema RAG sólido basado en tus documentos internos para que el chatbot conozca tus procedimientos, reforzar la seguridad del despliegue multiusuario en la intranet y formalizar el cumplimiento del RGPD con un expediente bien preparado.
Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.