Mejor LLM para soporte técnico en empresas de servicios digitales (IT)
Implementar una IA local de soporte informático responde a una exigencia concreta de las empresas de servicios digitales (ESN): los tickets, los logs y los runbooks contienen datos de clientes sujetos a cláusulas de confidencialidad. Con una IA local de soporte informático, estos elementos permanecen en una máquina que tú controlas, y cada respuesta puede vincularse a una fuente.
Esta página trata únicamente del soporte informático interno: clasificación de tickets técnicos, lectura de logs con información sensible eliminada, búsqueda en runbooks, trazabilidad y escalamiento. El comercio, los reembolsos y la traducción de la atención al cliente se abordan en la guía atención al cliente multilingüe con un LLM local.
El plan: criterios de selección, elección de modelos, memoria por cuantización, tasa de generación y benchmarks, licencias y, después, cadena de despliegue.
Lo que el soporte informático de una ESN exige a un modelo
El soporte interno no requiere las mismas cualidades que un asistente generalista. Hay cuatro criterios que importan:
- Ventana de contexto : un extracto de logs, un runbook y el historial de un ticket superan rápidamente 30 000 tokens. Los modelos limitados a 4 096 tokens (Snowflake Arctic Instruct) o 8.192 tokens (Grok-1 (base)) se excluyen para este uso.
- Salida estructurada : el modelo debe generar un JSON estable (categoría, gravedad, equipo destinatario) que la herramienta de gestión de tickets pueda procesar.
- Fidelidad a las fuentes : la respuesta debe citar el runbook o la línea de log utilizada, de lo contrario la trazabilidad se pierde.
- Licencia : el modelo suele ejecutarse como parte de un servicio facturado, por lo que se trata de un uso comercial.
La selección: siete modelos entre 68 y 85 GB en Q4
Los modelos siguientes son los más ligeros del catálogo de referencia de esta página. Todos requieren un servidor o una estación con mucha memoria, no el ordenador de un técnico.
- Mistral Small 4 : 119B, Apache 2.0, ~72 GB en Q4, contexto de 256 000. Primera opción por defecto gracias a su licencia permisiva y su gran contexto. Pesos en la página de Hugging Face de Mistral.
- Qwen 3.5 122B-A10B : 122B, Apache 2.0, ~73 GB en Q4, contexto 262 000. El sufijo A10B indica aproximadamente 10 mil millones de parámetros activos por token, lo que favorece la velocidad de procesamiento. Ver Alibaba en Hugging Face.
- Nemotron 3 Super 120B : 120B, NVIDIA Open Model License, ~72 GB en Q4, contexto 128 000. Pertinente para una infraestructura ya equipada con NVIDIA (NVIDIA en Hugging Face).
- Laguna S 2.1 : 118B, OpenMDW 1.1, ~68 GB en Q4, contexto 262 144. El más ligero de la selección, orientado al código, útil para tickets relacionados con scripts y pipelines.
- Qwen3.8 Flash Next 125B-A6B : 125B, licencia «Otro (pesos abiertos)», ~72 GB en Q4, contexto 256 000. Licencia que debe leerse antes de cualquier uso en el entorno de un cliente.
- Mistral Medium 3.5 128B : 128B, Modified MIT, ~74 GB en Q4, contexto 256 000
- Mixtral 8x22B Instruct : 141B, Apache 2.0, ~82 GB en Q4, contexto de 64 000. Contexto más corto, suficiente para un ticket y un runbook, pero justo para extractos largos de logs.
Dos modelos están limitados por su contexto de 32 768 tokens: dots.llm1 Instruct (142B, MIT, ~85 GB) y DBRX Instruct (132B, Databricks Open Model License, ~76 GB). Sirven para clasificar tickets, menos para analizar logs.
Para un equipo que disponga de más memoria, Step 3.5 Flash (196B, Apache 2.0, ~118 GB) y MiniMax-M2.7 (229B, Apache 2.0, ~138 GB) constituyen el siguiente nivel.
Memoria por cuantización y hardware
Solo los valores Q4 provienen del catálogo. Los demás niveles son estimaciones aproximadas calculadas mediante una regla de proporcionalidad, que deben confirmarse en cada ficha.
Para la clase 118B-128B:
- Q4 : 68 a 74 GB (catálogo)
- Q5 : ~82 a 90 GB (estimado)
- Q8 : ~120 a 135 GB (estimado)
- FP16 : ~236 a 256 GB (estimado)
Para Mixtral 8x22B Instruct (141B) :
- Q4 : ~82 GB (catálogo)
- Q5 : ~97 GB (estimado)
- Q8 : ~150 GB (estimado)
- FP16 : ~282 GB (estimado)
Estos números no incluyen el contexto: cargar 100.000 tokens de logs añade varios GB de caché. Deja un margen de al menos un 15 a 20 % (estimado).
En cuanto a hardware, un Q4 de 72 GB cabe en una máquina con memoria unificada de 96 GB con poca margen, y de forma más cómoda en 128 GB. Las páginas Mac 96 GB et Mac 128 GB detallan estas configuraciones. En PC, hay que combinar varias tarjetas gráficas: ver la guía elegir una GPU para un LLM local.
Velocidad y benchmarks: lo que aún queda por confirmar
Aquí no se publica ninguna velocidad medida para estos siete modelos: los tokens/segundo deben confirmarse en tu hardware. Dos referencias cualitativas:
- Arquitectura MoE : a igual tamaño, un modelo con un número reducido de parámetros activos (A6B, A10B) lee menos datos por token y genera más rápido que un modelo denso.
- Concurrencia : un equipo de soporte envía varias solicitudes simultáneamente. Un servidor como vLLM procesa las solicitudes por lotes y aumenta la tasa total de procesamiento, mientras que llama.cpp sigue siendo el más sencillo para un único flujo en GGUF.
Para las puntuaciones de MMLU o HumanEval, consulta elOpen LLM Leaderboard y las fichas del catálogo. Estas puntuaciones deben confirmarse modelo por modelo y no evalúan bien el trabajo de soporte.
Un conjunto de pruebas interno es más fiable: 50 tickets cerrados y anonimizados, con la categoría, la gravedad y la resolución reales. Mide la tasa de categorización correcta, la tasa de citas exactas del runbook y el número de escalados injustificados. La página benchmark local describe el método de medición de la tasa de procesamiento.
Licencias: verificar antes de instalar en las instalaciones de un cliente
- Apache 2.0 (Mistral Small 4, Qwen 3.5 122B-A10B, Mixtral 8x22B Instruct): uso comercial permitido, con conservación de las menciones de licencia.
- MIT (dots.llm1 Instruct) : uso comercial permitido, restricciones mínimas.
- MIT modificada (Mistral Medium 3.5 128B): hay que leer las cláusulas añadidas y confirmar las condiciones.
- NVIDIA Open Model License, OpenMDW 1.1, Databricks Open Model License : licencias propias de los proveedores, que deben revisarse antes del despliegue en servicios prestados a clientes.
- Otro (pesos abiertos) (Qwen3.8 Flash Next 125B-A6B) : condiciones a confirmar caso por caso.
La guía LLM local en la empresa y RGPD complementa este punto en lo relativo a los datos personales presentes en los tickets.
Cadena de despliegue: tickets, registros depurados, manuales operativos, escalamiento
Una cadena de soporte local se realiza en cinco pasos:
- Expurgo determinista : un script sustituye las direcciones IP, los nombres de host, los tokens y las direcciones de correo electrónico por identificadores neutros antes de enviar cualquier dato al modelo. La tabla de correspondencias permanece fuera del modelo.
- Búsqueda en los runbooks : los procedimientos se dividen y se indexan, luego el modelo recibe únicamente los fragmentos pertinentes con su referencia.
- Clasificación : el modelo devuelve un JSON con categoría, gravedad, hipótesis de causa y fuentes citadas.
- Regla de escalado : toda respuesta sin fuente, todo incidente de gravedad alta y toda acción que modifique la producción pasan a un técnico.
- Registro : cada intercambio se registra con la versión del modelo, la cuantización, el prompt y los fragmentos utilizados.
Para la interfaz de equipo, Open WebUI se conecta a un servidor local. La guía desplegar un chatbot de equipo en la intranet detalla la instalación y arquitectura de un agente local cubre las llamadas a herramientas.
FAQ
P: ¿Estos modelos funcionan en el equipo de un técnico?
No. El más ligero de la selección, Laguna S 2.1, requiere aproximadamente 68 GB en Q4, sin contar la memoria necesaria para el contexto. La configuración realista es un servidor compartido o una estación con 96-128 GB de memoria que el equipo consulta a través de la red interna. Para máquinas más modestas, el configurador del sitio propone modelos adaptados a la memoria disponible.
P: ¿Hay que ajustar el modelo con nuestros tickets?
No como primera medida. La búsqueda en los runbooks, con citas, ya proporciona el vocabulario y los procedimientos de la ESN sin reentrenamiento. El ajuste fino resulta útil si el formato de salida sigue siendo inestable o si el rendimiento de la categorización se estanca en tu conjunto de prueba. Requiere datos anonimizados y una verificación de la licencia del modelo.
P: ¿Puede el modelo depurar los registros por sí mismo?
No se recomienda. Un modelo puede pasar por alto una dirección IP o un token en un extracto largo. La eliminación de datos sensibles debe realizarse mediante un script determinista, probado y versionado, colocado antes del modelo. Este trabaja entonces con identificadores neutros, y la correspondencia con los valores reales permanece en un sistema separado.
P: ¿Puede el modelo cerrar un ticket solo?
Mejor evitarlo al inicio. El modelo propone una clasificación y una posible vía de resolución, y después un técnico valida la propuesta. Tras unas semanas de medición, pueden automatizarse ciertas categorías de bajo riesgo, por ejemplo, las solicitudes de documentación. Los incidentes de producción y las acciones que requieren privilegios siguen sujetos a validación humana.
P: ¿Qué contexto mínimo se busca para el análisis de logs?
Busca al menos 64 000 tokens, lo que ofrece Mixtral 8x22B Instruct, y preferiblemente 128 000 o más para correlacionar varios archivos. Los modelos con 32 768 tokens obligan a dividir los extractos en fragmentos mucho más pequeños. Un contexto amplio consume más memoria y ralentiza la generación: filtra los logs antes de enviarlos.
P: ¿Esta selección incluye el servicio de atención al cliente?
No. Se dirige al soporte IT interno de una ESN: incidentes, registros, runbooks y escalado. Los intercambios comerciales, los reembolsos y la traducción de conversaciones con clientes finales se rigen por otros criterios, especialmente la calidad multilingüe. Estos aspectos se tratan en la guía dedicada al soporte al cliente multilingüe con un LLM local.
Conclusión
Para una IA local de soporte informático en una ESN, Mistral Small 4 y Qwen 3.5 122B-A10B constituyen el punto de partida más seguro: licencia Apache 2.0, contexto de aproximadamente 256 000 tokens, 72 a 73 GB en Q4. Las velocidades de generación y las puntuaciones aún deben confirmarse en tu hardware y con tus propios tickets. Indica la memoria disponible en el configurador para verificar la compatibilidad, o visita el catálogo para comparar licencias y necesidades de VRAM.
El hardware para ejecutar un LLM localmente
Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:
Enlaces de afiliación — QuéLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.