Mejor LLM para soporte técnico en empresas de servicios digitales (IT)

Implementar una IA local de soporte informático responde a una exigencia concreta de las empresas de servicios digitales (ESN): los tickets, los logs y los runbooks contienen datos de clientes sujetos a cláusulas de confidencialidad. Con una IA local de soporte informático, estos elementos permanecen en una máquina que tú controlas, y cada respuesta puede vincularse a una fuente.

Esta página trata únicamente del soporte informático interno: clasificación de tickets técnicos, lectura de logs con información sensible eliminada, búsqueda en runbooks, trazabilidad y escalamiento. El comercio, los reembolsos y la traducción de la atención al cliente se abordan en la guía atención al cliente multilingüe con un LLM local.

El plan: criterios de selección, elección de modelos, memoria por cuantización, tasa de generación y benchmarks, licencias y, después, cadena de despliegue.

Lo que el soporte informático de una ESN exige a un modelo

El soporte interno no requiere las mismas cualidades que un asistente generalista. Hay cuatro criterios que importan:

La selección: siete modelos entre 68 y 85 GB en Q4

Los modelos siguientes son los más ligeros del catálogo de referencia de esta página. Todos requieren un servidor o una estación con mucha memoria, no el ordenador de un técnico.

Dos modelos están limitados por su contexto de 32 768 tokens: dots.llm1 Instruct (142B, MIT, ~85 GB) y DBRX Instruct (132B, Databricks Open Model License, ~76 GB). Sirven para clasificar tickets, menos para analizar logs.

Para un equipo que disponga de más memoria, Step 3.5 Flash (196B, Apache 2.0, ~118 GB) y MiniMax-M2.7 (229B, Apache 2.0, ~138 GB) constituyen el siguiente nivel.

Memoria por cuantización y hardware

Solo los valores Q4 provienen del catálogo. Los demás niveles son estimaciones aproximadas calculadas mediante una regla de proporcionalidad, que deben confirmarse en cada ficha.

Para la clase 118B-128B:

Para Mixtral 8x22B Instruct (141B) :

Estos números no incluyen el contexto: cargar 100.000 tokens de logs añade varios GB de caché. Deja un margen de al menos un 15 a 20 % (estimado).

En cuanto a hardware, un Q4 de 72 GB cabe en una máquina con memoria unificada de 96 GB con poca margen, y de forma más cómoda en 128 GB. Las páginas Mac 96 GB et Mac 128 GB detallan estas configuraciones. En PC, hay que combinar varias tarjetas gráficas: ver la guía elegir una GPU para un LLM local.

Velocidad y benchmarks: lo que aún queda por confirmar

Aquí no se publica ninguna velocidad medida para estos siete modelos: los tokens/segundo deben confirmarse en tu hardware. Dos referencias cualitativas:

Para las puntuaciones de MMLU o HumanEval, consulta elOpen LLM Leaderboard y las fichas del catálogo. Estas puntuaciones deben confirmarse modelo por modelo y no evalúan bien el trabajo de soporte.

Un conjunto de pruebas interno es más fiable: 50 tickets cerrados y anonimizados, con la categoría, la gravedad y la resolución reales. Mide la tasa de categorización correcta, la tasa de citas exactas del runbook y el número de escalados injustificados. La página benchmark local describe el método de medición de la tasa de procesamiento.

Licencias: verificar antes de instalar en las instalaciones de un cliente

La guía LLM local en la empresa y RGPD complementa este punto en lo relativo a los datos personales presentes en los tickets.

Cadena de despliegue: tickets, registros depurados, manuales operativos, escalamiento

Una cadena de soporte local se realiza en cinco pasos:

  1. Expurgo determinista : un script sustituye las direcciones IP, los nombres de host, los tokens y las direcciones de correo electrónico por identificadores neutros antes de enviar cualquier dato al modelo. La tabla de correspondencias permanece fuera del modelo.
  2. Búsqueda en los runbooks : los procedimientos se dividen y se indexan, luego el modelo recibe únicamente los fragmentos pertinentes con su referencia.
  3. Clasificación : el modelo devuelve un JSON con categoría, gravedad, hipótesis de causa y fuentes citadas.
  4. Regla de escalado : toda respuesta sin fuente, todo incidente de gravedad alta y toda acción que modifique la producción pasan a un técnico.
  5. Registro : cada intercambio se registra con la versión del modelo, la cuantización, el prompt y los fragmentos utilizados.

Para la interfaz de equipo, Open WebUI se conecta a un servidor local. La guía desplegar un chatbot de equipo en la intranet detalla la instalación y arquitectura de un agente local cubre las llamadas a herramientas.

FAQ

P: ¿Estos modelos funcionan en el equipo de un técnico?

No. El más ligero de la selección, Laguna S 2.1, requiere aproximadamente 68 GB en Q4, sin contar la memoria necesaria para el contexto. La configuración realista es un servidor compartido o una estación con 96-128 GB de memoria que el equipo consulta a través de la red interna. Para máquinas más modestas, el configurador del sitio propone modelos adaptados a la memoria disponible.

P: ¿Hay que ajustar el modelo con nuestros tickets?

No como primera medida. La búsqueda en los runbooks, con citas, ya proporciona el vocabulario y los procedimientos de la ESN sin reentrenamiento. El ajuste fino resulta útil si el formato de salida sigue siendo inestable o si el rendimiento de la categorización se estanca en tu conjunto de prueba. Requiere datos anonimizados y una verificación de la licencia del modelo.

P: ¿Puede el modelo depurar los registros por sí mismo?

No se recomienda. Un modelo puede pasar por alto una dirección IP o un token en un extracto largo. La eliminación de datos sensibles debe realizarse mediante un script determinista, probado y versionado, colocado antes del modelo. Este trabaja entonces con identificadores neutros, y la correspondencia con los valores reales permanece en un sistema separado.

P: ¿Puede el modelo cerrar un ticket solo?

Mejor evitarlo al inicio. El modelo propone una clasificación y una posible vía de resolución, y después un técnico valida la propuesta. Tras unas semanas de medición, pueden automatizarse ciertas categorías de bajo riesgo, por ejemplo, las solicitudes de documentación. Los incidentes de producción y las acciones que requieren privilegios siguen sujetos a validación humana.

P: ¿Qué contexto mínimo se busca para el análisis de logs?

Busca al menos 64 000 tokens, lo que ofrece Mixtral 8x22B Instruct, y preferiblemente 128 000 o más para correlacionar varios archivos. Los modelos con 32 768 tokens obligan a dividir los extractos en fragmentos mucho más pequeños. Un contexto amplio consume más memoria y ralentiza la generación: filtra los logs antes de enviarlos.

P: ¿Esta selección incluye el servicio de atención al cliente?

No. Se dirige al soporte IT interno de una ESN: incidentes, registros, runbooks y escalado. Los intercambios comerciales, los reembolsos y la traducción de conversaciones con clientes finales se rigen por otros criterios, especialmente la calidad multilingüe. Estos aspectos se tratan en la guía dedicada al soporte al cliente multilingüe con un LLM local.

Conclusión

Para una IA local de soporte informático en una ESN, Mistral Small 4 y Qwen 3.5 122B-A10B constituyen el punto de partida más seguro: licencia Apache 2.0, contexto de aproximadamente 256 000 tokens, 72 a 73 GB en Q4. Las velocidades de generación y las puntuaciones aún deben confirmarse en tu hardware y con tus propios tickets. Indica la memoria disponible en el configurador para verificar la compatibilidad, o visita el catálogo para comparar licencias y necesidades de VRAM.

El hardware para ejecutar un LLM localmente

Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:

Amazon RTX 5070 Ti →

Enlaces de afiliación — QuéLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

Artículo publicado y actualizado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.