Mejor LLM para servicio al cliente en retail y e-commerce

Implementar una IA local para el comercio destinada a la atención al cliente consiste en ejecutar un LLM en tus propias máquinas para responder a los clientes de una tienda en línea sin enviar el catálogo, los pedidos ni las direcciones postales a un servicio externo. El modelo adecuado para esta IA local para el comercio no es el más grande ni el mejor clasificado en un benchmark generalista: es el que lee correctamente una ficha de producto, indica el estado correcto de un pedido, aplica la política de devoluciones al pie de la letra y deriva la atención a una persona cuando no sabe la respuesta. Este artículo detalla las cuatro tareas que hay que cubrir, propone una selección por nivel de hardware en el catálogo quelllm.fr, describe un protocolo para evaluar el anclaje a los datos y luego repasa las licencias y el despliegue antes de una sección de preguntas frecuentes.

Las cuatro tareas de un LLM de servicio al cliente en comercio electrónico

El alcance es deliberadamente limitado. El soporte multilingüe se trata en el guía dedicada al soporte multilingüe al cliente con ejecución local y el soporte informático interno no se aborda aquí. Quedan cuatro funciones que definen las especificaciones:

La capacidad que distingue a los modelos es, por tanto, elancrage : responder a partir de los datos proporcionados y rechazar la solicitud adecuadamente cuando falta información. La arquitectura recomendada (búsqueda documental, llamadas a herramientas, reglas de rechazo) se describe en el guía de arquitectura de agente local.

Selección para Mac de 128 GB y estaciones de trabajo con dos GPU (Q4 entre 68 y 75 GB)

Este nivel corresponde a un Mac Studio con 128 GB de memoria unificada o a una estación con una tarjeta profesional de 96 GB. Los modelos siguientes tienen arquitecturas de mezcla de expertos (MoE): pocos parámetros activos por token, lo que permite una velocidad de generación compatible con un chat en tiempo real pese al tamaño de los pesos. Todas las velocidades de generación son estimaciones derivadas del número de parámetros activos y del ancho de banda de la memoria, que deben confirmarse en tu máquina.

Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - Parámetros : 122B en total, aproximadamente 10B activos por token - VRAM Q4 : ~73 GB; Q5 ~88 GB (estimado); Q8 ~130 GB (estimado); FP16 ~245 GB (estimado) - Contexto : 262.000 tokens, más que suficientes para una política de devoluciones completa, un historial de conversación y unas diez fichas de producto - Velocidad de procesamiento : 30 a 45 tokens/s estimados en Mac Studio M4 Max 128 GB en Q4; 80 tokens/s y más estimados en una tarjeta de 96 GB con vLLM - ¿Por qué para el comercio electrónico? : la familia Qwen sigue bien las instrucciones de formato y las llamadas a herramientas, lo que es importante para los estados de los pedidos. Pesos publicados por Alibaba en Hugging Face.

Mistral Small 4 (Mistral, Apache 2.0) - Parámetros : 119B - VRAM Q4 : ~72 GB; Q8 ~127 GB (estimado); FP16 ~240 GB (estimado) - Contexto : 256 000 tokens - Velocidad de procesamiento : por confirmar según la cantidad de parámetros activos de la arquitectura; considera un orden de magnitud similar al anterior si el modelo es MoE - ¿Por qué para el comercio electrónico? : calidad del francés en la redacción para clientes, licencia Apache 2.0 sin cláusula comercial. Pesos publicados por Mistral en Hugging Face.

Qwen3.8 Flash Next 125B-A6B (Qwen, licencia de pesos abiertos, términos a verificar antes del uso comercial) - Parámetros : 125B en total, aproximadamente 6B activos - VRAM Q4 : ~72 GB ; Q8 ~133 GB (estimado) - Contexto : 256 000 tokens - Velocidad de procesamiento : el más rápido del nivel, 50 a 70 tokens/s estimados en Mac Studio 128 GB - ¿Por qué para el comercio electrónico? : latencia baja para un chat con mucho tráfico. Contrapartida: menos parámetros activos, por lo que hay que probarlo con cuidado con preguntas ambiguas.

Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB; Q8 ~136 GB (estimado) - Contexto : 256 000 tokens - ¿Por qué para el comercio electrónico? : alternativa a Mistral Small 4 cuando quieres un nivel adicional de razonamiento en casos de litigio, a costa de una menor velocidad de generación (por confirmar).

Para elegir la máquina, la página dedicada a los Mac de 128 GB enumera los modelos que realmente caben en memoria con espacio para el contexto.

Nivel de servidor: 140 GB y más

Si dispones de un servidor con varias tarjetas o de una máquina de 192 GB o más, tres modelos ofrecen una ventaja en calidad en casos complejos (reclamaciones en varias etapas, pedidos parcialmente enviados).

Los modelos por encima de 400 GB del catálogo (DeepSeek V4 Pro, Kimi K3, GLM 5.2) están fuera de alcance para un despliegue en tienda y no aportan un beneficio medible en tareas tan definidas.

Evaluar el anclaje y el rechazo: el protocolo que importa

Los benchmarks públicos (MMLU, HumanEval, AIME) miden la cultura general, el código o las matemáticas. Ninguno mide «¿ha inventado el modelo un plazo de devolución?». El Open LLM Leaderboard sirve para descartar un modelo débil, no para elegir uno para este caso de uso. Crea tu propio conjunto de pruebas; media jornada basta:

Para la capa de búsqueda documental, el guía Firecrawl y RAG local muestra cómo construir el índice del catálogo; el guía GraphRAG trata el caso de los catálogos con muchas relaciones entre productos.

Licencias y datos de clientes

Un servicio de atención al cliente maneja datos personales: nombre, dirección, historial de compras. El despliegue local elimina el envío a un subcontratista, pero dos puntos siguen por definir.

Despliegue: motor, interfaz, latencia objetivo

Le guía de despliegue de un chatbot para el equipo en una intranet abarca el despliegue paso a paso.

FAQ

P: ¿Qué modelo elegir para empezar con un Mac Studio 128 GB?

Qwen 3.5 122B-A10B en Q4 (~73 GB) es el punto de partida más equilibrado: licencia Apache 2.0, buenas llamadas a herramientas, velocidad estimada de 30 a 45 tokens/s. Si la latencia tiene prioridad sobre la fineza de las respuestas, Qwen3.8 Flash Next 125B-A6B es más rápido, pero requiere más pruebas con preguntas ambiguas. Ejecuta el protocolo de 50 preguntas con ambos antes de decidir.

P: ¿Bastaría un modelo más pequeño que uno de 100B para este caso de uso?

A menudo sí para la búsqueda en el catálogo y los estados de los pedidos, donde el modelo reformula principalmente datos proporcionados. La ventaja de los modelos de este nivel se aprecia en los casos ambiguos y los rechazos. El catálogo filtra por VRAM para comparar con modelos más ligeros; el protocolo de evaluación permanece el mismo.

P: ¿Cómo evitar que el modelo invente un plazo de entrega?

Tres capas: el estado procede siempre de una llamada a una herramienta, nunca de la memoria del modelo; el prompt del sistema impone «ninguna fecha sin resultado de herramienta»; una regla de la aplicación bloquea toda respuesta que contenga una fecha si no se ha realizado ninguna llamada. Mide después la tasa de invención en tus 20 preguntas sin respuesta: debe mantenerse por debajo del 2 %.

P: ¿Se necesita un contexto de 1.000.000 tokens para cargar todo el catálogo?

Raramente. Cargar un catálogo completo en cada mensaje multiplica la latencia de prellenado y el costo de memoria del caché. Una búsqueda que devuelva entre 5 y 10 fichas relevantes en un contexto de 8 000 a 16 000 tokens da mejores resultados y una respuesta más rápida. El contexto muy largo de DeepSeek V4 Flash se usa más bien para análisis puntuales.

P: ¿Qué diferencia hay con la guía sobre soporte multilingüe?

Esta comparativa se limita a tareas transaccionales en francés: catálogo, pedidos, devoluciones y derivación a un nivel superior de soporte. La guía de atención al cliente multilingüe trata la detección de idioma, la traducción y los conjuntos de pruebas por idioma. Ambos se combinan: elige el modelo aquí y añade después la capa multilingüe si tu tienda realiza entregas fuera del ámbito francófono.

P: ¿Cómo medir la tasa de procesamiento real en mi máquina?

Carga el modelo en Q4 con llama.cpp o vLLM, envía diez veces la misma conversación representativa con 8.000 tokens de contexto y registra los tokens/s durante la generación y el tiempo hasta el primer token. Las cifras de este artículo son estimaciones; las tuyas dependen del ancho de banda de la memoria, de la cuantización y del número de sesiones simultáneas. La página de benchmark local describe un método reproducible.

Conclusión

Una IA local para el comercio y la atención al cliente se evalúa por su fundamentación en la información disponible y su capacidad de rechazar solicitudes, no por una puntuación MMLU. En un Mac con 128 GB o una estación de trabajo con 96 GB, Qwen 3.5 122B-A10B y Mistral Small 4 cubren catálogo, pedidos, devoluciones y escalamiento con licencia Apache 2.0. Por encima de 140 GB, Qwen 3 235B-A22B y MiniMax-M2.7 añaden margen en casos complejos. Comprueba la compatibilidad con tu hardware en el configurador, luego valida el modelo seleccionado con tus propias 50 preguntas.

El hardware para ejecutar un LLM localmente

Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:

Darty RTX 5070 Ti →Amazon RTX 5070 Ti →

Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

Artículo publicado y actualizado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.