Mejor LLM para servicio al cliente en retail y e-commerce
Implementar una IA local para el comercio destinada a la atención al cliente consiste en ejecutar un LLM en tus propias máquinas para responder a los clientes de una tienda en línea sin enviar el catálogo, los pedidos ni las direcciones postales a un servicio externo. El modelo adecuado para esta IA local para el comercio no es el más grande ni el mejor clasificado en un benchmark generalista: es el que lee correctamente una ficha de producto, indica el estado correcto de un pedido, aplica la política de devoluciones al pie de la letra y deriva la atención a una persona cuando no sabe la respuesta. Este artículo detalla las cuatro tareas que hay que cubrir, propone una selección por nivel de hardware en el catálogo quelllm.fr, describe un protocolo para evaluar el anclaje a los datos y luego repasa las licencias y el despliegue antes de una sección de preguntas frecuentes.
Las cuatro tareas de un LLM de servicio al cliente en comercio electrónico
El alcance es deliberadamente limitado. El soporte multilingüe se trata en el guía dedicada al soporte multilingüe al cliente con ejecución local y el soporte informático interno no se aborda aquí. Quedan cuatro funciones que definen las especificaciones:
- Búsqueda en el catálogo de productos : el modelo recibe un extracto del catálogo (fichas de producto, existencias, variantes, precios) a través de un sistema de búsqueda y debe responder únicamente a partir de ese extracto. Una talla de ropa inventada o una compatibilidad de un accesorio deducida sin comprobar provoca una devolución.
- Estado de pedido : el modelo llama a una herramienta (función) que consulta tu base de pedidos y reformula el resultado. Nunca debe generar un número de seguimiento ni una fecha de entrega que no provenga de esa llamada.
- Política de devolución y reembolso : el texto de la política se proporciona en el contexto. El modelo debe citar los plazos y condiciones exactos, incluyendo las exclusiones, y no redondear «14 días» a «aproximadamente dos semanas».
- Derivación a un agente humano : en cuanto una solicitud quede fuera del ámbito previsto (reclamación, compensación comercial, dato ausente), el modelo debe generar una respuesta de derivación y un resumen estructurado para el agente humano.
La capacidad que distingue a los modelos es, por tanto, elancrage : responder a partir de los datos proporcionados y rechazar la solicitud adecuadamente cuando falta información. La arquitectura recomendada (búsqueda documental, llamadas a herramientas, reglas de rechazo) se describe en el guía de arquitectura de agente local.
Selección para Mac de 128 GB y estaciones de trabajo con dos GPU (Q4 entre 68 y 75 GB)
Este nivel corresponde a un Mac Studio con 128 GB de memoria unificada o a una estación con una tarjeta profesional de 96 GB. Los modelos siguientes tienen arquitecturas de mezcla de expertos (MoE): pocos parámetros activos por token, lo que permite una velocidad de generación compatible con un chat en tiempo real pese al tamaño de los pesos. Todas las velocidades de generación son estimaciones derivadas del número de parámetros activos y del ancho de banda de la memoria, que deben confirmarse en tu máquina.
Qwen 3.5 122B-A10B (Alibaba, Apache 2.0) - Parámetros : 122B en total, aproximadamente 10B activos por token - VRAM Q4 : ~73 GB; Q5 ~88 GB (estimado); Q8 ~130 GB (estimado); FP16 ~245 GB (estimado) - Contexto : 262.000 tokens, más que suficientes para una política de devoluciones completa, un historial de conversación y unas diez fichas de producto - Velocidad de procesamiento : 30 a 45 tokens/s estimados en Mac Studio M4 Max 128 GB en Q4; 80 tokens/s y más estimados en una tarjeta de 96 GB con vLLM - ¿Por qué para el comercio electrónico? : la familia Qwen sigue bien las instrucciones de formato y las llamadas a herramientas, lo que es importante para los estados de los pedidos. Pesos publicados por Alibaba en Hugging Face.
Mistral Small 4 (Mistral, Apache 2.0) - Parámetros : 119B - VRAM Q4 : ~72 GB; Q8 ~127 GB (estimado); FP16 ~240 GB (estimado) - Contexto : 256 000 tokens - Velocidad de procesamiento : por confirmar según la cantidad de parámetros activos de la arquitectura; considera un orden de magnitud similar al anterior si el modelo es MoE - ¿Por qué para el comercio electrónico? : calidad del francés en la redacción para clientes, licencia Apache 2.0 sin cláusula comercial. Pesos publicados por Mistral en Hugging Face.
Qwen3.8 Flash Next 125B-A6B (Qwen, licencia de pesos abiertos, términos a verificar antes del uso comercial) - Parámetros : 125B en total, aproximadamente 6B activos - VRAM Q4 : ~72 GB ; Q8 ~133 GB (estimado) - Contexto : 256 000 tokens - Velocidad de procesamiento : el más rápido del nivel, 50 a 70 tokens/s estimados en Mac Studio 128 GB - ¿Por qué para el comercio electrónico? : latencia baja para un chat con mucho tráfico. Contrapartida: menos parámetros activos, por lo que hay que probarlo con cuidado con preguntas ambiguas.
Mistral Medium 3.5 128B (Mistral, Modified MIT) - VRAM Q4 : ~74 GB; Q8 ~136 GB (estimado) - Contexto : 256 000 tokens - ¿Por qué para el comercio electrónico? : alternativa a Mistral Small 4 cuando quieres un nivel adicional de razonamiento en casos de litigio, a costa de una menor velocidad de generación (por confirmar).
Para elegir la máquina, la página dedicada a los Mac de 128 GB enumera los modelos que realmente caben en memoria con espacio para el contexto.
Nivel de servidor: 140 GB y más
Si dispones de un servidor con varias tarjetas o de una máquina de 192 GB o más, tres modelos ofrecen una ventaja en calidad en casos complejos (reclamaciones en varias etapas, pedidos parcialmente enviados).
- Qwen 3 235B-A22B (Alibaba, Apache 2.0): ~142 GB en Q4, ~250 GB en Q8 (estimado), 131.072 tokens de contexto, aproximadamente 22B activos. Una opción fiable para llamadas a herramientas en secuencia.
- MiniMax-M2.7 (MiniMax, Apache 2.0): ~138 GB en Q4, 205 000 tokens de contexto. Orientado a agentes, útil cuando el servicio al cliente encadena una búsqueda en el catálogo y una actualización de un ticket.
- DeepSeek V4 Flash 284B (DeepSeek, MIT): ~170 GB en Q4, contexto de 1 000 000 tokens. El contexto muy largo permite cargar un catálogo completo de varios miles de referencias sin búsqueda previa, pero la latencia de prellenado aumenta proporcionalmente. Pesos publicados por DeepSeek en Hugging Face. La elección entre Flash y Pro se detalla en el comparativa DeepSeek V4 Pro vs Flash.
- GLM 5.3 Flash 320B-A18B (Zhipu, MIT): ~186 GB en Q4, 128 000 tokens, 18B activos. Pesos publicados por Zhipu en Hugging Face.
Los modelos por encima de 400 GB del catálogo (DeepSeek V4 Pro, Kimi K3, GLM 5.2) están fuera de alcance para un despliegue en tienda y no aportan un beneficio medible en tareas tan definidas.
Evaluar el anclaje y el rechazo: el protocolo que importa
Los benchmarks públicos (MMLU, HumanEval, AIME) miden la cultura general, el código o las matemáticas. Ninguno mide «¿ha inventado el modelo un plazo de devolución?». El Open LLM Leaderboard sirve para descartar un modelo débil, no para elegir uno para este caso de uso. Crea tu propio conjunto de pruebas; media jornada basta:
- 50 preguntas en tres categorías : 20 cuya respuesta está en los datos proporcionados, 20 cuya respuesta no está en ellos, 10 ambiguas (producto que existe en dos variantes, pedido con dos paquetes).
- Contexto idéntico para todos los modelos : mismas fichas de producto, misma política de devolución, misma salida simulada de la herramienta de pedidos.
- Tres métricas : exactitud en las preguntas presentes; tasa de rechazo correcto en las preguntas ausentes («no tengo esta información, te paso con un asesor»); tasa de respuestas inventadas, es decir, respuestas expresadas con seguridad sin respaldo en el contexto.
- Umbral de aceptación : una tasa de respuestas inventadas superior al 2 % en las preguntas ausentes descalifica al modelo, independientemente de su calidad en otros aspectos. Un cliente que recibe una fecha de entrega falsa genera un ticket, una reclamación y, a veces, una reseña negativa.
- Prueba del prompt de sistema : agrega la instrucción explícita «si la información no está en el contexto, responde que no sabes y propón una transferencia». Compara antes y después. Los modelos mencionados anteriormente suelen responder bien a esta instrucción, pero la diferencia entre ellos se ve especialmente en preguntas ambiguas.
Para la capa de búsqueda documental, el guía Firecrawl y RAG local muestra cómo construir el índice del catálogo; el guía GraphRAG trata el caso de los catálogos con muchas relaciones entre productos.
Licencias y datos de clientes
Un servicio de atención al cliente maneja datos personales: nombre, dirección, historial de compras. El despliegue local elimina el envío a un subcontratista, pero dos puntos siguen por definir.
- Licencia del modelo : Apache 2.0 (Qwen 3.5, Mistral Small 4, Qwen 3 235B, MiniMax-M2.7) y MIT (DeepSeek V4 Flash, GLM 5.3 Flash) permiten el uso comercial sin condiciones de volumen. La licencia Modified MIT de Mistral Medium 3.5 y la licencia «otra» de Qwen3.8 Flash Next requieren leer su texto antes de la puesta en producción. La NVIDIA Open Model License de Nemotron 3 Super 120B incluye sus propias cláusulas.
- Registro : conserva las conversaciones para la evaluación, pero con un plazo de retención definido y una seudonimización de los identificadores de pedido. La guía de LLM locales en empresas y RGPD detalla el registro de actividades de tratamiento.
Despliegue: motor, interfaz, latencia objetivo
- Motor de inferencia : llama.cpp para un Mac Studio o una estación de un solo usuario en GGUF; vLLM en cuanto varios clientes conversan en paralelo, ya que el procesamiento por lotes multiplica la tasa global de generación en una misma tarjeta.
- Interfaz y herramientas : Open WebUI proporciona una interfaz de prueba y la gestión de herramientas (funciones) para conectar tu API de pedidos. En producción, la integración suele hacerse en tu widget de chat existente mediante la API compatible con OpenAI que expone el motor.
- Contexto que reservar : calcula entre 8.000 y 16.000 tokens por conversación (política de devoluciones, de 5 a 10 fichas de producto, historial). En un Mac de 128 GB con un modelo Q4 de 73 GB, queda margen para varias sesiones simultáneas.
- Latencia objetivo : primer token en menos de 2 segundos, respuesta completa en menos de 10 segundos. Los modelos MoE del nivel de 72 GB cumplen este objetivo; los modelos densos de tamaño similar, no.
Le guía de despliegue de un chatbot para el equipo en una intranet abarca el despliegue paso a paso.
FAQ
P: ¿Qué modelo elegir para empezar con un Mac Studio 128 GB?
Qwen 3.5 122B-A10B en Q4 (~73 GB) es el punto de partida más equilibrado: licencia Apache 2.0, buenas llamadas a herramientas, velocidad estimada de 30 a 45 tokens/s. Si la latencia tiene prioridad sobre la fineza de las respuestas, Qwen3.8 Flash Next 125B-A6B es más rápido, pero requiere más pruebas con preguntas ambiguas. Ejecuta el protocolo de 50 preguntas con ambos antes de decidir.
P: ¿Bastaría un modelo más pequeño que uno de 100B para este caso de uso?
A menudo sí para la búsqueda en el catálogo y los estados de los pedidos, donde el modelo reformula principalmente datos proporcionados. La ventaja de los modelos de este nivel se aprecia en los casos ambiguos y los rechazos. El catálogo filtra por VRAM para comparar con modelos más ligeros; el protocolo de evaluación permanece el mismo.
P: ¿Cómo evitar que el modelo invente un plazo de entrega?
Tres capas: el estado procede siempre de una llamada a una herramienta, nunca de la memoria del modelo; el prompt del sistema impone «ninguna fecha sin resultado de herramienta»; una regla de la aplicación bloquea toda respuesta que contenga una fecha si no se ha realizado ninguna llamada. Mide después la tasa de invención en tus 20 preguntas sin respuesta: debe mantenerse por debajo del 2 %.
P: ¿Se necesita un contexto de 1.000.000 tokens para cargar todo el catálogo?
Raramente. Cargar un catálogo completo en cada mensaje multiplica la latencia de prellenado y el costo de memoria del caché. Una búsqueda que devuelva entre 5 y 10 fichas relevantes en un contexto de 8 000 a 16 000 tokens da mejores resultados y una respuesta más rápida. El contexto muy largo de DeepSeek V4 Flash se usa más bien para análisis puntuales.
P: ¿Qué diferencia hay con la guía sobre soporte multilingüe?
Esta comparativa se limita a tareas transaccionales en francés: catálogo, pedidos, devoluciones y derivación a un nivel superior de soporte. La guía de atención al cliente multilingüe trata la detección de idioma, la traducción y los conjuntos de pruebas por idioma. Ambos se combinan: elige el modelo aquí y añade después la capa multilingüe si tu tienda realiza entregas fuera del ámbito francófono.
P: ¿Cómo medir la tasa de procesamiento real en mi máquina?
Carga el modelo en Q4 con llama.cpp o vLLM, envía diez veces la misma conversación representativa con 8.000 tokens de contexto y registra los tokens/s durante la generación y el tiempo hasta el primer token. Las cifras de este artículo son estimaciones; las tuyas dependen del ancho de banda de la memoria, de la cuantización y del número de sesiones simultáneas. La página de benchmark local describe un método reproducible.
Conclusión
Una IA local para el comercio y la atención al cliente se evalúa por su fundamentación en la información disponible y su capacidad de rechazar solicitudes, no por una puntuación MMLU. En un Mac con 128 GB o una estación de trabajo con 96 GB, Qwen 3.5 122B-A10B y Mistral Small 4 cubren catálogo, pedidos, devoluciones y escalamiento con licencia Apache 2.0. Por encima de 140 GB, Qwen 3 235B-A22B y MiniMax-M2.7 añaden margen en casos complejos. Comprueba la compatibilidad con tu hardware en el configurador, luego valida el modelo seleccionado con tus propias 50 preguntas.
El hardware para ejecutar un LLM localmente
Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:
Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.