Tres modelos, una máquina, pruebas
Piloto del 12 de septiembre de 2026 en RTX 5070 Ti Laptop: 12 227 MiB registrados, Ollama, contexto 4096, una consulta a la vez. Sin extrapolación a la versión desktop, a una RTX 5090 o a un Mac.
Las matrices antiguas de múltiples máquinas fueron retiradas por falta de artefactos que permitieran su verificación. Este documento publica las únicas mediciones de este piloto, con calentamiento seguido de cinco repeticiones por modelo.
| Modelo | Cuantización | Mediana de tok/s | Min–max | Código FR | Documentos en francés |
|---|---|---|---|---|---|
| qwen3:8b | Q4_K_M | 59.71 | 59.45–59.96 | Éxito | Contenido factual y formato correctos |
| hermes3:8b | Q4_0 | 71.97 | 71.79–72.15 | Fallo | Hechos exitosos, claves diferentes |
| mistral-nemo:12b | Q4_0 | 47.44 | 47.37–47.56 | Éxito | Contenido factual y formato correctos |
Lo que este test permite decir
Hermes3 genera más rápido en este test, pero su función no elimina correctamente los duplicados y ordena los valores. Qwen3 y Mistral Nemo resuelven correctamente este ejercicio. Una tasa de generación no demuestra por sí sola la calidad. Una tarea de código y una extracción sintética no son suficientes para clasificar los modelos para todos los usos; la salida de Hermes3 también alcanza el límite de 256 tokens.
Reproducir y examinar los datos
- Protocolo, parámetros y límites
- Respuestas completas y asignación de GPU — JSON bruto
- Todas las repeticiones — CSV
- Resultados, identificadores y cuantizaciones
- Hardware, versiones y estado inicial
- Script reproducible
- Dosier completo, entradas y salidas incluidas
El procesamiento del prompt y la generación están separados en los datos brutos. El caché del prefijo puede influir en el primero; la velocidad mostrada se refiere solo a la generación. No es una medida de energía ni la latencia total de la aplicación.
Tres tipos de datos
«Medido por QuelLLM» designa un experimento vinculado a sus artefactos. «Medición externa» debe identificar al autor y su protocolo. «Estimación» designa, en particular, las velocidades heurísticas y los presupuestos de memoria del configurador; estos valores no proceden de esta nueva prueba.
Metodología · Elegir según mi máquina · Instalar una IA local gratis