Medido por QuelLLM

Tres modelos, una máquina, pruebas

Piloto del 12 de septiembre de 2026 en RTX 5070 Ti Laptop: 12 227 MiB registrados, Ollama, contexto 4096, una consulta a la vez. Sin extrapolación a la versión desktop, a una RTX 5090 o a un Mac.

Las matrices antiguas de múltiples máquinas fueron retiradas por falta de artefactos que permitieran su verificación. Este documento publica las únicas mediciones de este piloto, con calentamiento seguido de cinco repeticiones por modelo.

ModeloCuantizaciónMediana de tok/sMin–maxCódigo FRDocumentos en francés
qwen3:8bQ4_K_M59.7159.45–59.96ÉxitoContenido factual y formato correctos
hermes3:8bQ4_071.9771.79–72.15FalloHechos exitosos, claves diferentes
mistral-nemo:12bQ4_047.4447.37–47.56ÉxitoContenido factual y formato correctos

Lo que este test permite decir

Hermes3 genera más rápido en este test, pero su función no elimina correctamente los duplicados y ordena los valores. Qwen3 y Mistral Nemo resuelven correctamente este ejercicio. Una tasa de generación no demuestra por sí sola la calidad. Una tarea de código y una extracción sintética no son suficientes para clasificar los modelos para todos los usos; la salida de Hermes3 también alcanza el límite de 256 tokens.

Reproducir y examinar los datos

El procesamiento del prompt y la generación están separados en los datos brutos. El caché del prefijo puede influir en el primero; la velocidad mostrada se refiere solo a la generación. No es una medida de energía ni la latencia total de la aplicación.

Tres tipos de datos

«Medido por QuelLLM» designa un experimento vinculado a sus artefactos. «Medición externa» debe identificar al autor y su protocolo. «Estimación» designa, en particular, las velocidades heurísticas y los presupuestos de memoria del configurador; estos valores no proceden de esta nueva prueba.

Metodología · Elegir según mi máquina · Instalar una IA local gratis