Principiante 10 minAudio

Kokoro TTS: una voz local convincente y ligera

Respuesta directa

Kokoro (hexgrad/Kokoro-82M, licencia Apache 2.0) es un modelo abierto de síntesis de voz de 82 millones de parámetros, basado en StyleTTS 2 e ISTFTNet. Ofrece 8 idiomas y 54 voces (incluido el francés), funciona más rápido que en tiempo real en un procesador y se entrenó exclusivamente con audio libre de derechos, sin posibilidad de clonación, ya que no se ha publicado ningún módulo de clonación. Coste observado mediante API: menos de 1 $ por millón de caracteres.

La mayoría de los buenos sistemas de síntesis de voz funcionan en la nube o requieren un hardware potente. Kokoro es un modelo abierto (repositorio hexgrad/Kokoro-82M, licencia Apache 2.0) de tamaño muy reducido que ofrece resultados convincentes y genera voz más rápido que en tiempo real en un ordenador corriente, incluso sin tarjeta gráfica. Su ficha técnica describe con una precisión poco habitual lo que contiene, incluida la procedencia de los datos de entrenamiento, lo que convierte a Kokoro en uno de los pocos modelos de voz cuyas afirmaciones se pueden verificar una por una, en lugar de aceptarlas sin más.

Por Mohamed Meguedmi·Actualización 2026-09-28·Probado en Windows, macOS y Linux

#Por qué un modelo pequeño cambia el cálculo

La calidad de la síntesis de voz ya no es el problema desde hace tiempo; el coste y dónde se procesa, sí. Las voces en línea suenan muy bien, pero implican que cada frase pronunciada por tu sistema se envíe a un proveedor y se facture según el uso. Los modelos locales grandes suenan bien y ocupan una tarjeta gráfica que preferirías dedicar a tu modelo de lenguaje en lugar de a la voz que lo hace hablar.

Un modelo lo bastante pequeño como para ejecutarse en un segundo en un procesador elimina las dos restricciones de golpe. Leer un documento largo en voz alta deja de ser una decisión presupuestaria. Un asistente puede pronunciar todas sus respuestas en lugar de solo las importantes. Un procesamiento por lotes puede narrar cien archivos durante la noche con el hardware que ya posees, sin enviar nada a terceros ni esperar a disponer de cuota ni vigilar una factura que crece con el volumen procesado.

#El modelo, en cifras verificadas

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
82 millones de parámetros
Un orden de magnitud por debajo de los modelos con los que se suele comparar.
Arquitectura StyleTTS 2 + ISTFTNet
Un diseño basado únicamente en un decodificador, sin difusión, lo que explica en parte su ligereza.
8 idiomas, 54 voces (v1.0)
Publicada el 27 de enero de 2025, entrenada con unos cientos de horas de audio.
Costo total de entrenamiento: aproximadamente 1.000 $
1.000 horas de cálculo en GPU A100 de 80 GB en total, un presupuesto minúsculo para este resultado en comparación con los modelos competidores.
Datos exclusivamente libres de derechos
Audio del dominio público, bajo licencias permisivas, o audio sintético de proveedores comerciales cerrados — explícitamente nunca voz clonada no autorizada ni audio de otro modelo abierto.

Este último punto merece destacarse: la ficha del modelo es explícita sobre la procedencia de los datos, algo poco habitual en este ámbito. Es una de las razones por las que Kokoro puede desplegarse sin la incertidumbre jurídica que rodea a los modelos entrenados con voces obtenidas o clonadas sin consentimiento, un aspecto especialmente relevante para un proyecto dirigido al gran público en Francia, donde se toma en serio el derecho a la propia imagen aplicado a la voz. En su lanzamiento, Kokoro ocupó el primer puesto de la clasificación comunitaria TTS Spaces Arena, por delante de modelos mucho más grandes: XTTS v2 (467 millones de parámetros), MetaVoice (1,2 mil millones) y Fish Speech (unos 500 millones) fueron superados por un modelo de 82 millones. Es una clasificación correspondiente a un momento concreto, no una garantía universal, pero sí un indicio sólido de la relación calidad/tamaño para quien necesita elegir rápidamente sin ejecutar diez modelos en paralelo.

#Lo que hace y lo que no hace

Capacidades reales
CapacidadKokoro
Prosodia natural en prosa corrienteSólido para su tamaño
Voces predefinidas54 voces distribuidas en 8 idiomas, incluido el francés (fr-fr)
Clonación de voz a partir de una muestraNo es su objetivo: no se ha publicado ningún módulo de clonado con los pesos
Control preciso de la expresión emocionalLimitada
VelocidadMás rápido que el tiempo real en hardware modesto
Funcionamiento offlineSí, una vez descargados los pesos mediante pip install kokoro

La formulación honesta: es un muy buen lector, no un actor. Para narración, notificaciones, un asistente o accesibilidad, es más que suficiente. Para un trabajo de interpretación en el que importe una intención precisa, necesitarás una herramienta que puedas dirigir con mayor precisión. En cuanto al presupuesto, la tarifa observada por API ronda 1 $ por millón de caracteres de entrada —aproximadamente mil caracteres para un minuto de audio generado—, una referencia útil incluso en local para comparar con el coste real de una suscripción equivalente en la nube a lo largo del tiempo.

#Su lugar en una cadena local

  1. 01
    La voz entra
    Un modelo de transcripción convierte la voz del usuario en texto; Faster-Whisper cubre bien este paso, incluso sin GPU.
  2. 02
    El modelo piensa
    Un modelo local, servido por Ollama u otro motor, produce la respuesta.
  3. 03
    La voz se escucha
    Kokoro lee la respuesta mediante el paquete Python kokoro, que se basa en la biblioteca de fonetización misaki y en espeak-ng como alternativa para ciertas palabras que no están en el diccionario.

El presupuesto de latencia siempre debe considerarse en su conjunto: el usuario percibe el total —transcripción, luego generación, luego síntesis—. La síntesis suele ser la menos costosa de las tres etapas, lo que significa que la capacidad de respuesta percibida de un asistente vocal está determinada ante todo por la velocidad de tu modelo de lenguaje, no por la voz que lee la respuesta final.

→
Reproduce la voz a medida que llega el texto
Esperar a que la respuesta sea completa antes de empezar a hablar desperdicia los segundos que el modelo ha invertido en producirla. Sintetizar frase por frase mientras llega el texto hace que el sistema sea espectacularmente más ágil sin ser más rápido.

#Tres usos concretos en francés

La voz fr-fr de Kokoro permite utilizar el modelo directamente para un público francófono, sin recurrir a una voz inglesa con un acento inadecuado ni a un servicio de terceros que cobre por uso. Tres casos son los más frecuentes en los proyectos que lo adoptan.

Lectura de documentos largos
Informes, artículos, notas de seguimiento: narrar un documento de varias páginas ya no cuesta más que un poco de tiempo de procesador, en lugar de una suscripción a una API facturada por carácter.
Asistente de voz doméstico o profesional
Combinado con Whisper para la escucha y con un LLM local para la reflexión, Kokoro cierra el bucle sin que ninguna conversación abandone la red local.
Accesibilidad y notificaciones
Lectura de pantalla, alertas de voz, confirmación de acciones: usos en los que la latencia y la disponibilidad sin conexión importan más que los matices de la interpretación.

En los tres casos, la lógica presupuestaria cambia: en lugar de un coste por carácter facturado en cada llamada, el gasto pasa a ser la electricidad y el tiempo de procesador de una máquina que ya tienes. Cuando se lee en voz alta un gran volumen de texto —desde el seguimiento documental diario hasta un servicio de atención al cliente por voz—, la diferencia aumenta rápidamente a favor de la ejecución local, sobre todo porque la generación sigue siendo más rápida que el tiempo real incluso sin una tarjeta gráfica dedicada.

#Kokoro o Piper

Dos prioridades diferentes
KokoroPiper
Calidad de salidaMejor, prosodia más naturalBueno, más plano
Tamaño82 millones de parámetros, un solo modeloMuy pequeño, un modelo ONNX por voz (VITS)
Velocidad en el procesadorRápidoExtremadamente rápido, diseñado para hardware con recursos muy limitados
Cobertura lingüística8 idiomas, 54 voces (v1.0)44 idiomas/configuraciones regionales en la lista oficial de voces
LicenciaApache 2.0, una única licencia para todas las vocesGPL-3.0 en el repositorio activo; MIT en el repositorio anterior, ahora archivado
Cuándo elegirloLa calidad primaLa huella, la latencia o una voz de una configuración regional específica tienen prioridad

Conviene comprobar la licencia de Piper antes de comprometerse: el repositorio histórico rhasspy/piper, bajo licencia MIT, está ahora archivado y es de solo lectura. El desarrollo activo se ha trasladado a OHF-Voice/piper1-gpl, mantenido por la Open Home Foundation bajo licencia GPL-3.0: una diferencia real para el uso comercial respecto a los tutoriales que aún citan la licencia MIT del antiguo repositorio. La documentación oficial de Piper añade que algunas voces individuales pueden tener licencias más restrictivas que la del motor: hay que comprobarlas voz por voz, no solo a nivel del proyecto. La arquitectura de Piper sigue siendo distinta de la de Kokoro: cada voz es un modelo VITS independiente exportado a ONNX, con un archivo .onnx y un archivo de configuración .onnx.json, mientras que Kokoro ofrece sus 54 voces a partir de un único conjunto de pesos compartido.

#Licencia y ética

Dos cuestiones determinan si puedes utilizar un modelo de síntesis de voz en tu proyecto, y solo una es técnica. La primera es la licencia de los pesos y las voces, que regula el uso comercial: para Kokoro, es Apache 2.0, una licencia permisiva y sin ambigüedades que cubre las 54 voces en conjunto; no es el caso de todos los motores, y Piper es el ejemplo más cercano con su reciente paso a GPL-3.0. La segunda es que un modelo con voces predefinidas evita por completo la cuestión del consentimiento, mientras que clonar la voz de alguien a partir de una muestra requiere su autorización y conlleva, en un número creciente de jurisdicciones, consecuencias jurídicas. La ficha de Kokoro es explícita: no se ha publicado ningún módulo de clonación junto con los pesos, lo que excluye este uso por diseño en lugar de hacerlo mediante una simple política de uso.

Para un proyecto francés, esta combinación simplifica mucho las cosas: no hay que negociar un contrato de licencia de voz ni obtener el consentimiento de una persona real, y la licencia Apache 2.0 no plantea dudas sobre la reventa o la integración en un producto de pago. El único aspecto que queda por comprobar es puramente técnico: verificar que la voz francesa elegida suene bien al leer los textos reales del proyecto, incluidos los acentos y las siglas, antes de desplegarla a gran escala.

#FAQ

¿Se puede usar Kokoro con fines comerciales?+
Sí. Kokoro-82M está publicado bajo licencia Apache 2.0, una de las licencias abiertas más permisivas, y su ficha afirma que «puede desplegarse en cualquier lugar, desde un entorno de producción hasta un proyecto personal». No se exigen regalías ni atribución más allá de los términos estándar de Apache, y esto cubre las 54 voces en su conjunto.
¿Se necesita una tarjeta gráfica?+
No. Sus 82 millones de parámetros hacen que la generación en el procesador sea viable, generalmente más rápida que en tiempo real con hardware corriente. Una GPU ayuda a procesar grandes volúmenes por lotes, pero no es necesaria para un uso interactivo en un asistente de voz.
¿Puede clonar mi voz?+
No, y es una decisión de diseño asumida: la ficha del modelo confirma que no se ha publicado ningún módulo de clonado con los pesos. Ofrece 54 voces predefinidas en 8 idiomas en su lugar. El clonado pertenece a otra clase de modelos y plantea cuestiones de consentimiento que las voces predefinidas evitan completamente.
¿Kokoro o Piper?+
Kokoro para un resultado más natural con 82 millones de parámetros; Piper cuando primen el mínimo consumo de recursos y la latencia más baja, normalmente en hardware embebido. Ambos funcionan completamente sin conexión, pero revisa la licencia: Kokoro está bajo Apache 2.0, mientras que la versión de Piper que se mantiene activamente ha pasado a GPL-3.0.
¿Qué idiomas son compatibles y está el francés entre ellos?+
Sí: la versión 1.0 cubre 8 idiomas y 54 voces, incluyendo inglés americano y británico, español, francés, hindí, italiano, japonés, portugués brasileño y mandarín. Verifica la disponibilidad exacta de voces por idioma en el archivo VOICES.md del modelo antes de elegir una voz específica.
¿De dónde vienen los datos de entrenamiento de Kokoro?+
De unos cientos de horas de audio, exclusivamente de dominio público, con licencia permisiva o de audio sintético generado por proveedores comerciales cerrados; explícitamente, nunca de audio procedente de otro modelo abierto ni de una voz clonada sin autorización, según la declaración de procedencia publicada en la ficha del modelo.
¿Cuál es el costo real en comparación con una API en la nube?+
En local, el único gasto recurrente es la electricidad, para un modelo de 82 millones de parámetros que se ejecuta en unos segundos en la CPU. Como referencia, el precio observado en el mercado para Kokoro ofrecido mediante una API ronda 1 $ por millón de caracteres; esta cifra sirve como referencia útil antes de elegir entre el autoalojamiento y un servicio de terceros.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.