Principiante 11 minConceptos

Hugging Face: ¿qué es y cómo usarlo? ?

Respuesta directa

Hugging Face es la plataforma donde se publican casi todos los modelos de IA abiertos: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. A menudo se describe como el GitHub del machine learning: el repositorio de donde provienen los archivos, incluidos los que Ollama y LM Studio descargan para ti. El Hub superó los tres millones de modelos públicos el 18 de agosto de 2026, sin ningún filtro editorial.

Hugging Face es la plataforma donde se publican casi todos los modelos de IA abiertos: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. A menudo se describe como el GitHub del machine learning. Para quien ejecuta una IA en su propia máquina, es el almacén de donde provienen todos los archivos, incluidos los que Ollama y LM Studio descargan por ti. El Hub superó oficialmente los tres millones de modelos públicos el 18 de agosto de 2026, a un ritmo de aproximadamente 2.700 a 3.000 nuevos modelos al día, sin ningún filtro. Esta página te enseña a interpretarlo: qué repositorio abrir, qué archivo elegir para tu tarjeta gráfica y qué comprobar antes de hacer clic.

Por Mohamed Meguedmi·Actualización 2026-09-28·Probado en Windows, macOS y Linux

#Hugging Face, ¿qué es?

Hugging Face es una empresa fundada en 2016 por tres empresarios franceses, Clément Delangue, Julien Chaumond y Thomas Wolf, y establecida entre Nueva York y París, cuya sede social sigue en Estados Unidos. Empezó con una aplicación de chatbot dirigida a adolescentes, un proyecto hoy abandonado, de donde proviene el nombre tomado del emoji que sonríe con las manos abiertas. Posteriormente se centró en herramientas de código abierto para el aprendizaje automático: su biblioteca transformers se ha convertido en la forma casi estándar de cargar y ejecutar un modelo de lenguaje en Python, adoptada por la mayoría de los laboratorios de investigación y las empresas del sector. Finalmente, construyó el Hub, una plataforma de alojamiento basada en el sistema de control de versiones Git donde cualquiera puede publicar gratis modelos, conjuntos de datos y pequeñas demostraciones web, sin validación editorial previa.

Para la IA local, el Hub funciona como una tienda de aplicaciones, con dos diferencias: casi todo es gratuito y nada está seleccionado para ti. A diferencia de una tienda de aplicaciones tradicional, nadie prueba, aprueba ni clasifica los modelos antes de su publicación: cualquiera puede crear una cuenta gratuita y subir un repositorio en pocos minutos, sin validación ni control de calidad de ningún tipo. Esta ausencia total de filtros es a la vez la fortaleza del Hub —todo llega allí primero, a menudo incluso antes del anuncio oficial de un laboratorio— y su principal trampa para un principiante, que puede encontrarse con cientos de resultados de búsqueda sin saber cuál es fiable. Saber orientarse, distinguir un repositorio oficial de una copia de terceros y una conversión seria de un intento abandonado es la habilidad que hay que adquirir antes de descargar cualquier cosa.

#Las tres secciones del Hub

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida
SecciónContenidoInterés por la IA local
ModelsArchivos de pesos, configuración, documentaciónAquí se encuentra el archivo que vas a ejecutar
DatasetsDatos de entrenamiento y evaluaciónSolo si realizas fine-tuning o pruebas
SpacesPequeñas aplicaciones web, normalmente demosProbar un modelo en el navegador antes de descargar 15 GB

#Leer una página de modelo

Cada modelo tiene una dirección de la forma huggingface.co/organisation/nom-du-modele, por ejemplo huggingface.co/Qwen/Qwen3-8B. Cuatro elementos distintos de esta página merecen tu atención antes de cualquier descarga.

Nombre de la organización
Qwen, google, meta-llama, mistralai, openai y deepseek-ai corresponden a los propios laboratorios, verificados. Cualquier otro nombre corresponde a un tercero: a veces excelente, pero nunca al original del laboratorio.
La ficha del modelo (model card)
El archivo README: qué es el modelo, cómo se ha entrenado, sus usos previstos, sus puntuaciones, su formato de prompt y sus limitaciones. La calidad varía: algunos son muy completos y otros están vacíos.
La licencia
Se muestra de forma destacada en la parte superior de la ficha, al lado del nombre del modelo. Ver la sección dedicada más abajo para saber qué permite realmente cada licencia habitual.
La pestaña Files and versions
La lista completa de archivos descargables. Un vistazo rápido basta para saber inmediatamente en qué tipo de repositorio te encuentras.

#¿Qué repositorio elegir: pesos originales o GGUF?

Lo que ves en FilesQué esPara qué herramientasTamaño para un modelo 8B
model-00001-of-00004.safetensors…Pesos originales, en BF16, divididos en varios archivostransformers, vLLM, herramientas de fine-tuning≈ 16 GB
…-Q4_K_M.gguf, …-Q8_0.ggufConversiones cuantizadas, un solo archivo por nivelOllama, LM Studio, llama.cpp, KoboldCpp, Jan≈ 5 GB en Q4
Repositorios …-AWQ, …-GPTQ, …-FP8Cuantización pensada para servidores GPUvLLM y motores equivalentes≈ 5 a 9 GB
Repositorios …-MLX-4bitFormato Apple SiliconMLX, LM Studio en Mac≈ 5 GB

Los laboratorios publican principalmente el primer tipo, los pesos originales tal como salen del entrenamiento. Los archivos GGUF que necesitan las aplicaciones de escritorio se generan por separado mediante convertidores: algunos laboratorios publican los suyos directamente, y colaboradores de la comunidad como bartowski, unsloth o la organización ggml-org cubren casi todo el resto, generalmente solo unas horas después de un lanzamiento muy esperado. Para encontrarlos sin buscar al azar, abre la página del modelo original y sigue el enlace Quantizations en el árbol del modelo, mostrado a la derecha de la página, o busca simplemente el nombre del modelo seguido de la palabra GGUF en la barra de búsqueda del Hub, que generalmente coloca las conversiones más descargadas al principio de la lista.

#Elegir el archivo correcto para tu tarjeta

Un repositorio GGUF suele ofrecer una decena larga de archivos para el mismo modelo, uno por cada nivel de cuantización disponible, desde el más comprimido hasta el más fiel. El tamaño del archivo corresponde, aproximadamente, a la VRAM que ocuparán los pesos una vez cargado el modelo en memoria. Mantén siempre entre 1 y 3 GB de VRAM libres para el contexto de la conversación y el margen de funcionamiento del sistema.

Calculado a partir del catálogo QuelLLM · 20/09/2026 · tamaños redondeados al siguiente GB entero
ModeloQ4_K_MQ5_K_MQ8_0BF16Tarjeta con margen suficiente en Q4
Qwen 3 8B5 GB6 GB9 GB16 GB8 GB
Gemma 4 12B7 GB9 GB13 GB24 GB12 GB
Qwen 3 14B9 GB11 GB16 GB28 GB12 GB
gpt-oss 20B13 GB16 GB23 GB42 GB16 GB
Mistral Small 3.2 24B14 GB17 GB26 GB48 GB16 GB
Qwen 3.8 27B16 GB19 GB29 GB54 GB24 GB
Llama 3.3 70B40 GB48 GB75 GB140 GB2 × 24 GB

#Tres formas de descargar

La más sencilla consiste en dejar que tu herramienta se encargue. La búsqueda de LM Studio consulta directamente Hugging Face e indica qué archivos caben en tu máquina. Tanto Ollama como llama.cpp pueden descargar un repositorio GGUF por su nombre.

Desde Ollama o llama.cpp
# Ollama : lancer n'importe quel dépôt GGUF du Hub
ollama run hf.co/bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M

# llama.cpp : télécharger et servir
llama-server -hf bartowski/Qwen_Qwen3-8B-GGUF:Q4_K_M
Con la herramienta de línea de comandos
pip install -U huggingface_hub
hf download bartowski/Qwen_Qwen3-8B-GGUF --include "*Q4_K_M.gguf" --local-dir ./models

El filtro --include es importante: sin él, descargas todas las cuantizaciones del repositorio, a menudo más de 100 GB. La tercera opción es el navegador: pestaña Files and versions, flecha de descarga junto al archivo. Es práctico para un GGUF individual, pero no para los pesos originales divididos en varios archivos.

i
¿Un tutorial antiguo te habla de huggingface-cli?
Ignóralo: el comando huggingface-cli download está obsoleto y se ha eliminado por completo desde la versión 1.0 de la biblioteca huggingface_hub. Lo sustituye el comando más corto hf, que la propia Hugging Face presenta como «una CLI más rápida y más fácil de usar». La sustitución es mecánica: usa hf download allí donde el antiguo tutorial indicaba huggingface-cli download, con las mismas opciones.
i
Modelos con acceso condicional
Algunos laboratorios, entre ellos Meta para la familia Llama, exigen aceptar sus condiciones antes de la descarga. Crea una cuenta gratuita, haz clic en el botón de acceso de la página del modelo y después autentica una sola vez la herramienta de línea de comandos con hf auth login y un token creado en la configuración de la cuenta. Las conversiones GGUF comunitarias generalmente no están bloqueadas, pero la licencia original sigue siendo aplicable a tu uso.

#Licencias: abierto no quiere decir sin condiciones

Licencias registradas en el catálogo QuelLLM · 20/09/2026
LicenciaEjemplos del catálogoUso comercial
Apache 2.0Familia Qwen 3, Gemma 4 12B, gpt-oss, Mistral Small 3.2Sí, con mención
MITDestilaciones de DeepSeek R1, GLM 4.7 FlashSí
Licencia Llama CommunityLlama 3.3 70BSí bajo condiciones: reglas de nomenclatura, política de uso, umbral de usuarios
No comercial, investigaciónVarias publicaciones de investigaciónNo

La etiqueta mostrada en la ficha del modelo es la referencia en caso de duda, y un modelo derivado, ajustado mediante fine-tuning o fusionado a partir de otro suele heredar las obligaciones de su modelo base, incluso cuando el README del derivado no dice nada al respecto explícitamente. Para un despliegue en una empresa o en un producto comercial, esos dos minutos de lectura atenta de la licencia evitan construir toda una integración sobre un modelo cuyo uso comercial está en realidad restringido, un error frecuente y costoso de corregir a posteriori.

#¿Es seguro?

Prefiere .safetensors y .gguf
Son formatos de datos puros. Los archivos antiguos de PyTorch .bin y .pt se basan en el mecanismo pickle de Python, que puede ejecutar código al cargarlos. El Hub los señala con una advertencia.
Ten cuidado con «trust remote code»
Algunos repositorios, especialmente los de arquitecturas recientes que aún no están integradas en la biblioteca transformers, incluyen código Python personalizado para cuya ejecución el cargador solicita autorización explícita antes de continuar. Acepta esta autorización únicamente para organizaciones que reconozcas y en las que confíes: este código se ejecuta con los mismos permisos que el resto de tu programa Python, sin restricciones específicas.
Mira quién publica
El número de descargas acumuladas, la lista de otros repositorios publicados por la misma organización y un enlace al repositorio desde el sitio oficial del laboratorio son buenas señales de confianza. En el Hub, como en otros lugares de la web, existen cuentas que imitan a organizaciones conocidas usando un nombre parecido, con una errata o un guion bajo adicional: echar un vistazo al número de descargas y a la antigüedad de la cuenta suele bastar para detectarlas.
El modelo permanece en tu dispositivo
Una vez descargado, un GGUF ejecutado por llama.cpp o Ollama ya no realiza ninguna llamada de red a Hugging Face ni a ningún otro destinatario, a diferencia de un modelo utilizado a través de una API alojada en la nube. Tus prompts y tus datos nunca salen de tu máquina, un argumento fundamental de privacidad para quienes eligen la IA local en lugar de un servicio en línea.

#FAQ

¿Para qué sirve Hugging Face?+
Para publicar y descargar modelos de IA abiertos, conjuntos de datos y pequeñas demostraciones web. Para la IA local, es la fuente principal de los archivos de modelos, especialmente de las versiones GGUF cuantizadas que Ollama, LM Studio y llama.cpp cargan directamente, a menudo creadas por colaboradores de la comunidad pocas horas después del lanzamiento oficial de un modelo por parte del laboratorio que lo desarrolló.
¿Es gratuito Hugging Face?+
Consultar y descargar los modelos públicos es completamente gratuito y no requiere una cuenta, salvo para los modelos con acceso condicionado, para los que la cuenta sigue siendo gratuita. La empresa cobra en realidad por la inferencia alojada en sus servidores, la potencia de cálculo adicional para los Spaces, el almacenamiento de repositorios privados y sus ofertas dirigidas a empresas.
¿Es Hugging Face una empresa francesa?+
Fue fundada en 2016 por tres empresarios franceses, Clément Delangue, Julien Chaumond y Thomas Wolf, y mantiene un equipo importante en París, pero su sede social está en Nueva York, Estados Unidos. Es una de las pocas plataformas realmente importantes del mundo de la IA que tiene raíces francesas tan marcadas.
¿Se necesita una cuenta para descargar un modelo?+
No en la gran mayoría de los casos: consultar y descargar modelos públicos no requiere nada. Una cuenta gratuita y un token de acceso solo son necesarios para los modelos cuyo laboratorio exige la aceptación previa de sus condiciones de uso, como la familia Llama de Meta o algunos lanzamientos de Google.
¿Qué archivo descargar para Ollama o LM Studio?+
Un solo archivo .gguf procedente de un repositorio GGUF, generalmente la variante Q4_K_M para empezar, cuyo tamaño sea entre 1 y 3 GB menor que la memoria de tu tarjeta gráfica. Los archivos .safetensors divididos del repositorio original del laboratorio están destinados a frameworks Python como transformers y a motores de servidor como vLLM, no a aplicaciones de escritorio.
¿Aún se necesita usar huggingface-cli para descargar un modelo?+
No: este comando ha quedado obsoleto y se eliminó en la versión 1.0 de huggingface_hub. El comando actual, que Hugging Face presenta como más rápido y sencillo, se llama hf: hf download seguido del nombre del repositorio funciona exactamente allí donde un tutorial antiguo indicaba huggingface-cli download, con las mismas opciones de filtrado.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.