Hugging Face: ¿qué es y cómo usarlo? ?
Hugging Face es la plataforma donde se publican casi todos los modelos de IA abiertos: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. A menudo se describe como el GitHub del machine learning: el repositorio de donde provienen los archivos, incluidos los que Ollama y LM Studio descargan para ti. El Hub superó los tres millones de modelos públicos el 18 de agosto de 2026, sin ningún filtro editorial.
Hugging Face es la plataforma donde se publican casi todos los modelos de IA abiertos: Qwen, Llama, Gemma, Mistral, gpt-oss, DeepSeek. A menudo se describe como el GitHub del machine learning. Para quien ejecuta una IA en su propia máquina, es el almacén de donde provienen todos los archivos, incluidos los que Ollama y LM Studio descargan por ti. El Hub superó oficialmente los tres millones de modelos públicos el 18 de agosto de 2026, a un ritmo de aproximadamente 2.700 a 3.000 nuevos modelos al día, sin ningún filtro. Esta página te enseña a interpretarlo: qué repositorio abrir, qué archivo elegir para tu tarjeta gráfica y qué comprobar antes de hacer clic.
#Hugging Face, ¿qué es?
Hugging Face es una empresa fundada en 2016 por tres empresarios franceses, Clément Delangue, Julien Chaumond y Thomas Wolf, y establecida entre Nueva York y París, cuya sede social sigue en Estados Unidos. Empezó con una aplicación de chatbot dirigida a adolescentes, un proyecto hoy abandonado, de donde proviene el nombre tomado del emoji que sonríe con las manos abiertas. Posteriormente se centró en herramientas de código abierto para el aprendizaje automático: su biblioteca transformers se ha convertido en la forma casi estándar de cargar y ejecutar un modelo de lenguaje en Python, adoptada por la mayoría de los laboratorios de investigación y las empresas del sector. Finalmente, construyó el Hub, una plataforma de alojamiento basada en el sistema de control de versiones Git donde cualquiera puede publicar gratis modelos, conjuntos de datos y pequeñas demostraciones web, sin validación editorial previa.
Para la IA local, el Hub funciona como una tienda de aplicaciones, con dos diferencias: casi todo es gratuito y nada está seleccionado para ti. A diferencia de una tienda de aplicaciones tradicional, nadie prueba, aprueba ni clasifica los modelos antes de su publicación: cualquiera puede crear una cuenta gratuita y subir un repositorio en pocos minutos, sin validación ni control de calidad de ningún tipo. Esta ausencia total de filtros es a la vez la fortaleza del Hub —todo llega allí primero, a menudo incluso antes del anuncio oficial de un laboratorio— y su principal trampa para un principiante, que puede encontrarse con cientos de resultados de búsqueda sin saber cuál es fiable. Saber orientarse, distinguir un repositorio oficial de una copia de terceros y una conversión seria de un intento abandonado es la habilidad que hay que adquirir antes de descargar cualquier cosa.
#Las tres secciones del Hub
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
| Sección | Contenido | Interés por la IA local |
|---|---|---|
| Models | Archivos de pesos, configuración, documentación | Aquí se encuentra el archivo que vas a ejecutar |
| Datasets | Datos de entrenamiento y evaluación | Solo si realizas fine-tuning o pruebas |
| Spaces | Pequeñas aplicaciones web, normalmente demos | Probar un modelo en el navegador antes de descargar 15 GB |
#Leer una página de modelo
Cada modelo tiene una dirección de la forma huggingface.co/organisation/nom-du-modele, por ejemplo huggingface.co/Qwen/Qwen3-8B. Cuatro elementos distintos de esta página merecen tu atención antes de cualquier descarga.
- Nombre de la organización
- Qwen, google, meta-llama, mistralai, openai y deepseek-ai corresponden a los propios laboratorios, verificados. Cualquier otro nombre corresponde a un tercero: a veces excelente, pero nunca al original del laboratorio.
- La ficha del modelo (model card)
- El archivo README: qué es el modelo, cómo se ha entrenado, sus usos previstos, sus puntuaciones, su formato de prompt y sus limitaciones. La calidad varía: algunos son muy completos y otros están vacíos.
- La licencia
- Se muestra de forma destacada en la parte superior de la ficha, al lado del nombre del modelo. Ver la sección dedicada más abajo para saber qué permite realmente cada licencia habitual.
- La pestaña Files and versions
- La lista completa de archivos descargables. Un vistazo rápido basta para saber inmediatamente en qué tipo de repositorio te encuentras.
#¿Qué repositorio elegir: pesos originales o GGUF?
| Lo que ves en Files | Qué es | Para qué herramientas | Tamaño para un modelo 8B |
|---|---|---|---|
| model-00001-of-00004.safetensors… | Pesos originales, en BF16, divididos en varios archivos | transformers, vLLM, herramientas de fine-tuning | ≈ 16 GB |
| …-Q4_K_M.gguf, …-Q8_0.gguf | Conversiones cuantizadas, un solo archivo por nivel | Ollama, LM Studio, llama.cpp, KoboldCpp, Jan | ≈ 5 GB en Q4 |
| Repositorios …-AWQ, …-GPTQ, …-FP8 | Cuantización pensada para servidores GPU | vLLM y motores equivalentes | ≈ 5 a 9 GB |
| Repositorios …-MLX-4bit | Formato Apple Silicon | MLX, LM Studio en Mac | ≈ 5 GB |
Los laboratorios publican principalmente el primer tipo, los pesos originales tal como salen del entrenamiento. Los archivos GGUF que necesitan las aplicaciones de escritorio se generan por separado mediante convertidores: algunos laboratorios publican los suyos directamente, y colaboradores de la comunidad como bartowski, unsloth o la organización ggml-org cubren casi todo el resto, generalmente solo unas horas después de un lanzamiento muy esperado. Para encontrarlos sin buscar al azar, abre la página del modelo original y sigue el enlace Quantizations en el árbol del modelo, mostrado a la derecha de la página, o busca simplemente el nombre del modelo seguido de la palabra GGUF en la barra de búsqueda del Hub, que generalmente coloca las conversiones más descargadas al principio de la lista.
#Elegir el archivo correcto para tu tarjeta
Un repositorio GGUF suele ofrecer una decena larga de archivos para el mismo modelo, uno por cada nivel de cuantización disponible, desde el más comprimido hasta el más fiel. El tamaño del archivo corresponde, aproximadamente, a la VRAM que ocuparán los pesos una vez cargado el modelo en memoria. Mantén siempre entre 1 y 3 GB de VRAM libres para el contexto de la conversación y el margen de funcionamiento del sistema.
| Modelo | Q4_K_M | Q5_K_M | Q8_0 | BF16 | Tarjeta con margen suficiente en Q4 |
|---|---|---|---|---|---|
| Qwen 3 8B | 5 GB | 6 GB | 9 GB | 16 GB | 8 GB |
| Gemma 4 12B | 7 GB | 9 GB | 13 GB | 24 GB | 12 GB |
| Qwen 3 14B | 9 GB | 11 GB | 16 GB | 28 GB | 12 GB |
| gpt-oss 20B | 13 GB | 16 GB | 23 GB | 42 GB | 16 GB |
| Mistral Small 3.2 24B | 14 GB | 17 GB | 26 GB | 48 GB | 16 GB |
| Qwen 3.8 27B | 16 GB | 19 GB | 29 GB | 54 GB | 24 GB |
| Llama 3.3 70B | 40 GB | 48 GB | 75 GB | 140 GB | 2 × 24 GB |
- Q4, Q5, Q8 o FP16: elegir tu cuantización
- VRAM: conocer la tuya y saber qué permite
- Calculadora de VRAM
#Tres formas de descargar
La más sencilla consiste en dejar que tu herramienta se encargue. La búsqueda de LM Studio consulta directamente Hugging Face e indica qué archivos caben en tu máquina. Tanto Ollama como llama.cpp pueden descargar un repositorio GGUF por su nombre.
El filtro --include es importante: sin él, descargas todas las cuantizaciones del repositorio, a menudo más de 100 GB. La tercera opción es el navegador: pestaña Files and versions, flecha de descarga junto al archivo. Es práctico para un GGUF individual, pero no para los pesos originales divididos en varios archivos.
#Licencias: abierto no quiere decir sin condiciones
| Licencia | Ejemplos del catálogo | Uso comercial |
|---|---|---|
| Apache 2.0 | Familia Qwen 3, Gemma 4 12B, gpt-oss, Mistral Small 3.2 | Sí, con mención |
| MIT | Destilaciones de DeepSeek R1, GLM 4.7 Flash | Sí |
| Licencia Llama Community | Llama 3.3 70B | Sí bajo condiciones: reglas de nomenclatura, política de uso, umbral de usuarios |
| No comercial, investigación | Varias publicaciones de investigación | No |
La etiqueta mostrada en la ficha del modelo es la referencia en caso de duda, y un modelo derivado, ajustado mediante fine-tuning o fusionado a partir de otro suele heredar las obligaciones de su modelo base, incluso cuando el README del derivado no dice nada al respecto explícitamente. Para un despliegue en una empresa o en un producto comercial, esos dos minutos de lectura atenta de la licencia evitan construir toda una integración sobre un modelo cuyo uso comercial está en realidad restringido, un error frecuente y costoso de corregir a posteriori.
#¿Es seguro?
- Prefiere .safetensors y .gguf
- Son formatos de datos puros. Los archivos antiguos de PyTorch .bin y .pt se basan en el mecanismo pickle de Python, que puede ejecutar código al cargarlos. El Hub los señala con una advertencia.
- Ten cuidado con «trust remote code»
- Algunos repositorios, especialmente los de arquitecturas recientes que aún no están integradas en la biblioteca transformers, incluyen código Python personalizado para cuya ejecución el cargador solicita autorización explícita antes de continuar. Acepta esta autorización únicamente para organizaciones que reconozcas y en las que confíes: este código se ejecuta con los mismos permisos que el resto de tu programa Python, sin restricciones específicas.
- Mira quién publica
- El número de descargas acumuladas, la lista de otros repositorios publicados por la misma organización y un enlace al repositorio desde el sitio oficial del laboratorio son buenas señales de confianza. En el Hub, como en otros lugares de la web, existen cuentas que imitan a organizaciones conocidas usando un nombre parecido, con una errata o un guion bajo adicional: echar un vistazo al número de descargas y a la antigüedad de la cuenta suele bastar para detectarlas.
- El modelo permanece en tu dispositivo
- Una vez descargado, un GGUF ejecutado por llama.cpp o Ollama ya no realiza ninguna llamada de red a Hugging Face ni a ningún otro destinatario, a diferencia de un modelo utilizado a través de una API alojada en la nube. Tus prompts y tus datos nunca salen de tu máquina, un argumento fundamental de privacidad para quienes eligen la IA local en lugar de un servicio en línea.
- Documentación oficial del Hub Hugging Face
- El catálogo QuelLLM: 249 modelos ordenados por hardware
- Fuente: Wikipedia, historia de la empresa
- Fuente: anuncio oficial de la nueva CLI hf
#FAQ
¿Para qué sirve Hugging Face?+
¿Es gratuito Hugging Face?+
¿Es Hugging Face una empresa francesa?+
¿Se necesita una cuenta para descargar un modelo?+
¿Qué archivo descargar para Ollama o LM Studio?+
¿Aún se necesita usar huggingface-cli para descargar un modelo?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.