Modelos abliterated (sin censura) en local: guía pratique
Los modelos de pesos abiertos como Qwen, Gemma o Mistral han sido alineados para rechazar ciertas solicitudes. Un modelo abliterated es una variante en la que este comportamiento de rechazo se ha eliminado quirúrgicamente a nivel de los pesos —no mediante un jailbreak por prompt, sino editando la red—. Esta guía explica qué hace realmente esta técnica, dónde encontrar estos modelos, cómo ejecutarlos en local con Ollama o en formato GGUF y cuáles son sus verdaderas limitaciones.
#¿Qué es un modelo abliterated?
Un modelo llamado «abliterated» (a veces «decensored» o «uncensored») es un LLM de pesos abiertos al que se le ha eliminado la capacidad de negarse a responder. Cuando le pides algo que un Qwen 3.5 estándar rechazaría con «I cannot help with that», la versión abliterated responde directamente, sin mensaje de alineamiento, sin preámbulo moralizador y sin desviar la pregunta.
Importante: no es un jailbreak mediante un prompt. Se han modificado los pesos del modelo. El rechazo se ha vuelto mecánicamente imposible —o, en todo caso, extremadamente raro— porque se ha eliminado la dirección interna que lo activaba.
#Cómo funciona la ablación
Ahora sabes qué es un modelo «abliterated». El kit IA Sin Filtro comienza por el marco legal en Francia y en Europa (cap. 4), luego te enseña a evaluar una variante antes de descargarla (cap. 5 y 6) y a elegir la que quepa en tu memoria de vídeo (cap. 7).
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
La ablación se basa en un resultado publicado en 2024 por Arditi et al. («Refusal in Language Models Is Mediated by a Single Direction»). Los autores muestran que, en la mayoría de los LLM alineados, el rechazo está controlado por una única dirección en el espacio de activaciones internas: un vector que se puede aislar comparando las activaciones ante prompts inofensivos y ante prompts que desencadenan un rechazo.
La ablación consiste en eliminar esta dirección de los pesos del modelo mediante una proyección, capa por capa. En concreto, se modifican las matrices de proyección para que ya no puedan producir la componente asociada al rechazo. El modelo continúa funcionando normalmente, pero se ha desactivado la «señal interna» que lo hacía pasar al modo «me niego».
- Etapa 1 — Sondear
- Se envían al modelo decenas de pares de prompts: prompts neutros y prompts que provocan que el modelo se niegue a responder. Se registran las activaciones en cada capa.
- Paso 2 — Aislar
- Se calcula la diferencia media de las activaciones entre los dos grupos. Este vector, normalizado, es la dirección de rechazo.
- Paso 3 — Proyectar
- Se modifican los pesos de cada capa para hacer esta dirección inaccesible. Es simplemente una resta de una proyección ortogonal, no un reentrenamiento.
- Paso 4 — Probar
- Se comprueba que el modelo ya no se niegue a responder y que sus capacidades generales (razonamiento, código, francés) no se hayan desplomado.
#Dónde encontrar modelos abliterated
La mayor parte del ecosistema se encuentra en Hugging Face. Algunos publicadores de modelos son referentes en la comunidad por la calidad de sus ablaciones:
- mlabonne
- Maxime Labonne, uno de los primeros en popularizar esta técnica. Variantes abliterated de Qwen 3.5, Gemma 4 y Mistral Small, todas documentadas en huggingface.co/mlabonne.
- huihui-ai
- Cubre una matriz muy amplia: Qwen 3.5 (2B a 27B), Granite 4.2, Gemma 4, GLM 4.7. Variantes indicadas como « -abliterated » o « -abliterate ».
- failspy
- Autor de varias variantes destacadas (Qwen 3.5 9B abliterated, Gemma 4 12B abliterated). Muy comentado por su calidad.
- Orenguteng / Lexi
- La serie «Lexi-Uncensored» combina ablación y un ajuste fino ligero. Es conocida por su tono conversacional.
Para usar Ollama, el registro oficial también aloja numerosas variantes: busca las etiquetas que contengan abliterated o uncensored en ollama.com/library, o utiliza las variantes comunitarias publicadas por huihui_ai y mlabonne, que se pueden descargar directamente.
#Instalación en Ollama
La vía más sencilla para ejecutar un LLM abliterated localmente pasa por Ollama. El daemon escucha por defecto en http://localhost:11434 y acepta las variantes comunitarias sin configuración especial.
- 01Verificar que Ollama esté en ejecuciónEjecutar ollama --version en un terminal. Si el comando falla, seguir la guía de instalación de Ollama antes de continuar.
- 02Elegir un modelo adecuado para tu VRAMTen en cuenta estas cifras aproximadas: un 7-8B Q4 ocupa ~5 GB, un 14B ~9 GB, un 32B ~19 GB y un 70B ~40 GB. Una RTX 3060 de 12 GB basta para ejecutar un 8B con comodidad; una RTX 4090 de 24 GB permite ejecutar modelos de 32B.
- 03Descargar y ejecutarUtiliza ollama run con el nombre completo de la variante. El modelo se descarga y luego se carga en VRAM, y la conversación comienza.
- 04Probar un rechazo típicoHaz una pregunta que el modelo base rechazaría. Si a la variante se le ha aplicado correctamente la técnica de abliteration, obtienes una respuesta directa, sin preámbulo.
Una vez cargado el modelo, funciona como cualquier otro LLM de Ollama: endpoint compatible con OpenAI en :11434, integrable en Open WebUI, Continue.dev, LiteLLM y tus scripts de Python. No se requiere ninguna opción especial para que un modelo abliterated «funcione»: la ausencia de negativas a responder está en los pesos, no en la configuración.
#Con GGUF (LM Studio, llama.cpp)
Si prefieres LM Studio o llama.cpp directamente, trabajarás con archivos GGUF. La mayoría de las ablaciones ya están disponibles en varias cuantizaciones en Hugging Face — Q4_K_M sigue siendo el equilibrio recomendado (calidad preservada, VRAM mínima), Q5_K_M si tienes margen, Q8_0 si quieres la máxima fidelidad.
- 01Identificar el repositorio GGUFEn Hugging Face, busca los repositorios etiquetados con -GGUF. Por ejemplo: mlabonne/Qwen3.5-9B-abliterated-GGUF o bartowski/<modele>-abliterated-GGUF.
- 02Descargar la cuantización adecuadaEn LM Studio, la interfaz filtra por tamaño y por proveedor. Prefiere Q4_K_M en la mayoría de los casos. Para modelos muy pequeños (1-3B), Q5_K_M o Q6_K evita una pérdida significativa.
- 03Cargar y probarLM Studio carga automáticamente las capas en la GPU si la VRAM es suficiente. Vigila el indicador de offload: si parte del modelo pasa a la RAM, la velocidad cae.
- 04Exponer a través de la APIActiva el servidor local compatible con OpenAI si quieres conectarlo a tus aplicaciones. El puerto predeterminado es 1234 para LM Studio (en lugar de 11434 para Ollama).
#Límites y pérdida de calidad
La ablación tiene un coste. Eliminar una dirección en el residuo modifica todo lo que pasaba por esa dirección, incluidos componentes útiles. Los efectos secundarios observados en la práctica:
- Baja leve en los benchmarks de razonamiento
- Se observa normalmente una caída de entre 1 y 3 puntos en MMLU o GSM8K. Es medible, pero rara vez supone un obstáculo en el uso real.
- Respuestas a veces más mecánicas
- El modelo pierde parte de los matices del alineamiento: menos peticiones de aclaración y menos advertencias, incluso cuando serían útiles.
- Alucinaciones apenas un poco más frecuentes
- Ante preguntas a las que normalmente el modelo habría respondido «no estoy seguro», tiende a inventar una respuesta expresada con seguridad.
- Comportamientos residuales
- Algunos rechazos siguen apareciendo, sobre todo cuando las ablaciones son aproximadas. En cambio, algunos modelos muy bien abliterados responden a todo, incluso a cosas sobre las que preferirías que guardaran silencio.
#Riesgos y uso responsable
Un modelo que ya no rechaza nada no es un juguete. Algunos principios sencillos antes de integrarlo en un uso real:
- Sigues siendo responsable de los resultados
- Tanto si utilizas un modelo alineado como uno abliterated o en la nube, eres tú quien decide qué uso hace de las respuestas. El RGPD, el derecho penal y los derechos de autor no cambian según la versión del modelo.
- No lo pongas a disposición de los usuarios en modo autoservicio sin filtros
- Si montas un endpoint para un equipo, prevé al menos un filtrado en la aplicación (palabras clave, moderación de las respuestas). Usar un modelo abliterated sin filtros en un chat interno es, de entrada, una mala idea.
- Sé transparente con los usuarios
- Si una app conectada a un modelo abliterated genera contenido que podría sorprender, avisa a tus usuarios. Sin sorpresas, sin demandas judiciales.
- Uso legítimo, uso real
- Investigación en seguridad de la IA, red-teaming, procesamiento de corpus sensibles (médicos, jurídicos, de seguridad) en los que las negativas de un modelo alineado vuelven inutilizable la herramienta: estos son los casos en los que la ablación tiene un valor real. Lo de «he quitado la censura por diversión» expone a resultados muy indeseables sin aportar ningún beneficio.
#Consejos y solución de problemas
- El modelo sigue negándose
- Algunas ablaciones dejan pasar respuestas de rechazo en temas concretos (política, medicina, menores). Prueba otra ablación del mismo modelo o una de otro publicador: la calidad de la ablación varía mucho.
- El modelo se ha vuelto incoherente
- Síntoma de una ablación demasiado agresiva (demasiadas direcciones eliminadas o una dirección mal aislada). Elige una variante de un editor reconocido en lugar de una ablación casera no documentada.
- Rendimiento deficiente en francés
- Como con cualquier modelo de pesos abiertos, el rendimiento en francés depende del modelo base. Qwen 3.5, Mistral Small, Gemma 4 y Granite 4.2 son sólidos; los modelos más antiguos (Llama 3, Phi-3, Gemma 2) son más débiles. La ablación no cambia esto.
- Preámbulos residuales del tipo «As an AI, I cannot...»
- En lugar de un jailbreak, añade un prompt de sistema breve que recuerde el rol y el formato esperado. A menudo basta para eliminar los restos de alineación.
- VRAM saturada
- Con 8 GB, quédate con un 7-8B en Q4_K_M. Con 12 GB, puedes subir a Q5_K_M o probar un 14B en Q4. Con 24 GB, un 32B en Q4 cabe con margen.
#Para ir más allá
La ablación es una puerta de entrada a la personalización de modelos con pesos abiertos. Para ir más allá:
- Personalizar un modelo con Ollama Modelfile
- Si quieres añadir un prompt de sistema, parámetros y una plantilla sobre una variante abliterated, el Modelfile es la herramienta que debes conocer.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para entender qué GGUF cargar según tu VRAM y la calidad deseada: la ablación no cambia los compromisos que hay que sopesar.
- Fine-tuning de LLM en local: LoRA y QLoRA
- Si la ablación por sí sola no te basta y quieres adaptar el tono o el dominio, un LoRA ligero sobre una variante abliterated suele ser el mejor compromiso.
¿Existe una IA sin límites ni censura?+
¿Es legal una IA sin censura ejecutada en local?+
¿Una IA local sin límites es menos inteligente?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.