Intermedio 10 minPersonalización

Modelos abliterated (sin censura) en local: guía pratique

Los modelos de pesos abiertos como Qwen, Gemma o Mistral han sido alineados para rechazar ciertas solicitudes. Un modelo abliterated es una variante en la que este comportamiento de rechazo se ha eliminado quirúrgicamente a nivel de los pesos —no mediante un jailbreak por prompt, sino editando la red—. Esta guía explica qué hace realmente esta técnica, dónde encontrar estos modelos, cómo ejecutarlos en local con Ollama o en formato GGUF y cuáles son sus verdaderas limitaciones.

Por Mohamed Meguedmi·Actualización 2026-09-01·Probado en Windows, macOS y Linux

#¿Qué es un modelo abliterated?

Un modelo llamado «abliterated» (a veces «decensored» o «uncensored») es un LLM de pesos abiertos al que se le ha eliminado la capacidad de negarse a responder. Cuando le pides algo que un Qwen 3.5 estándar rechazaría con «I cannot help with that», la versión abliterated responde directamente, sin mensaje de alineamiento, sin preámbulo moralizador y sin desviar la pregunta.

Importante: no es un jailbreak mediante un prompt. Se han modificado los pesos del modelo. El rechazo se ha vuelto mecánicamente imposible —o, en todo caso, extremadamente raro— porque se ha eliminado la dirección interna que lo activaba.

i
Abliterated, ajustado mediante fine-tuning, modificado mediante jailbreak: tres cosas diferentes
Un modelo con jailbreak es el original más un prompt ingenioso que lo induce a eludir sus mecanismos de protección (frágil). Un modelo sin censura sometido a ajuste fino ha sido reentrenado con un conjunto de datos sin rechazos (costoso). A un modelo abliterated simplemente se le ha eliminado la dirección de rechazo mediante una operación de álgebra lineal (rápido, conserva mejor la calidad).

#Cómo funciona la ablación

El kit IA Sin Filtros

Ahora sabes qué es un modelo «abliterated». El kit IA Sin Filtro comienza por el marco legal en Francia y en Europa (cap. 4), luego te enseña a evaluar una variante antes de descargarla (cap. 5 y 6) y a elegir la que quepa en tu memoria de vídeo (cap. 7).

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

La ablación se basa en un resultado publicado en 2024 por Arditi et al. («Refusal in Language Models Is Mediated by a Single Direction»). Los autores muestran que, en la mayoría de los LLM alineados, el rechazo está controlado por una única dirección en el espacio de activaciones internas: un vector que se puede aislar comparando las activaciones ante prompts inofensivos y ante prompts que desencadenan un rechazo.

La ablación consiste en eliminar esta dirección de los pesos del modelo mediante una proyección, capa por capa. En concreto, se modifican las matrices de proyección para que ya no puedan producir la componente asociada al rechazo. El modelo continúa funcionando normalmente, pero se ha desactivado la «señal interna» que lo hacía pasar al modo «me niego».

Etapa 1 — Sondear
Se envían al modelo decenas de pares de prompts: prompts neutros y prompts que provocan que el modelo se niegue a responder. Se registran las activaciones en cada capa.
Paso 2 — Aislar
Se calcula la diferencia media de las activaciones entre los dos grupos. Este vector, normalizado, es la dirección de rechazo.
Paso 3 — Proyectar
Se modifican los pesos de cada capa para hacer esta dirección inaccesible. Es simplemente una resta de una proyección ortogonal, no un reentrenamiento.
Paso 4 — Probar
Se comprueba que el modelo ya no se niegue a responder y que sus capacidades generales (razonamiento, código, francés) no se hayan desplomado.
→
¿Por qué es tan rápido?
La ablación no requiere una GPU monstruosa ni horas de entrenamiento. Bastan entre unos minutos y unas horas incluso para modelos de 70B, porque solo se realizan operaciones de álgebra lineal sobre matrices existentes.

#Dónde encontrar modelos abliterated

La mayor parte del ecosistema se encuentra en Hugging Face. Algunos publicadores de modelos son referentes en la comunidad por la calidad de sus ablaciones:

mlabonne
Maxime Labonne, uno de los primeros en popularizar esta técnica. Variantes abliterated de Qwen 3.5, Gemma 4 y Mistral Small, todas documentadas en huggingface.co/mlabonne.
huihui-ai
Cubre una matriz muy amplia: Qwen 3.5 (2B a 27B), Granite 4.2, Gemma 4, GLM 4.7. Variantes indicadas como « -abliterated » o « -abliterate ».
failspy
Autor de varias variantes destacadas (Qwen 3.5 9B abliterated, Gemma 4 12B abliterated). Muy comentado por su calidad.
Orenguteng / Lexi
La serie «Lexi-Uncensored» combina ablación y un ajuste fino ligero. Es conocida por su tono conversacional.
!
Revisa la ficha del modelo
No todos los modelos etiquetados como «uncensored» o «abliterated» son igual de buenos. Lee la ficha del modelo: algunos de quienes los publican proporcionan los scripts utilizados y las evaluaciones posteriores a la ablación; otros se limitan a un título llamativo. En caso de duda, prefiere a alguien con un historial verificable.

Para usar Ollama, el registro oficial también aloja numerosas variantes: busca las etiquetas que contengan abliterated o uncensored en ollama.com/library, o utiliza las variantes comunitarias publicadas por huihui_ai y mlabonne, que se pueden descargar directamente.

#Instalación en Ollama

La vía más sencilla para ejecutar un LLM abliterated localmente pasa por Ollama. El daemon escucha por defecto en http://localhost:11434 y acepta las variantes comunitarias sin configuración especial.

  1. 01
    Verificar que Ollama esté en ejecución
    Ejecutar ollama --version en un terminal. Si el comando falla, seguir la guía de instalación de Ollama antes de continuar.
  2. 02
    Elegir un modelo adecuado para tu VRAM
    Ten en cuenta estas cifras aproximadas: un 7-8B Q4 ocupa ~5 GB, un 14B ~9 GB, un 32B ~19 GB y un 70B ~40 GB. Una RTX 3060 de 12 GB basta para ejecutar un 8B con comodidad; una RTX 4090 de 24 GB permite ejecutar modelos de 32B.
  3. 03
    Descargar y ejecutar
    Utiliza ollama run con el nombre completo de la variante. El modelo se descarga y luego se carga en VRAM, y la conversación comienza.
  4. 04
    Probar un rechazo típico
    Haz una pregunta que el modelo base rechazaría. Si a la variante se le ha aplicado correctamente la técnica de abliteration, obtienes una respuesta directa, sin preámbulo.
Ejemplo — variante abliterated de Qwen 3.5 9B
ollama run huihui_ai/qwen3.5-abliterated:9b
Ejemplo — variante abliterated de Gemma 4 12B
ollama run huihui_ai/gemma4-abliterated:12b
# ou, depuis Hugging Face directement :
# ollama run hf.co/mlabonne/gemma-4-12b-it-abliterated-GGUF
→
Descarga directa desde Hugging Face
Desde Ollama 0.4, puedes ejecutar ollama run hf.co/<publisher>/<modele>-GGUF sin pasar por el registro de Ollama. Útil para probar rápidamente una ablación publicada por mlabonne o failspy que no tenga (todavía) una etiqueta oficial.

Una vez cargado el modelo, funciona como cualquier otro LLM de Ollama: endpoint compatible con OpenAI en :11434, integrable en Open WebUI, Continue.dev, LiteLLM y tus scripts de Python. No se requiere ninguna opción especial para que un modelo abliterated «funcione»: la ausencia de negativas a responder está en los pesos, no en la configuración.

#Con GGUF (LM Studio, llama.cpp)

Si prefieres LM Studio o llama.cpp directamente, trabajarás con archivos GGUF. La mayoría de las ablaciones ya están disponibles en varias cuantizaciones en Hugging Face — Q4_K_M sigue siendo el equilibrio recomendado (calidad preservada, VRAM mínima), Q5_K_M si tienes margen, Q8_0 si quieres la máxima fidelidad.

  1. 01
    Identificar el repositorio GGUF
    En Hugging Face, busca los repositorios etiquetados con -GGUF. Por ejemplo: mlabonne/Qwen3.5-9B-abliterated-GGUF o bartowski/<modele>-abliterated-GGUF.
  2. 02
    Descargar la cuantización adecuada
    En LM Studio, la interfaz filtra por tamaño y por proveedor. Prefiere Q4_K_M en la mayoría de los casos. Para modelos muy pequeños (1-3B), Q5_K_M o Q6_K evita una pérdida significativa.
  3. 03
    Cargar y probar
    LM Studio carga automáticamente las capas en la GPU si la VRAM es suficiente. Vigila el indicador de offload: si parte del modelo pasa a la RAM, la velocidad cae.
  4. 04
    Exponer a través de la API
    Activa el servidor local compatible con OpenAI si quieres conectarlo a tus aplicaciones. El puerto predeterminado es 1234 para LM Studio (en lugar de 11434 para Ollama).
i
Cuantización y ablación
La ablación se realiza sobre el modelo no cuantizado y luego se aplica la cuantización al resultado. Así obtienes directamente el GGUF de una variante ya sometida a ablación: no hay nada que «activar» en la cuantización.

#Límites y pérdida de calidad

La ablación tiene un coste. Eliminar una dirección en el residuo modifica todo lo que pasaba por esa dirección, incluidos componentes útiles. Los efectos secundarios observados en la práctica:

Baja leve en los benchmarks de razonamiento
Se observa normalmente una caída de entre 1 y 3 puntos en MMLU o GSM8K. Es medible, pero rara vez supone un obstáculo en el uso real.
Respuestas a veces más mecánicas
El modelo pierde parte de los matices del alineamiento: menos peticiones de aclaración y menos advertencias, incluso cuando serían útiles.
Alucinaciones apenas un poco más frecuentes
Ante preguntas a las que normalmente el modelo habría respondido «no estoy seguro», tiende a inventar una respuesta expresada con seguridad.
Comportamientos residuales
Algunos rechazos siguen apareciendo, sobre todo cuando las ablaciones son aproximadas. En cambio, algunos modelos muy bien abliterados responden a todo, incluso a cosas sobre las que preferirías que guardaran silencio.
→
Comparar antes de adoptar
Antes de reemplazar tu modelo base por su versión abliterated, haz una pequeña prueba con 10-20 prompts representativos de tu uso real, en ambas versiones. Así sabrás inmediatamente si la pérdida es aceptable para ti.

#Riesgos y uso responsable

Un modelo que ya no rechaza nada no es un juguete. Algunos principios sencillos antes de integrarlo en un uso real:

Sigues siendo responsable de los resultados
Tanto si utilizas un modelo alineado como uno abliterated o en la nube, eres tú quien decide qué uso hace de las respuestas. El RGPD, el derecho penal y los derechos de autor no cambian según la versión del modelo.
No lo pongas a disposición de los usuarios en modo autoservicio sin filtros
Si montas un endpoint para un equipo, prevé al menos un filtrado en la aplicación (palabras clave, moderación de las respuestas). Usar un modelo abliterated sin filtros en un chat interno es, de entrada, una mala idea.
Sé transparente con los usuarios
Si una app conectada a un modelo abliterated genera contenido que podría sorprender, avisa a tus usuarios. Sin sorpresas, sin demandas judiciales.
Uso legítimo, uso real
Investigación en seguridad de la IA, red-teaming, procesamiento de corpus sensibles (médicos, jurídicos, de seguridad) en los que las negativas de un modelo alineado vuelven inutilizable la herramienta: estos son los casos en los que la ablación tiene un valor real. Lo de «he quitado la censura por diversión» expone a resultados muy indeseables sin aportar ningún beneficio.
!
Lo que la ablación no cambia
La ablación suprime el rechazo, no los conocimientos. Si el modelo base nunca ha visto un tema peligroso durante su entrenamiento, el modelo abliterated tampoco sabrá más sobre él. A la inversa, un modelo que «sabía» y se negaba a decirlo ahora lo dirá: eso es precisamente lo que motiva la prudencia.

#Consejos y solución de problemas

El modelo sigue negándose
Algunas ablaciones dejan pasar respuestas de rechazo en temas concretos (política, medicina, menores). Prueba otra ablación del mismo modelo o una de otro publicador: la calidad de la ablación varía mucho.
El modelo se ha vuelto incoherente
Síntoma de una ablación demasiado agresiva (demasiadas direcciones eliminadas o una dirección mal aislada). Elige una variante de un editor reconocido en lugar de una ablación casera no documentada.
Rendimiento deficiente en francés
Como con cualquier modelo de pesos abiertos, el rendimiento en francés depende del modelo base. Qwen 3.5, Mistral Small, Gemma 4 y Granite 4.2 son sólidos; los modelos más antiguos (Llama 3, Phi-3, Gemma 2) son más débiles. La ablación no cambia esto.
Preámbulos residuales del tipo «As an AI, I cannot...»
En lugar de un jailbreak, añade un prompt de sistema breve que recuerde el rol y el formato esperado. A menudo basta para eliminar los restos de alineación.
VRAM saturada
Con 8 GB, quédate con un 7-8B en Q4_K_M. Con 12 GB, puedes subir a Q5_K_M o probar un 14B en Q4. Con 24 GB, un 32B en Q4 cabe con margen.

#Para ir más allá

La ablación es una puerta de entrada a la personalización de modelos con pesos abiertos. Para ir más allá:

Personalizar un modelo con Ollama Modelfile
Si quieres añadir un prompt de sistema, parámetros y una plantilla sobre una variante abliterated, el Modelfile es la herramienta que debes conocer.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para entender qué GGUF cargar según tu VRAM y la calidad deseada: la ablación no cambia los compromisos que hay que sopesar.
Fine-tuning de LLM en local: LoRA y QLoRA
Si la ablación por sí sola no te basta y quieres adaptar el tono o el dominio, un LoRA ligero sobre una variante abliterated suele ser el mejor compromiso.
Preguntas frecuentes
¿Existe una IA sin límites ni censura?+
Sí, pero no en la nube: todos los servicios en línea «sin límite» aplican en realidad filtros del lado del servidor y condiciones generales de uso. La verdadera IA sin censura es un modelo abliterated que funciona en local: el comportamiento de rechazo se ha eliminado de los propios pesos y nada pasa por un servidor de terceros. Es exactamente lo que cubre esta guía.
¿Es legal una IA sin censura ejecutada en local?+
Ejecutar un modelo abliterated en casa es legal: se trata de pesos open-weight modificados, distribuidos públicamente. Sin embargo, lo que produzcas con él sigue sujeto al derecho común: la ablación elimina los rechazos del modelo, no tus responsabilidades. Revisa también la licencia de la variante utilizada (generalmente sigue la del modelo original).
¿Una IA local sin límites es menos inteligente?+
Ligeramente, sí: la ablación degrada un poco la calidad general (ver la sección «Límites y pérdida de calidad»). Para un uso habitual, la diferencia es marginal; para código o razonamiento exigente, mantén la variante original en paralelo: las dos coexisten muy bien en Ollama.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.