Avanzado 11 minAgentes

AutoGen en local: lo que funciona y lo que casse

Respuesta directa

AutoGen funciona localmente a través de un punto de acceso compatible con OpenAI (Ollama, vLLM), pero Microsoft puso el proyecto en modo mantenimiento el 2 de octubre de 2025: ya no se añaden nuevas funcionalidades, y Microsoft recomienda migrar al Microsoft Agent Framework. AG2, el fork bajo licencia Apache-2.0 de los creadores originales, es actualmente la versión activamente desarrollada que se debe considerar para un nuevo proyecto.

AutoGen construye sistemas a partir de agentes que se comunican entre sí. Conectado a un modelo local, funciona, hasta un punto que depende casi enteramente del tamaño del modelo y del margen de libertad que se le dé a la conversación. En local, cada turno de conversación es una generación en tu propia tarjeta gráfica: la disciplina no está en el prompt, está en los límites. Hay otra cosa que ha cambiado desde finales de 2025 y que pocos tutoriales mencionan todavía: el nombre «AutoGen» ya no se refiere a un solo proyecto activo, sino a tres trayectorias distintas que hay que distinguir antes de decidir dónde invertir tiempo.

Por Mohamed Meguedmi·Actualización 2026-09-28·Probado en Windows, macOS y Linux

#El modelo de conversación

Mientras que un framework de cadenas exige definir etapas, AutoGen pide definir participantes. Un agente asistente propone; un agente que actúa en tu nombre te representa, puede ejecutar código y devuelve el resultado; una conversación grupal reúne a varios especialistas bajo un gestor que decide quién habla. El comportamiento surge de estos intercambios.

Es realmente potente para tareas abiertas —depurar, iterar sobre un análisis— y es exactamente lo que hace que el costo sea impredecible. Una cadena fija realiza N llamadas al modelo. Una conversación realiza tantas como hagan falta, y es precisamente el modelo del que dudas el que decide cuántas hacen falta.

Este diseño tiene una consecuencia directa en la elección de los roles: cuantos más agentes distintos haya en la conversación, más turnos serán posibles antes de que surja una respuesta final y mayor será el riesgo de deriva. Dos agentes que se responden en bucle sin llegar nunca a una conclusión son el síntoma más frecuente en local, precisamente porque no se estableció ningún límite antes del primer intento. Por tanto, el número de agentes no es solo una elección de arquitectura: es un multiplicador directo del tiempo de cálculo consumido en tu propia tarjeta gráfica.

#AutoGen en modo mantenimiento: lo que ha cambiado

El kit de Agentes Locales

Agentes que actúan en tu máquina: Cline agéntico, MCP, n8n + Ollama, automatizaciones locales.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Este es el punto que la mayoría de los tutoriales que siguen en línea omiten. El propio repositorio oficial microsoft/autogen lo anuncia claramente desde el 2 de octubre de 2025: el proyecto está en modo de mantenimiento, ya no recibirá nuevas funcionalidades y será gestionado por la comunidad. Microsoft recomienda que los nuevos proyectos comiencen directamente con Microsoft Agent Framework (MAF), el sucesor que combina los componentes de AutoGen con los de Semantic Kernel en un único kit de desarrollo, que alcanzó la disponibilidad general a principios de abril de 2026.

Los creadores originales de AutoGen, Chi Wang y Qingyun Wu, dejaron Microsoft a finales de 2024 y continuaron el desarrollo bajo el nombre AG2, un fork bajo licencia Apache 2.0, alojado por la organización ag2ai. AG2 se presenta como la continuación activa del proyecto en lugar de como una ruptura: la base histórica sigue disponible bajo el nombre AG2 Classic para quienes no quieren cambiar nada en su código, mientras que AG2 1.0 hace evolucionar la arquitectura hacia un protocolo más explícito entre agentes. Para un proyecto que empieza hoy, AG2 es la opción más coherente si quieres mantenerte cerca de la API original de AutoGen; Microsoft Agent Framework es la opción que debes considerar si ya estás en el ecosistema de Microsoft y la fusión con las herramientas de Semantic Kernel te concierne directamente.

!
¿Qué cambia concretamente para ti?
El código histórico de AutoGen sigue funcionando: recibe correcciones de seguridad, no nuevas funcionalidades. Nada de lo que sigue en esta guía (configuración de Ollama, aislamiento de la ejecución de código, tamaños de modelo) cambia con AG2, cuya API sigue siendo muy similar. Pero empezar hoy con «AutoGen» sin saber que el nombre engloba ahora tres proyectos distintos —el repositorio de Microsoft congelado, el fork AG2 activo y Microsoft Agent Framework— es el tipo de error al elegir una herramienta que sale caro seis meses después, cuando llega el momento de hacer evolucionar el código.

#Conectarlo a un modelo local

  1. 01
    Servir el modelo
    En un punto de acceso compatible con OpenAI. Para varios agentes que hablan al mismo tiempo, un servidor diseñado para la concurrencia funciona mucho mejor que uno pensado para un solo equipo.
  2. 02
    Configurar el cliente
    Dirección base (por ejemplo http://localhost:11434/v1 para Ollama), nombre exacto del modelo tal como fue recuperado localmente, clave ficticia. Los servidores locales ignoran la clave; la biblioteca cliente suele exigir que exista.
  3. 03
    Declarar honestamente las capacidades
    Los frameworks piden que indiques si el modelo admite llamadas a funciones o el modo JSON. Declarar una capacidad inexistente provoca errores incomprensibles más adelante, en lugar de un fallo controlado.
  4. 04
    Aumentar la ventana de contexto
    El historial crece con cada turno. Un contexto por defecto trunca silenciosamente el inicio, y los agentes vuelven a hacer un trabajo ya realizado.
!
Establece un número máximo de rondas antes del primer intento
No después. La experiencia inicial típica de una conversación con múltiples agentes en local consiste en descubrir, veinte minutos después, que dos agentes se felicitan mutuamente desde el tercer mensaje mientras la tarjeta gráfica funciona a plena capacidad.

#La ejecución de código: debe aislarse

El esquema que hace atractivo a AutoGen —un agente escribe código, un agente delegado lo ejecuta, el error vuelve y el agente lo corrige— es también el que ejecuta código escrito por un modelo en tu máquina. Ese código se ejecuta en un contenedor, sin credenciales, sin red si la tarea no la necesita y nunca sobre tu directorio personal. Y todo contenido recuperado del exterior —un ticket, una página web, un archivo de documentación— debe considerarse potencialmente hostil.

La observabilidad importa tanto como el aislamiento. En una conversación con tres o cuatro agentes, un incidente se diagnostica releyendo el prompt exacto que recibió cada agente en cada turno, no un resumen elaborado a posteriori. Sin un registro completo, nunca se sabe si un agente interpretó mal una instrucción o si simplemente recibió un contexto truncado por falta de memoria. Registrar cada intercambio, incluidas las llamadas a herramientas y sus argumentos exactos, cuesta poco y evita tener que adivinar qué ocurrió una vez que la tarjeta gráfica ha vuelto a quedarse en silencio.

#El tamaño del modelo, una vez más

Lo que realmente ocurre en una conversación
Clase de modeloComportamiento
3 a 8 mil millonesMensajes fluidos, llamadas a herramientas poco fiables, sin disciplina para detenerse. Entra en bucle.
12 a 14 mil millonesLas interacciones entre dos agentes con roles claros funcionan; las discusiones grupales se desvían.
24 a 32 mil millonesUmbral práctico para conversaciones grupales y bucles de ejecución de código.
70 mil millones y másComportamiento más cercano al cloud, bastante lento para que las conversaciones largas se conviertan en procesamiento por lotes.

Prefiere modelos entrenados para realizar llamadas a herramientas y generar salidas estructuradas. Es el mismo límite con el que se encuentran todos los frameworks de agentes locales: la prosa es fácil, pero los formatos estrictos no lo son. El papel de gestor en una conversación de grupo suele merecer el modelo más capaz del que dispongas: es quien decide quién habla después, y cada decisión incorrecta de enrutamiento cuesta un turno entero, un coste que se repite mientras la conversación siga dando vueltas sin converger.

#AutoGen, AG2 o CrewAI

Dos modelos mentales diferentes
QuieresElige
Roles definidos, relevos ordenados, un costo previsibleCrewAI
Una conversación abierta, iteración y ciclos de corrección y reintentoAG2 (el fork activo de lo que era AutoGen)
Un grafo explícito con un estado que tú controlasUn framework orientado a grafos
Un solo agente que modifica un repositorioUn agente de código dedicado
Proyecto ya construido en el ecosistema de MicrosoftMicrosoft Agent Framework

Para el código ya escrito con la API histórica de AutoGen, la migración a AG2 suele requerir pocos cambios: el espacio de nombres original autogen.* sigue disponible en una rama dedicada (AG2 Classic), para que puedas hacer la transición a tu ritmo. Empezar desde cero hoy es otra decisión: conviene elegir directamente AG2 o evaluar Microsoft Agent Framework en lugar de aprender una base de código que su propio responsable describe como gestionada por la comunidad.

#¿Cuánto cuesta realmente una conversación?

Con una API de pago, una conversación entre tres agentes que se prolonga durante veinte turnos se nota en la factura. En local, se nota en el ventilador del chasis y en el reloj de pared. Cada turno es una generación completa: si un turno dura de media cinco segundos en tu tarjeta, veinte turnos sin condición de parada representan como mínimo un minuto y cuarenta segundos de cálculo continuo, a menudo mucho más una vez que el contexto ha crecido y cada generación vuelve a leer un historial más largo que en la anterior. Nada te avisa mientras esto ocurre: no hay contador ni umbral, solo una GPU que sigue caliente.

Por eso el límite de turnos no es un detalle de configuración más: es el único mecanismo que convierte un costo potencialmente ilimitado en un costo acotado y previsible, exactamente como lo haría un presupuesto de tokens en una API comercial. Fijar este límite antes de la primera prueba, en lugar de descubrirlo después, marca la diferencia entre una prueba de cinco minutos y una tarjeta gráfica monopolizada durante toda una tarde-noche por una conversación que no llevaba a ninguna parte desde el décimo mensaje. En una máquina compartida con otros usos —una estación de trabajo, no un servidor dedicado—, esta monopolización también tiene un costo de oportunidad concreto: no puedes ejecutar nada más que consuma muchos recursos de GPU mientras una conversación entre varios agentes se ejecuta sin límite en segundo plano.

#FAQ

¿AutoGen sigue siendo desarrollado por Microsoft?+
No, ya no se desarrolla activamente. Microsoft puso el repositorio microsoft/autogen en modo mantenimiento el 2 de octubre de 2025: solo correcciones de seguridad, ninguna nueva funcionalidad y gestión comunitaria para el resto. Microsoft recomienda explícitamente que los nuevos proyectos empiecen con Microsoft Agent Framework, su sucesor oficial, que alcanzó la disponibilidad general a principios de abril de 2026, con una guía de migración específica.
¿Qué es AG2, y se debe usar en su lugar?+
AG2 es el fork bajo licencia Apache 2.0 creado por Chi Wang y Qingyun Wu, los autores originales de AutoGen, tras su salida de Microsoft al final de 2024. Es hoy la versión activamente desarrollada más cercana a la API AutoGen histórica: una opción razonable para un nuevo proyecto que quiera mantener ese espíritu sin depender del ecosistema de Microsoft.
¿Funciona AutoGen con Ollama?+
Sí, a través del punto de acceso de Ollama compatible con OpenAI, disponible en http://localhost:11434/v1: dirección base, nombre del modelo exactamente como se obtuvo localmente y clave ficticia, ya que Ollama no la verifica. Para varios agentes simultáneos, un servidor diseñado para la concurrencia funciona claramente mejor que Ollama por sí solo en un ordenador de escritorio convencional.
¿Por qué mis agentes hablan sin fin?+
No se ha establecido una condición de parada efectiva, y a menudo el modelo es demasiado pequeño para reconocerla incluso cuando existe en el prompt. Establece un número máximo de turnos antes del primer ensayo, define una frase de parada explícita y probada, y asigna un modelo más grande al rol de gestor que decide quién habla después.
¿Es prudente dejar que un agente ejecute código?+
Solo dentro de un contenedor, sin credenciales y con el acceso a la red restringido a lo estrictamente necesario. El ejecutor ejecuta código escrito por un modelo que quizá haya leído texto controlado por un tercero durante la conversación, lo que lo convierte en una puerta de entrada clásica para la inyección indirecta de prompts en una instalación local.
¿Cuál es el modelo más pequeño usable?+
Alrededor de 12 a 14 mil millones de parámetros para intercambios simples entre dos agentes con roles bien definidos, y de 24 a 32 mil millones para discusiones de grupo o bucles de ejecución de código. Por debajo de este umbral, los mensajes siguen pareciendo fluidos, pero el respeto de las condiciones de parada y las llamadas a herramientas se vuelven poco fiables.
¿AutoGen (AG2) o CrewAI?+
CrewAI se adapta mejor a roles definidos de antemano y a traspasos previsibles de un agente a otro; AG2, a la conversación abierta y a la resolución iterativa cuando el camino no se conoce al principio. Ambos siguen siendo igual de sensibles a la calidad del modelo cuando se ejecutan en local.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.