AutoGen en local: lo que funciona y lo que casse
AutoGen funciona localmente a través de un punto de acceso compatible con OpenAI (Ollama, vLLM), pero Microsoft puso el proyecto en modo mantenimiento el 2 de octubre de 2025: ya no se añaden nuevas funcionalidades, y Microsoft recomienda migrar al Microsoft Agent Framework. AG2, el fork bajo licencia Apache-2.0 de los creadores originales, es actualmente la versión activamente desarrollada que se debe considerar para un nuevo proyecto.
AutoGen construye sistemas a partir de agentes que se comunican entre sí. Conectado a un modelo local, funciona, hasta un punto que depende casi enteramente del tamaño del modelo y del margen de libertad que se le dé a la conversación. En local, cada turno de conversación es una generación en tu propia tarjeta gráfica: la disciplina no está en el prompt, está en los límites. Hay otra cosa que ha cambiado desde finales de 2025 y que pocos tutoriales mencionan todavía: el nombre «AutoGen» ya no se refiere a un solo proyecto activo, sino a tres trayectorias distintas que hay que distinguir antes de decidir dónde invertir tiempo.
#El modelo de conversación
Mientras que un framework de cadenas exige definir etapas, AutoGen pide definir participantes. Un agente asistente propone; un agente que actúa en tu nombre te representa, puede ejecutar código y devuelve el resultado; una conversación grupal reúne a varios especialistas bajo un gestor que decide quién habla. El comportamiento surge de estos intercambios.
Es realmente potente para tareas abiertas —depurar, iterar sobre un análisis— y es exactamente lo que hace que el costo sea impredecible. Una cadena fija realiza N llamadas al modelo. Una conversación realiza tantas como hagan falta, y es precisamente el modelo del que dudas el que decide cuántas hacen falta.
Este diseño tiene una consecuencia directa en la elección de los roles: cuantos más agentes distintos haya en la conversación, más turnos serán posibles antes de que surja una respuesta final y mayor será el riesgo de deriva. Dos agentes que se responden en bucle sin llegar nunca a una conclusión son el síntoma más frecuente en local, precisamente porque no se estableció ningún límite antes del primer intento. Por tanto, el número de agentes no es solo una elección de arquitectura: es un multiplicador directo del tiempo de cálculo consumido en tu propia tarjeta gráfica.
#AutoGen en modo mantenimiento: lo que ha cambiado
Agentes que actúan en tu máquina: Cline agéntico, MCP, n8n + Ollama, automatizaciones locales.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Este es el punto que la mayoría de los tutoriales que siguen en línea omiten. El propio repositorio oficial microsoft/autogen lo anuncia claramente desde el 2 de octubre de 2025: el proyecto está en modo de mantenimiento, ya no recibirá nuevas funcionalidades y será gestionado por la comunidad. Microsoft recomienda que los nuevos proyectos comiencen directamente con Microsoft Agent Framework (MAF), el sucesor que combina los componentes de AutoGen con los de Semantic Kernel en un único kit de desarrollo, que alcanzó la disponibilidad general a principios de abril de 2026.
Los creadores originales de AutoGen, Chi Wang y Qingyun Wu, dejaron Microsoft a finales de 2024 y continuaron el desarrollo bajo el nombre AG2, un fork bajo licencia Apache 2.0, alojado por la organización ag2ai. AG2 se presenta como la continuación activa del proyecto en lugar de como una ruptura: la base histórica sigue disponible bajo el nombre AG2 Classic para quienes no quieren cambiar nada en su código, mientras que AG2 1.0 hace evolucionar la arquitectura hacia un protocolo más explícito entre agentes. Para un proyecto que empieza hoy, AG2 es la opción más coherente si quieres mantenerte cerca de la API original de AutoGen; Microsoft Agent Framework es la opción que debes considerar si ya estás en el ecosistema de Microsoft y la fusión con las herramientas de Semantic Kernel te concierne directamente.
#Conectarlo a un modelo local
- 01Servir el modeloEn un punto de acceso compatible con OpenAI. Para varios agentes que hablan al mismo tiempo, un servidor diseñado para la concurrencia funciona mucho mejor que uno pensado para un solo equipo.
- 02Configurar el clienteDirección base (por ejemplo http://localhost:11434/v1 para Ollama), nombre exacto del modelo tal como fue recuperado localmente, clave ficticia. Los servidores locales ignoran la clave; la biblioteca cliente suele exigir que exista.
- 03Declarar honestamente las capacidadesLos frameworks piden que indiques si el modelo admite llamadas a funciones o el modo JSON. Declarar una capacidad inexistente provoca errores incomprensibles más adelante, en lugar de un fallo controlado.
- 04Aumentar la ventana de contextoEl historial crece con cada turno. Un contexto por defecto trunca silenciosamente el inicio, y los agentes vuelven a hacer un trabajo ya realizado.
#La ejecución de código: debe aislarse
El esquema que hace atractivo a AutoGen —un agente escribe código, un agente delegado lo ejecuta, el error vuelve y el agente lo corrige— es también el que ejecuta código escrito por un modelo en tu máquina. Ese código se ejecuta en un contenedor, sin credenciales, sin red si la tarea no la necesita y nunca sobre tu directorio personal. Y todo contenido recuperado del exterior —un ticket, una página web, un archivo de documentación— debe considerarse potencialmente hostil.
La observabilidad importa tanto como el aislamiento. En una conversación con tres o cuatro agentes, un incidente se diagnostica releyendo el prompt exacto que recibió cada agente en cada turno, no un resumen elaborado a posteriori. Sin un registro completo, nunca se sabe si un agente interpretó mal una instrucción o si simplemente recibió un contexto truncado por falta de memoria. Registrar cada intercambio, incluidas las llamadas a herramientas y sus argumentos exactos, cuesta poco y evita tener que adivinar qué ocurrió una vez que la tarjeta gráfica ha vuelto a quedarse en silencio.
#El tamaño del modelo, una vez más
| Clase de modelo | Comportamiento |
|---|---|
| 3 a 8 mil millones | Mensajes fluidos, llamadas a herramientas poco fiables, sin disciplina para detenerse. Entra en bucle. |
| 12 a 14 mil millones | Las interacciones entre dos agentes con roles claros funcionan; las discusiones grupales se desvían. |
| 24 a 32 mil millones | Umbral práctico para conversaciones grupales y bucles de ejecución de código. |
| 70 mil millones y más | Comportamiento más cercano al cloud, bastante lento para que las conversaciones largas se conviertan en procesamiento por lotes. |
Prefiere modelos entrenados para realizar llamadas a herramientas y generar salidas estructuradas. Es el mismo límite con el que se encuentran todos los frameworks de agentes locales: la prosa es fácil, pero los formatos estrictos no lo son. El papel de gestor en una conversación de grupo suele merecer el modelo más capaz del que dispongas: es quien decide quién habla después, y cada decisión incorrecta de enrutamiento cuesta un turno entero, un coste que se repite mientras la conversación siga dando vueltas sin converger.
- CrewAI: roles y entregables organizados
- Arquitectura de un agente local
- Crear un agente local en Python con LangChain
- El kit QuelLLM para montar agentes locales
- Repositorio oficial: anuncio del modo de mantenimiento
- AG2: el fork que se desarrolla activamente
- La API oficial de Ollama compatible con OpenAI
#AutoGen, AG2 o CrewAI
| Quieres | Elige |
|---|---|
| Roles definidos, relevos ordenados, un costo previsible | CrewAI |
| Una conversación abierta, iteración y ciclos de corrección y reintento | AG2 (el fork activo de lo que era AutoGen) |
| Un grafo explícito con un estado que tú controlas | Un framework orientado a grafos |
| Un solo agente que modifica un repositorio | Un agente de código dedicado |
| Proyecto ya construido en el ecosistema de Microsoft | Microsoft Agent Framework |
Para el código ya escrito con la API histórica de AutoGen, la migración a AG2 suele requerir pocos cambios: el espacio de nombres original autogen.* sigue disponible en una rama dedicada (AG2 Classic), para que puedas hacer la transición a tu ritmo. Empezar desde cero hoy es otra decisión: conviene elegir directamente AG2 o evaluar Microsoft Agent Framework en lugar de aprender una base de código que su propio responsable describe como gestionada por la comunidad.
#¿Cuánto cuesta realmente una conversación?
Con una API de pago, una conversación entre tres agentes que se prolonga durante veinte turnos se nota en la factura. En local, se nota en el ventilador del chasis y en el reloj de pared. Cada turno es una generación completa: si un turno dura de media cinco segundos en tu tarjeta, veinte turnos sin condición de parada representan como mínimo un minuto y cuarenta segundos de cálculo continuo, a menudo mucho más una vez que el contexto ha crecido y cada generación vuelve a leer un historial más largo que en la anterior. Nada te avisa mientras esto ocurre: no hay contador ni umbral, solo una GPU que sigue caliente.
Por eso el límite de turnos no es un detalle de configuración más: es el único mecanismo que convierte un costo potencialmente ilimitado en un costo acotado y previsible, exactamente como lo haría un presupuesto de tokens en una API comercial. Fijar este límite antes de la primera prueba, en lugar de descubrirlo después, marca la diferencia entre una prueba de cinco minutos y una tarjeta gráfica monopolizada durante toda una tarde-noche por una conversación que no llevaba a ninguna parte desde el décimo mensaje. En una máquina compartida con otros usos —una estación de trabajo, no un servidor dedicado—, esta monopolización también tiene un costo de oportunidad concreto: no puedes ejecutar nada más que consuma muchos recursos de GPU mientras una conversación entre varios agentes se ejecuta sin límite en segundo plano.
#FAQ
¿AutoGen sigue siendo desarrollado por Microsoft?+
¿Qué es AG2, y se debe usar en su lugar?+
¿Funciona AutoGen con Ollama?+
¿Por qué mis agentes hablan sin fin?+
¿Es prudente dejar que un agente ejecute código?+
¿Cuál es el modelo más pequeño usable?+
¿AutoGen (AG2) o CrewAI?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.