0.0. Esa es la mejora neta aproximada en precisión para una gran cantidad de “enjambres” multiagente una vez restado el enorme sobrecosto de coordinación y el aumento de latencia. Hemos pasado el último año fingiendo que, si un LLM es propenso a alucinar, cinco LLMs conversando entre sí de alguna manera sintetizarán la verdad. En realidad, a menudo solo estamos creando un área de superficie mayor para que las cosas salgan mal.
La industria se ha enamorado de la idea del “flujo de trabajo agéntico”, donde un agente gestor delega tareas a un agente programador, quien luego envía el trabajo a un agente revisor. Suena como una organización profesional. Se ve genial en un video de demostración. Pero como señala la investigación reciente de Anthropic, estos sistemas introducen un tipo específico de inestabilidad. Cuando encadenas agentes, no solo estás sumando sus capacidades; estás multiplicando sus tasas de error.
La mayoría de estas configuraciones son solo bucles enmascarados (que básicamente es una forma elegante de decir encadenamiento de prompts). Estamos tratando a los LLMs como empleados en una jerarquía corporativa, olvidando que no tienen intuición compartida ni un sentido común de “terminado”. Tienen prompts. Si el agente gestor da una instrucción ligeramente ambigua, el agente programador la interpreta de forma salvaje, y el agente revisor, intentando ser útil, alucina una razón por la cual el error es en realidad una característica.
Es una reunión de comité corporativo que dura cuatro horas y termina con la decisión de tener otra reunión.
La fricción aquí no es solo conceptual; es financiera y temporal. Cada vez que un agente “reflexiona” o “critica” a otro, estás quemando tokens y añadiendo segundos al TTFT. Para un desarrollador, esto es una pesadilla. Pasas de una llamada a la API predecible a un proceso estocástico que puede tardar treinta segundos o tres minutos, dependiendo de cuántas veces el “revisor” decida que el código no está del todo bien.
También está el problema de que el “bucle agéntico” se convierta en una espiral mortal. Todos lo hemos visto: dos agentes discutiendo por un error de sintaxis hasta alcanzar el límite máximo de tokens, ninguno capaz de salir del bucle para darse cuenta de que ambos están equivocados. Esto sucede porque estamos intentando resolver un problema de razonamiento con una estrategia de coordinación.
¿Por qué estamos tan obsesionados con los MAS? Probablemente porque se siente como si estuviéramos construyendo “software” de nuevo, con módulos y roles, en lugar de solo suplicarle a una caja negra que sea más inteligente. Pero añadir más cajas no hace que la caja sea más inteligente; solo hace que el sistema sea más frágil.
Es una forma costosa de fracasar.
El verdadero peligro es la propagación de una única premisa errónea. En un prompt monolítico, un modelo a veces puede autocorregirse mientras genera texto. En un sistema multiagente, una vez que un agente “especialista” registra un hecho en el estado compartido, cada agente posterior trata ese hecho como una verdad absoluta. El error está grabado a fuego.
Básicamente, estamos construyendo un juego del teléfono descompuesto donde los participantes son mentirosos extremadamente seguros de sí mismos. Si el primer agente de la cadena decide que el usuario quiere una función que no existe, el resto del enjambre pasará los siguientes diez turnos optimizando una alucinación. (Sospecho que la mayoría de los frameworks de “agentes” ignoran esto porque admitirlo significaría reconocer que el framework es inútil).
La industria está actualmente ciega por la novedad de la “autonomía”. Queremos que la IA “simplemente lo gestione”, pero la autonomía sin un modelo del mundo fiable es solo aleatoriedad con un nombre elegante. No necesitamos más agentes; necesitamos modelos que puedan mantener un plan coherente a largo plazo sin necesitar que un “gestor” los empuje cada tres párrafos.
Para el cuarto trimestre, el hype alrededor de los “enjambres de agentes” colapsará, reemplazado por un retorno a los modelos monolíticos equipados con una lógica de uso de herramientas mucho más determinista y hard-coded. Nos daremos cuenta de que un único modelo potente guiado por una máquina de estados estricta es infinitamente más útil que un comité de cinco agentes mediocres fingiendo ser una startup.