Yeda AI Tips · #213

English

Los agentes en paralelo cuestan siete veces más

Correr varios agentes a la vez se siente como la opción eficiente: más trabajo pasando, menos espera. La factura de tokens no está de acuerdo, y vale la pena entender el motivo con precisión, porque la versión más repetida de esta advertencia apunta a la función equivocada.

El número y su condición

La cifra documentada es que los equipos de agentes usan aproximadamente 7 veces más tokens que una sesión estándar cuando los integrantes corren en modo plan. La razón declarada es estructural: cada integrante mantiene su propia ventana de contexto y corre como una instancia separada.

Ambas mitades de esa frase importan. El multiplicador está atado a una condición, integrantes corriendo en modo plan, en vez de ser un impuesto plano sobre cualquier trabajo en paralelo. Y el mecanismo explica la forma del costo: escala con la cantidad de integrantes activos, de manera aproximadamente proporcional, porque cada uno es una sesión completa pagando su propio contexto.

Un integrante no es un trabajador liviano. Carga el archivo de reglas, los servidores MCP y las skills como cualquier sesión normal, y después sostiene su propia conversación. Cinco integrantes se parecen más a cinco personas con su propia sesión que a una sesión haciendo cinco cosas.

La corrección: los equipos no son subagentes

Acá es donde el consejo suele torcerse. Esa cifra de 7x se repite como advertencia sobre delegar en general, o específicamente sobre subagentes. No lo es. Los equipos de agentes y los subagentes son funciones distintas con perfiles de costo opuestos.

La misma documentación que reporta el multiplicador de 7x para equipos recomienda los subagentes como forma de reducir el uso de tokens. Delegar operaciones verbosas, como correr pruebas, traer documentación o procesar archivos de log, mantiene la salida ruidosa en el contexto del subagente, y a tu conversación principal solo regresa un resumen. La tabla comparativa lo dice explícito: los subagentes son la opción de menor costo porque los resultados se resumen de vuelta; los equipos son mayores porque cada integrante es una instancia separada.

Así que las dos formas son:

Que te digan "los agentes en paralelo son caros" y concluir que hay que dejar de delegar investigación es exactamente al revés. Delegar la lectura es el movimiento barato.

Cuándo un equipo sí se gana el costo

Los equipos valen el multiplicador cuando el trabajo de verdad se paraleliza y los agentes se benefician de cuestionarse entre sí. Los casos fuertes documentados son investigación y revisión sobre aspectos independientes, módulos nuevos donde cada integrante es dueño de una pieza, depuración con hipótesis en competencia, y cambios que cruzan capas.

El caso de hipótesis en competencia es el más interesante, porque el valor no es la velocidad. Un solo agente investigando un error tiende a encontrar una explicación plausible y detenerse, el clásico sesgo de anclaje. Varios investigadores tratando activamente de refutarse producen una teoría sobreviviente con mucha mayor probabilidad de ser la causa real. Estás comprando independencia de criterio, no rendimiento.

Los equipos calzan mal con trabajo secuencial, ediciones al mismo archivo, o cualquier cosa con muchas dependencias entre las piezas. Ahí la coordinación se come el paralelismo y pagaste el multiplicador a cambio de nada.

Cómo bajar el costo cuando sí usas uno

Algo más que crea equipos sin que lo pidas

Los equipos de agentes son experimentales y vienen apagados, se habilitan con CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1. Pero una vez habilitados cambian la delegación común: un subagente al que se le asigna un nombre se lanza como integrante de equipo. Los nombres se asignan de forma automática para que los agentes puedan mensajearse, lo que significa que se pueden formar equipos durante delegaciones que nunca planteaste como trabajo de equipo, y puedes estar pagando economía de equipo sin haber pedido uno.

Si ves que pasa, poner la variable en 0 restaura el comportamiento normal de subagentes, y aplica al siguiente que se cree sin necesidad de abrir una sesión nueva.

Para llevar

Paralelo no es gratis: pagas renta por cada ventana de contexto, y con equipos en modo plan son cerca de siete veces una sesión sola. Pero apunta bien la precaución: los integrantes de equipo son la forma cara, y los subagentes que leen y resumen son la barata. Usa subagentes para mirar cosas. Usa un equipo solo cuando el trabajo de verdad se divida en piezas que necesiten discutir entre sí.

¿Construyendo con IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.

Hablemos · Lee el blog