Los agentes en paralelo cuestan siete veces más
Correr varios agentes a la vez se siente como la opción eficiente: más trabajo pasando, menos espera. La factura de tokens no está de acuerdo, y vale la pena entender el motivo con precisión, porque la versión más repetida de esta advertencia apunta a la función equivocada.
El número y su condición
La cifra documentada es que los equipos de agentes usan aproximadamente 7 veces más tokens que una sesión estándar cuando los integrantes corren en modo plan. La razón declarada es estructural: cada integrante mantiene su propia ventana de contexto y corre como una instancia separada.
Ambas mitades de esa frase importan. El multiplicador está atado a una condición, integrantes corriendo en modo plan, en vez de ser un impuesto plano sobre cualquier trabajo en paralelo. Y el mecanismo explica la forma del costo: escala con la cantidad de integrantes activos, de manera aproximadamente proporcional, porque cada uno es una sesión completa pagando su propio contexto.
Un integrante no es un trabajador liviano. Carga el archivo de reglas, los servidores MCP y las skills como cualquier sesión normal, y después sostiene su propia conversación. Cinco integrantes se parecen más a cinco personas con su propia sesión que a una sesión haciendo cinco cosas.
La corrección: los equipos no son subagentes
Acá es donde el consejo suele torcerse. Esa cifra de 7x se repite como advertencia sobre delegar en general, o específicamente sobre subagentes. No lo es. Los equipos de agentes y los subagentes son funciones distintas con perfiles de costo opuestos.
La misma documentación que reporta el multiplicador de 7x para equipos recomienda los subagentes como forma de reducir el uso de tokens. Delegar operaciones verbosas, como correr pruebas, traer documentación o procesar archivos de log, mantiene la salida ruidosa en el contexto del subagente, y a tu conversación principal solo regresa un resumen. La tabla comparativa lo dice explícito: los subagentes son la opción de menor costo porque los resultados se resumen de vuelta; los equipos son mayores porque cada integrante es una instancia separada.
Así que las dos formas son:
- Subagente: lee mucho, devuelve un resumen. El efecto neto sobre tu contexto principal suele ser negativo: gastas un poco para no gastar mucho.
- Integrante de equipo: una sesión paralela completa con su propio contexto, sus herramientas y su conversación. El efecto neto es aditivo y se multiplica con el tamaño del equipo.
Que te digan "los agentes en paralelo son caros" y concluir que hay que dejar de delegar investigación es exactamente al revés. Delegar la lectura es el movimiento barato.
Cuándo un equipo sí se gana el costo
Los equipos valen el multiplicador cuando el trabajo de verdad se paraleliza y los agentes se benefician de cuestionarse entre sí. Los casos fuertes documentados son investigación y revisión sobre aspectos independientes, módulos nuevos donde cada integrante es dueño de una pieza, depuración con hipótesis en competencia, y cambios que cruzan capas.
El caso de hipótesis en competencia es el más interesante, porque el valor no es la velocidad. Un solo agente investigando un error tiende a encontrar una explicación plausible y detenerse, el clásico sesgo de anclaje. Varios investigadores tratando activamente de refutarse producen una teoría sobreviviente con mucha mayor probabilidad de ser la causa real. Estás comprando independencia de criterio, no rendimiento.
Los equipos calzan mal con trabajo secuencial, ediciones al mismo archivo, o cualquier cosa con muchas dependencias entre las piezas. Ahí la coordinación se come el paralelismo y pagaste el multiplicador a cambio de nada.
Cómo bajar el costo cuando sí usas uno
- Empieza con 3 a 5 integrantes. Más allá, la coordinación crece y los retornos disminuyen. Tres integrantes enfocados suelen superar a cinco dispersos: con 15 tareas independientes, tres es un punto de partida razonable.
- Usa un modelo más barato para los integrantes. El trabajo de coordinación no necesita tu modelo más capaz.
- Mantén enfocados los prompts de creación. Los integrantes ya cargan el archivo de reglas, los servidores y las skills; todo lo que agregues al prompt es contexto que cargan desde su primer token.
- Apágalos cuando terminen. Un integrante activo sigue consumiendo tokens hasta que sale o termina la sesión.
- Vigila el TTL del caché. Las solicitudes de un integrante en proceso quedan fuera del bucket de caché de la conversación principal, así que su caché dura cinco minutos por defecto. Ajusta
subagentPromptCacheTtla1hpara conservarlo más, considerando que las escrituras de caché de una hora se cobran a una tarifa mayor.
Algo más que crea equipos sin que lo pidas
Los equipos de agentes son experimentales y vienen apagados, se habilitan con CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1. Pero una vez habilitados cambian la delegación común: un subagente al que se le asigna un nombre se lanza como integrante de equipo. Los nombres se asignan de forma automática para que los agentes puedan mensajearse, lo que significa que se pueden formar equipos durante delegaciones que nunca planteaste como trabajo de equipo, y puedes estar pagando economía de equipo sin haber pedido uno.
Si ves que pasa, poner la variable en 0 restaura el comportamiento normal de subagentes, y aplica al siguiente que se cree sin necesidad de abrir una sesión nueva.
Para llevar
Paralelo no es gratis: pagas renta por cada ventana de contexto, y con equipos en modo plan son cerca de siete veces una sesión sola. Pero apunta bien la precaución: los integrantes de equipo son la forma cara, y los subagentes que leen y resumen son la barata. Usa subagentes para mirar cosas. Usa un equipo solo cuando el trabajo de verdad se divida en piezas que necesiten discutir entre sí.
¿Construyendo con IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.