Ajusta El Esfuerzo Al Tamaño De La Tarea
Si cada sesión de agente que abres está configurada al máximo esfuerzo de razonamiento, estás pagando el mismo peaje por "qué lenguajes usa este código" que por "define cinco posibles funciones nuevas". Una de esas es una consulta de cinco segundos. La otra realmente necesita que el agente explore, sopese compensaciones y piense. Tratarlas igual significa que la pregunta rápida hace fila detrás de la lenta.
El problema: un solo nivel de esfuerzo para cada tarea
La mayoría de los agentes de programación exponen alguna noción de esfuerzo de razonamiento o nivel de modelo: una perilla que intercambia latencia por profundidad de exploración. Dejada en "alto" por defecto, cada sesión paga por un razonamiento profundo lo necesite la tarea o no. Una consulta rápida que podría devolverse en segundos toma minutos, porque usa el mismo presupuesto que una tarea que tiene que explorar todo el código y proponer opciones.
El error inverso es igual de costoso: bajar cada sesión a esfuerzo bajo para que todo se sienta rápido, y luego obtener una respuesta superficial en una tarea que en realidad necesitaba que el agente indagara.
Ajusta la sesión a la tarea
Ejecuta un puñado de terminales o sesiones a la vez, y define el nivel de esfuerzo por sesión según lo que esa tarea específica necesita:
- Esfuerzo alto: trabajo que requiere exploración o criterio; "define cinco posibles funciones nuevas" necesita que el agente examine el código y razone sobre las compensaciones antes de responder.
- Esfuerzo bajo: consultas puntuales y factuales; "qué lenguajes se usan en este código" no necesita un razonamiento profundo, solo un escaneo rápido.
- Esfuerzo medio: el punto intermedio; tareas con algo de ambigüedad pero un alcance acotado.
En la práctica esto se ve como cuatro terminales corriendo lado a lado: dos en esfuerzo alto para el trabajo exploratorio, una en medio, una en bajo para la consulta rápida. La sesión de esfuerzo bajo regresa con su respuesta mientras las de esfuerzo alto siguen trabajando; no estás bloqueado esperando a que la más lenta llegue a la pregunta que ya podrías haber respondido.
Cómo ejecutarlo
- Enumera lo que realmente necesitas responder o construir ahora mismo.
- Ordena cada elemento según cuánta exploración o criterio requiere de verdad.
- Abre una sesión por tarea.
- Define el esfuerzo o el nivel de modelo por sesión: alto para el trabajo exploratorio o creativo, bajo para las consultas rápidas, medio para todo lo demás.
- Enruta cada tarea a su sesión correspondiente y déjalas correr en paralelo.
La ganancia no es solo velocidad en las tareas fáciles; es que la tarea difícil también recibe el pensamiento profundo que necesita, sin interrupciones, en lugar de apurarse con una configuración baja compartida para mantener todo lo demás ágil.
El límite: las sesiones en paralelo tienen un techo
Ejecutar sesiones en paralelo no escala indefinidamente. Hay un techo práctico de cuántos flujos concurrentes una persona puede realmente seguir y revisar: alrededor de cuatro a la vez antes de que solo estés hojeando y perdiéndote cosas. Pasado ese punto, agregar más sesiones no suma rendimiento, suma sesiones que olvidarás revisar.
Trucos avanzados
- Vigila el contexto, no solo el esfuerzo. A medida que la ventana de contexto de una sesión de larga duración se llena, las respuestas empiezan a desviarse; el agente pierde el hilo de decisiones anteriores o se repite, sin importar el nivel de esfuerzo.
- Limpia o compacta antes de que empiece la deriva. No dejes que una sesión de esfuerzo alto corra indefinidamente sobre un historial cada vez más inflado; límpiala o compáctala de forma proactiva.
- Reserva el esfuerzo máximo para el trabajo genuinamente abierto. Si una tarea tiene una respuesta acotada y factual, no necesita la configuración más profunda por más "importante" que se sienta.
¿Construyendo una función con IA? Yeda AI diseña, audita y despliega sistemas LLM en producción.