Yeda AI Tips · #020

English

Ajusta El Esfuerzo Al Tamaño De La Tarea

Si cada sesión de agente que abres está configurada al máximo esfuerzo de razonamiento, estás pagando el mismo peaje por "qué lenguajes usa este código" que por "define cinco posibles funciones nuevas". Una de esas es una consulta de cinco segundos. La otra realmente necesita que el agente explore, sopese compensaciones y piense. Tratarlas igual significa que la pregunta rápida hace fila detrás de la lenta.

El problema: un solo nivel de esfuerzo para cada tarea

La mayoría de los agentes de programación exponen alguna noción de esfuerzo de razonamiento o nivel de modelo: una perilla que intercambia latencia por profundidad de exploración. Dejada en "alto" por defecto, cada sesión paga por un razonamiento profundo lo necesite la tarea o no. Una consulta rápida que podría devolverse en segundos toma minutos, porque usa el mismo presupuesto que una tarea que tiene que explorar todo el código y proponer opciones.

El error inverso es igual de costoso: bajar cada sesión a esfuerzo bajo para que todo se sienta rápido, y luego obtener una respuesta superficial en una tarea que en realidad necesitaba que el agente indagara.

Ajusta la sesión a la tarea

Ejecuta un puñado de terminales o sesiones a la vez, y define el nivel de esfuerzo por sesión según lo que esa tarea específica necesita:

En la práctica esto se ve como cuatro terminales corriendo lado a lado: dos en esfuerzo alto para el trabajo exploratorio, una en medio, una en bajo para la consulta rápida. La sesión de esfuerzo bajo regresa con su respuesta mientras las de esfuerzo alto siguen trabajando; no estás bloqueado esperando a que la más lenta llegue a la pregunta que ya podrías haber respondido.

Cómo ejecutarlo

  1. Enumera lo que realmente necesitas responder o construir ahora mismo.
  2. Ordena cada elemento según cuánta exploración o criterio requiere de verdad.
  3. Abre una sesión por tarea.
  4. Define el esfuerzo o el nivel de modelo por sesión: alto para el trabajo exploratorio o creativo, bajo para las consultas rápidas, medio para todo lo demás.
  5. Enruta cada tarea a su sesión correspondiente y déjalas correr en paralelo.

La ganancia no es solo velocidad en las tareas fáciles; es que la tarea difícil también recibe el pensamiento profundo que necesita, sin interrupciones, en lugar de apurarse con una configuración baja compartida para mantener todo lo demás ágil.

El límite: las sesiones en paralelo tienen un techo

Ejecutar sesiones en paralelo no escala indefinidamente. Hay un techo práctico de cuántos flujos concurrentes una persona puede realmente seguir y revisar: alrededor de cuatro a la vez antes de que solo estés hojeando y perdiéndote cosas. Pasado ese punto, agregar más sesiones no suma rendimiento, suma sesiones que olvidarás revisar.

Trucos avanzados

¿Construyendo una función con IA? Yeda AI diseña, audita y despliega sistemas LLM en producción.

Hablemos · Lee el blog