Planifica caro, construye barato, revisa afilado
Quienes le sacan más provecho a los agentes de IA para código dejaron de preguntar "¿cuál es el mejor modelo?" y empezaron a preguntar "¿qué modelo para qué parte de la tarea?". Una sola tarea de programación no es un trabajo — son tres: planificar, ejecutar y revisar. Cada uno tiene una forma completamente distinta, y pagar precios de frontera por los tres es como quemas dinero en las partes que no lo necesitan.
Una tarea, tres roles
Enruta una sola tarea en tres pasadas:
- Planifica con tu modelo más fuerte y más caro. La parte difícil de programar es el pensamiento de alto nivel: leer toda la base de código, entender la solicitud, diseñar el enfoque, ver a la vuelta de la esquina. Dáselo al mejor modelo que tengas — un modelo de frontera de OpenAI o Anthropic — porque un mal plan envenena todo lo que viene después.
- Ejecuta con un modelo barato y rápido. Una vez que existe un buen plan, escribir el código es la parte fácil. No necesitas un modelo de frontera para teclear funciones contra una especificación. Un modelo más barato — algo como el nivel de código de Grok o el Composer de Cursor — hace esto bien por una fracción del precio.
- Revisa con un segundo modelo de frontera. Entrega el código terminado a un modelo fuerte distinto y pídele que verifique el trabajo contra el plan. Un modelo que revisa el código de otro modelo detecta más errores que uno que revisa el suyo propio — la autorrevisión tiene puntos ciegos.
Por qué la ejecución es donde ahorras
La parte contraintuitiva: la ejecución es la etapa más cara, no la planificación. Se reduce a la división entre tokens de entrada y de salida, y los de salida cuestan mucho más (aproximadamente $5 por millón de entrada frente a $30 por millón de salida en un modelo de frontera típico).
| Etapa | Tokens de entrada | Tokens de salida | Motor del costo |
|---|---|---|---|
| Planificar | Alto — lee toda la base de código | Bajo — solo un plan | Entrada barata |
| Ejecutar | Bajo — lee el plan | Alto — escribe todo el código | Salida cara |
| Revisar | Alto — lee el código | Bajo — un veredicto | Entrada barata |
La ejecución lee poco y escribe mucho, así que quema los tokens más caros. Esa es justo la etapa que un modelo que no es de frontera maneja bien — lo que significa que estás sacando el modelo más caro de la etapa más cara.
La matemática del costo
Corre la misma tarea de tres formas y los números son contundentes:
- Solo modelo de frontera: ≈ $81 por toda la tarea.
- Solo un modelo más barato: menos, pero perdiste calidad en la planificación.
- División mixta (plan de frontera → ejecución barata → revisión de frontera): ≈ $25 — el mismo resultado que la corrida toda de frontera.
Misma salida, alrededor de un tercio del costo. Y a menudo más rápido, porque el modelo de ejecución barato también es el rápido, y los modelos de frontera más grandes tienden a ser los más lentos.
Por qué funciona la revisión entre modelos
La pasada de revisión no es solo cuestión de costo — es una mejora de calidad. Distintos modelos escriben y razonan de forma diferente: agrupan sus errores en lugares distintos. Un modelo tiende a omitir comportamiento requerido; otro malinterpreta la intención semántica. Cuando un segundo modelo revisa el pull request del primero, no pelea contra los mismos puntos ciegos que produjeron el error, así que detecta más de ellos. Revisar tu propio código — humano o modelo — es donde se esconden los errores.
Cómo hacerlo práctico
Necesitas acceso a varios modelos detrás de un solo flujo. Un enrutador como OpenRouter expone modelos de muchos proveedores a través de una sola API compatible con OpenAI, así que puedes apuntar tu paso de planificación a un modelo y tu paso de ejecución a otro sin cablear tres SDK de proveedores. Configura tres prompts — un planificador, un ejecutor que recibe el plan, y un revisor que recibe el código más el plan — y enruta cada uno al modelo correcto.
En resumen
Deja de pagar precios de frontera por la parte fácil. Planifica caro, construye barato, revisa afilado: tu mejor modelo diseña, un modelo barato y rápido implementa, y un segundo modelo de frontera verifica el trabajo. Mismo resultado, alrededor de un tercio del costo, y normalmente más rápido — porque no todos los tokens de una tarea merecen el mismo modelo.
Recursos
- El costo por tarea, no por token — Yeda AI Tips #203
- Apunta tu agente de código a un modelo abierto — Yeda AI Tips #206
- OpenRouter — una API para muchos modelos
¿Estás construyendo una función con IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.