El caché es donde los modelos abiertos se vuelven baratos
Los modelos abiertos anuncian un precio por token que parece una ganga frente a la frontera. Luego llega la factura mensual y es más alta de lo que prometía la cuenta del precio de lista. La diferencia casi siempre se remonta a un ajuste que la gente omite: el caché de entrada. No es una nota al pie — para un agente de programación, el caché es la diferencia entre una factura que te hace parpadear y otra que se acerca al costo de un almuerzo.
Por qué el precio de lista le miente a los agentes de programación
Un agente de programación no hace una pregunta y se detiene. Corre un bucle: leer el repo, hacer un plan, editar archivos, correr las pruebas, leer las fallas, arreglar lo que se rompió, volver a intentar. En cada vuelta de ese bucle reenvía un gran bloque de contexto — los mismos archivos del repositorio, el mismo system prompt, los mismos docs — porque el modelo no tiene memoria entre llamadas. Así que los tokens que más pagas no son instrucciones nuevas e ingeniosas. Son el mismo prefijo inmutable, facturado una y otra vez, decenas de veces por tarea.
Por eso "barato por token" puede aún producir un mes caro. La tarifa por token es real, pero la pagas contra un conteo de tokens inflado por relecturas constantes. Un día pesado de programación agéntica puede consumir cerca de 20 millones de tokens. A tarifas completas de entrada y salida, la factura de ese día es la que te hace parpadear.
Qué hace realmente el caché de entrada
Los proveedores cachean el prefijo estable de tu prompt. Cuando una solicitud posterior empieza con el mismo contenido, eso es un "acierto de caché" (cache hit), y esos tokens reutilizados se facturan a una fracción de la tarifa normal de entrada en lugar del precio completo. Según la documentación de caché de prompts de OpenRouter, las lecturas cacheadas suelen cobrarse a aproximadamente 0.1–0.5× la entrada normal, según el proveedor — algunos lo habilitan de forma automática, otros requieren que marques los bloques estables de forma explícita.
Las magnitudes en los modelos abiertos son justo el punto. En un modelo abierto citado en torno a $3 por millón de tokens de entrada, la entrada cacheada baja a cerca de $0.30 por millón — aproximadamente una décima parte de la tarifa de entrada de lista. Otro modelo abierto citó entrada cacheada en torno a $0.26 por millón. Pon los números lado a lado:
| Tarifa (por 1M de tokens, aproximada) | Entrada de lista | Entrada cacheada |
|---|---|---|
| Modelo abierto A | ~$3.00 | ~$0.30 |
| Modelo abierto B (tarifa cacheada citada) | — | ~$0.26 |
Ahora vuelve a reproducir ese día pesado de programación. El contexto reutilizado — el repo, el system prompt, los docs que el agente sigue releyendo — es exactamente la parte que el caché descuenta unas 10×. El mismo día de 20 millones de tokens, con el caché funcionando sobre la entrada, sale más cerca del costo de un almuerzo. El caché es donde de verdad aparece la ventaja de costo del modelo abierto; sin él, pagas facturas con forma de frontera por un modelo con forma de descuento.
Cómo conseguir aciertos de caché de verdad
El caché solo ayuda si el prefijo de tu prompt es genuinamente estable, así que estructura el prompt en torno a eso:
- Pon primero el contexto grande e inmutable. Los archivos del repo, el system prompt y los docs de referencia van al frente del prompt para que el prefijo estable sea idéntico byte por byte entre corridas. Cualquier cosa que cambie en cada turno — la instrucción más reciente, la salida más nueva de una herramienta — va al final.
- No dejes que ediciones pequeñas rompan el prefijo. Una marca de tiempo, un orden de archivos barajado o una línea de system reescrita cerca del inicio invalida el caché para todo lo que sigue. Mantén congelado el encabezado del prompt.
- Revisa el precio separado de entrada cacheada del proveedor. Es una línea de costo distinta y mucho más baja que la tarifa de entrada de lista. Si un proveedor no publica una, no obtienes el descuento — y el precio de portada del modelo abierto solo te cuenta la mitad de la historia.
- Confirma que estás obteniendo aciertos. Muchos proveedores reportan el conteo de tokens cacheados frente a los frescos por solicitud. Si tu conteo de tokens cacheados se queda cerca de cero a lo largo de una corrida larga del agente, tu prefijo no es estable — arregla el orden antes de confiar en el ahorro.
Reglas prácticas
- El precio por token te dice el techo, no la factura. Para bucles de agente, la tarifa de entrada cacheada es el número que decide tu mes.
- La entrada cacheada suele correr a cerca de una décima parte de la entrada de lista — trata esa diferencia como la verdadera razón para reutilizar el contexto de forma deliberada.
- Lo estable arriba, lo volátil abajo. Ese solo hábito de orden es casi todo lo que enciende el caché.
- Antes de comparar dos modelos abiertos por precio, compara sus tarifas de entrada cacheada, no solo las de lista.
En resumen
La historia de costo del modelo abierto no es el precio de lista — es el caché. Los agentes de programación releen el mismo contexto en cada paso, así que los mismos tokens de entrada salen una y otra vez. Mantén ese contexto al frente del prompt, revisa la tarifa de entrada cacheada de tu proveedor y confirma que estás obteniendo aciertos. Haz eso, y el modelo que parecía barato sobre el papel será por fin barato en la práctica.
Recursos
- Costo por tarea, no por token — Yeda AI Tips #203
- Apunta tu agente de programación a un modelo abierto — Yeda AI Tips #206
- OpenRouter — caché de prompts
¿Estás construyendo una función con IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.