Yeda AI Tips · #207

English

El caché es donde los modelos abiertos se vuelven baratos

Los modelos abiertos anuncian un precio por token que parece una ganga frente a la frontera. Luego llega la factura mensual y es más alta de lo que prometía la cuenta del precio de lista. La diferencia casi siempre se remonta a un ajuste que la gente omite: el caché de entrada. No es una nota al pie — para un agente de programación, el caché es la diferencia entre una factura que te hace parpadear y otra que se acerca al costo de un almuerzo.

Por qué el precio de lista le miente a los agentes de programación

Un agente de programación no hace una pregunta y se detiene. Corre un bucle: leer el repo, hacer un plan, editar archivos, correr las pruebas, leer las fallas, arreglar lo que se rompió, volver a intentar. En cada vuelta de ese bucle reenvía un gran bloque de contexto — los mismos archivos del repositorio, el mismo system prompt, los mismos docs — porque el modelo no tiene memoria entre llamadas. Así que los tokens que más pagas no son instrucciones nuevas e ingeniosas. Son el mismo prefijo inmutable, facturado una y otra vez, decenas de veces por tarea.

Por eso "barato por token" puede aún producir un mes caro. La tarifa por token es real, pero la pagas contra un conteo de tokens inflado por relecturas constantes. Un día pesado de programación agéntica puede consumir cerca de 20 millones de tokens. A tarifas completas de entrada y salida, la factura de ese día es la que te hace parpadear.

Qué hace realmente el caché de entrada

Los proveedores cachean el prefijo estable de tu prompt. Cuando una solicitud posterior empieza con el mismo contenido, eso es un "acierto de caché" (cache hit), y esos tokens reutilizados se facturan a una fracción de la tarifa normal de entrada en lugar del precio completo. Según la documentación de caché de prompts de OpenRouter, las lecturas cacheadas suelen cobrarse a aproximadamente 0.1–0.5× la entrada normal, según el proveedor — algunos lo habilitan de forma automática, otros requieren que marques los bloques estables de forma explícita.

Las magnitudes en los modelos abiertos son justo el punto. En un modelo abierto citado en torno a $3 por millón de tokens de entrada, la entrada cacheada baja a cerca de $0.30 por millón — aproximadamente una décima parte de la tarifa de entrada de lista. Otro modelo abierto citó entrada cacheada en torno a $0.26 por millón. Pon los números lado a lado:

Tarifa (por 1M de tokens, aproximada)Entrada de listaEntrada cacheada
Modelo abierto A~$3.00~$0.30
Modelo abierto B (tarifa cacheada citada)~$0.26

Ahora vuelve a reproducir ese día pesado de programación. El contexto reutilizado — el repo, el system prompt, los docs que el agente sigue releyendo — es exactamente la parte que el caché descuenta unas 10×. El mismo día de 20 millones de tokens, con el caché funcionando sobre la entrada, sale más cerca del costo de un almuerzo. El caché es donde de verdad aparece la ventaja de costo del modelo abierto; sin él, pagas facturas con forma de frontera por un modelo con forma de descuento.

Cómo conseguir aciertos de caché de verdad

El caché solo ayuda si el prefijo de tu prompt es genuinamente estable, así que estructura el prompt en torno a eso:

Reglas prácticas

En resumen

La historia de costo del modelo abierto no es el precio de lista — es el caché. Los agentes de programación releen el mismo contexto en cada paso, así que los mismos tokens de entrada salen una y otra vez. Mantén ese contexto al frente del prompt, revisa la tarifa de entrada cacheada de tu proveedor y confirma que estás obteniendo aciertos. Haz eso, y el modelo que parecía barato sobre el papel será por fin barato en la práctica.

Recursos

¿Estás construyendo una función con IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.

Hablemos · Lee el blog