Yeda AI Tips · #214

English

El modelo barato que sale más caro

Llevas una hora de sesión. La siguiente pregunta es trivial, así que cambias al modelo más chico, barato y rápido para responderla. Es el movimiento obviamente sensato, y según cuánta conversación traigas atrás, puede costar más que no haberlo hecho.

El caché es lo que hace viables las sesiones largas

Cada solicitud de una conversación arrastra todo el historial. Sin caché eso sería ruinoso, así que el historial completo se cachea y se relee a tarifa de caché en vez de reprocesarse desde cero. Por eso una sesión larga no cuesta proporcionalmente más por mensaje a medida que crece.

La propiedad crítica es que el caché es una coincidencia de prefijo: cualquier cambio de bytes en cualquier punto del prefijo invalida todo lo que viene después. Y el caché pertenece a un modelo específico. No es un almacén compartido del que distintos modelos leen: cada uno tiene el suyo.

Qué hace realmente el cambio

Cambia de modelo a mitad de conversación y el nuevo no tiene caché para esta conversación. Todo lo anterior es entrada sin cachear para él. Así que lee tu historial completo a precio completo sin caché, para responder la pregunta chica por la que cambiaste.

Después regresas, y el primer modelo también tiene que reconstruir. Ya pagaste tarifa completa sin caché por el mismo contexto dos veces, una en cada dirección, más el costo de lo que realmente preguntaste.

La aritmética se invierte conforme crece la conversación. Al principio, con unos pocos miles de tokens de historial, cambiar es barato y la tarifa menor del modelo chico gana con holgura. Con cien mil tokens de contexto, el costo único de reconstruir caché dos veces puede empequeñecer el ahorro de una sola respuesta corta. El instinto que dice "modelo más barato, respuesta más barata" solo pone precio a la respuesta, no a la relectura.

Nota: El mismo mecanismo aplica a otros cambios a mitad de conversación, no solo al modelo. Cambiar el ajuste de velocidad también invalida el caché de prompt, así que activar un modo más rápido a la mitad de una sesión larga tiene la misma forma de costo: vuelves a pagar por el contexto existente a las tarifas de la nueva configuración.

Elige el modelo en los límites de cada tarea

La regla que sale de esto es simple: la elección de modelo es una decisión por tarea, no por pregunta.

Decide al empezar una pieza de trabajo y quédate ahí mientras dure. Si lo siguiente de verdad es otro trabajo que le calza a un modelo más barato, esa es buena razón para abrir una sesión nueva con ese modelo: de todos modos no ibas a reutilizar el contexto, y limpiar entre tareas no relacionadas es el hábito de contexto de mayor valor sin importar nada más.

Una señal útil: si sientes el impulso de cambiar de modelo a mitad de tarea, suele ser evidencia de que la tarea debieron ser dos sesiones. El impulso normalmente lo dispara una pregunta que en realidad no es parte del trabajo actual.

Y si la pregunta lateral de verdad es chica, hay formas más baratas de hacerla que un cambio de modelo. Un mecanismo de pregunta lateral que no se suma a la conversación evita el problema completo, porque nunca invalidas nada.

La otra trampa de caché de la misma familia

Una vez que sabes que el caché es lo que te sostiene, un segundo patrón cobra sentido: tu primer mensaje después de una pausa larga puede salir inesperadamente caro, porque el caché tiene una vida útil y una sesión inactiva se sale de ella. La siguiente solicitud reprocesa el contexto completo.

Esa vida útil es de una hora en una suscripción y baja a cinco minutos cuando ya estás usando créditos de uso; con una llave de API o un proveedor en la nube son cinco minutos por defecto. Así que el costo de irte a almorzar a mitad de sesión no es cero, y en una sesión muy grande conviene tenerlo presente al volver.

Esto también explica por qué el uso puede subir en una sesión larga que se siente inactiva: cualquier cosa que inicie un turno nuevo, como una tarea programada que se dispara, un mensaje que llega de otra sesión o una revisión de meta, manda el contexto completo otra vez.

Para llevar

El modelo barato solo es barato al principio de la conversación. El caché de prompt pertenece a un modelo, así que cambiar a mitad de tarea significa pagar precio completo por releer todo lo que ya dijiste, y pagar de nuevo al regresar. Elige el modelo cuando eliges la tarea; si la siguiente pregunta no pertenece a esa tarea, dale su propia sesión.

¿Construyendo con IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.

Hablemos · Lee el blog