Yeda AI Tips · #139

English

Ejecuta una unidad antes de escalar

¿Vas a correr un trabajo por lotes de IA? Mide el costo de un ítem antes de correr diez mil. El dinero gastado en una llamada de API es tan real como una caída, y mucho más silencioso: nadie te alerta, el trabajo simplemente termina y llega la factura. Un lote de miles multiplica cualquier error de tu estimación — así que el lugar más barato para detectar un problema es en la unidad número uno.

La cuenta es implacable porque es lineal

El costo de un lote es casi perfectamente lineal: total ≈ costo por unidad × volumen. No hay ninguna economía de escala escondida en el medio que te salve. Si una llamada cuesta 2x más de lo que supusiste, diez mil llamadas también cuestan 2x más. Esa linealidad corta para ambos lados: significa que una sola unidad medida predice todo el lote.

La propia documentación de precios de Anthropic trae un ejemplo concreto: clasificar 10.000 tickets de soporte de ~3.700 tokens cada uno con Claude Haiku 4.5 ($1/M de entrada, $5/M de salida) cuesta alrededor de $37.00. Cambia el modelo a Claude Opus 4.8 ($5/M de entrada, $25/M de salida) y los mismos 10.000 tickets cuestan aproximadamente 5x más — mismo código, mismos prompts, una línea de configuración. Ese es el número que quieres ver antes de arrancar, no después.

El hábito de tres pasos

  1. Estima. Anota costo por unidad × volumen desde la tabla de precios del modelo. Incluso un conteo aproximado de tokens te lleva al orden de magnitud correcto.
  2. Ejecuta exactamente una unidad. Envía un solo ítem real y lee el bloque usage de la respuesta (tokens de entrada, tokens de salida). Multiplica por la tabla de precios para obtener el costo real por unidad.
  3. Concilia y luego escala. Si el costo medido coincide con la estimación, escala. Si es 3x más alto, acabas de evitar un lote 3x sobrecosteado — averigua por qué primero (un system prompt enorme, una salida sin límite, un bucle de reintentos).

Un bug detectado en el paso 2 produce una factura de una unidad. El mismo bug detectado después del lote completo produce una de $500.

Reglas prácticas

SituaciónQué revisar en la única unidad
Prompt compartido largoCachéalo — un cache hit se lee a ~10% del precio de entrada
La salida varía de largoFija max_tokens; una salida sin límite es costo sin límite
Reintentos ante fallosLimita los intentos — una tormenta de reintentos multiplica la factura
Trabajo no urgenteUsa el Batch API — 50% de descuento en entrada y salida
Cualquier trabajo automatizadoAcota el tamaño del lote para que un bug siga siendo barato

Nivel avanzado: descuentos de batch y topes reales

Si los resultados no tienen que ser instantáneos, los dos proveedores principales ofrecen un Batch API asíncrono con 50% de descuento en tokens de entrada y salida. Los lotes de OpenAI aceptan hasta 50.000 solicitudes (200 MB) y se completan en 24 horas. Los Message Batches de Anthropic aceptan hasta 100.000 solicitudes (256 MB), y la mayoría termina en menos de una hora. Para evals, clasificación y enriquecimiento offline, eso es la mitad de precio por esperar un poco.

Una trampa: las configuraciones de "presupuesto mensual" de las plataformas son cada vez más alertas, no cortes duros — te envían un correo y siguen sirviendo tráfico. No dependas de ellas como red de seguridad. El tope real es el que escribes en el trabajo: acota la cantidad de ítems por corrida, para que el peor caso sea costo por unidad × tu tope, no costo por unidad × infinito. Mide una, acota el resto.

Recursos

¿Llevas IA a escala? Yeda AI diseña, audita y lanza sistemas LLM en producción — con la cuenta de costos hecha desde el inicio.

Hablemos · Lee el blog