Ejecuta una unidad antes de escalar
¿Vas a correr un trabajo por lotes de IA? Mide el costo de un ítem antes de correr diez mil. El dinero gastado en una llamada de API es tan real como una caída, y mucho más silencioso: nadie te alerta, el trabajo simplemente termina y llega la factura. Un lote de miles multiplica cualquier error de tu estimación — así que el lugar más barato para detectar un problema es en la unidad número uno.
La cuenta es implacable porque es lineal
El costo de un lote es casi perfectamente lineal: total ≈ costo por unidad × volumen. No hay ninguna economía de escala escondida en el medio que te salve. Si una llamada cuesta 2x más de lo que supusiste, diez mil llamadas también cuestan 2x más. Esa linealidad corta para ambos lados: significa que una sola unidad medida predice todo el lote.
La propia documentación de precios de Anthropic trae un ejemplo concreto: clasificar 10.000 tickets de soporte de ~3.700 tokens cada uno con Claude Haiku 4.5 ($1/M de entrada, $5/M de salida) cuesta alrededor de $37.00. Cambia el modelo a Claude Opus 4.8 ($5/M de entrada, $25/M de salida) y los mismos 10.000 tickets cuestan aproximadamente 5x más — mismo código, mismos prompts, una línea de configuración. Ese es el número que quieres ver antes de arrancar, no después.
El hábito de tres pasos
- Estima. Anota
costo por unidad × volumendesde la tabla de precios del modelo. Incluso un conteo aproximado de tokens te lleva al orden de magnitud correcto. - Ejecuta exactamente una unidad. Envía un solo ítem real y lee el bloque
usagede la respuesta (tokens de entrada, tokens de salida). Multiplica por la tabla de precios para obtener el costo real por unidad. - Concilia y luego escala. Si el costo medido coincide con la estimación, escala. Si es 3x más alto, acabas de evitar un lote 3x sobrecosteado — averigua por qué primero (un system prompt enorme, una salida sin límite, un bucle de reintentos).
Un bug detectado en el paso 2 produce una factura de una unidad. El mismo bug detectado después del lote completo produce una de $500.
Reglas prácticas
| Situación | Qué revisar en la única unidad |
|---|---|
| Prompt compartido largo | Cachéalo — un cache hit se lee a ~10% del precio de entrada |
| La salida varía de largo | Fija max_tokens; una salida sin límite es costo sin límite |
| Reintentos ante fallos | Limita los intentos — una tormenta de reintentos multiplica la factura |
| Trabajo no urgente | Usa el Batch API — 50% de descuento en entrada y salida |
| Cualquier trabajo automatizado | Acota el tamaño del lote para que un bug siga siendo barato |
Nivel avanzado: descuentos de batch y topes reales
Si los resultados no tienen que ser instantáneos, los dos proveedores principales ofrecen un Batch API asíncrono con 50% de descuento en tokens de entrada y salida. Los lotes de OpenAI aceptan hasta 50.000 solicitudes (200 MB) y se completan en 24 horas. Los Message Batches de Anthropic aceptan hasta 100.000 solicitudes (256 MB), y la mayoría termina en menos de una hora. Para evals, clasificación y enriquecimiento offline, eso es la mitad de precio por esperar un poco.
Una trampa: las configuraciones de "presupuesto mensual" de las plataformas son cada vez más alertas, no cortes duros — te envían un correo y siguen sirviendo tráfico. No dependas de ellas como red de seguridad. El tope real es el que escribes en el trabajo: acota la cantidad de ítems por corrida, para que el peor caso sea costo por unidad × tu tope, no costo por unidad × infinito. Mide una, acota el resto.
Recursos
- Guía del Batch API de OpenAI — 50% de descuento, 50k solicitudes, ventana de 24h
- Message Batches de Anthropic — 50% de descuento, límites de 100k/256 MB
- Precios de Anthropic — tarifas por token y el ejemplo de los 10.000 tickets
- Rate limits de OpenAI — throughput y topes por nivel de uso
- Read this article in English
¿Llevas IA a escala? Yeda AI diseña, audita y lanza sistemas LLM en producción — con la cuenta de costos hecha desde el inicio.