Yeda AI Tips · #140

English

Pon un límite fijo por trabajo en cada llamada de IA automatizada

Cada llamada de IA automatizada necesita un límite fijo. Un bug debe producir una factura acotada, no una ilimitada. Cuando hay una persona en el proceso, un prompt descontrolado es molesto — lo notas y lo detienes. Cuando la llamada corre en un cron, en un worker de una cola o dentro del bucle de un agente, nadie observa cada ejecución y el medidor sube en silencio toda la noche.

Por qué el gasto recurrente es el peligroso

El gasto interactivo se limita solo: hay alguien ahí sentado. El gasto automatizado no. Los tres modos de falla clásicos multiplican tu factura sin que nadie lo note:

Ninguno de estos lanza un error. Simplemente cuestan dinero hasta que llega la factura.

Limita los tres ejes, luego pon una alarma en la cuenta

Pon un límite fijo en cada eje por el que un trabajo descontrolado pueda crecer, en el punto de la llamada — no en una configuración que nadie lee.

EjeQué limitarCómo
Longitud de salidaTokens que el modelo puede generarmax_tokens (Anthropic) / max_completion_tokens (OpenAI)
Tamaño del loteElementos procesados por ejecuciónRecorta la lista de entrada; falla en firme al pasar un tope
Tiempo de relojTiempo que puede tomar una llamadatimeout de la petición, más un deadline a nivel de trabajo
DineroGasto total en la cuentaUna alarma de presupuesto en la nube

En la Messages API de Anthropic, max_tokens es un parámetro obligatorio — no puedes hacer una llamada sin declarar el tope. En Chat Completions de OpenAI, max_tokens quedó obsoleto en septiembre de 2024 en favor de max_completion_tokens, la única forma que aceptan los modelos de razonamiento de la serie o. Ponlo deliberadamente en lo que la tarea realmente necesita, no en el máximo.

Limitar los tokens acota una llamada. Limitar los elementos acota el fan-out — un trabajo que debería tocar 100 filas debe negarse a tocar 100.000. Limitar el tiempo acota una llamada colgada. Y una alarma de presupuesto es el respaldo para todo lo que olvidaste: vigila el dinero directamente.

El respaldo a nivel de cuenta

Incluso un trabajo perfectamente limitado puede sorprenderte cuando diez de ellos corren a la vez. Pon una alarma de gasto en cualquier cuenta contra la que la automatización pueda facturar. AWS Budgets, por ejemplo, te permite crear un cost budget con un objetivo mensual fijo y recibir avisos tanto del gasto actual (ya acumulado) como del forecasted (proyectado) — un patrón común es una alerta al 80% del presupuesto. Las notificaciones van a correo o a un topic de Amazon SNS. Los presupuestos se actualizan hasta tres veces al día, así que trata la alarma como un piso, no como un interruptor en tiempo real.

Movimientos avanzados

Recursos

¿Corres LLMs en producción? Yeda AI diseña, audita y despliega sistemas de IA automatizados con las barreras de seguridad incorporadas.

Habla con nosotros · Lee el blog