Evaluación y Seguridad de LLMs
Mide si tu IA realmente funciona, y contén el daño cuando no lo hace.
Los guardrails son dos puntos de control, no uno
La mayoría de los guardrails de IA solo revisan un lado de la conversación. Aquí te explicamos por qué necesitas una verificación de entrada y otra de salida, y cómo construir ambas.
Tip #050Un Prompt Se Va a Romper, Así que Limita el Radio de Impacto
No puedes filtrar cada inyección de prompt. Así se limita lo que un agente de IA secuestrado puede hacer realmente, con herramientas de mínimo privilegio y aprobación humana.
Tip #051Tu juez de I.A. tiene favoritos, compruébalo
LLM-as-judge escala la evaluación más allá de la revisión manual, pero hereda sesgos. Así se corre una prueba de intercambio posicional antes de confiar en el puntaje.
Tip #139Ejecuta una unidad antes de escalar
Antes de correr 10.000 llamadas de IA, corre una. Mide el costo real y luego escala — con la cuenta exacta por unidad y el 50% de descuento del batch.
Tip #140Pon un límite fijo por trabajo en cada llamada de IA automatizada
Un bug en un trabajo de IA automatizado debe producir una factura acotada, no una ilimitada — limita tokens, elementos y tiempo por llamada, y pon una alarma de presupuesto en la cuenta.
Tip #166Los secretos borrados en una capa posterior de Docker siguen vivos en el historial
Un secreto copiado o usado en un paso RUN del Dockerfile queda grabado en esa capa para siempre — borrarlo después no lo elimina, y cualquiera puede extraerlo con un solo comando. Usa build secrets.
Tip #167Reemplaza las claves de AWS de larga duración con OIDC
Las claves de acceso estáticas de AWS en CI nunca expiran, así que una sola filtración funciona hasta que alguien lo note. Cámbialas por asunción de rol con OIDC y obtén credenciales de corta duración sin nada guardado que robar.
Tip #168Audita los scripts de postinstall de cualquier paquete
npm install puede ejecutar el script de shell de un desconocido en el instante de instalar. Audita los hooks postinstall y prepare y marca los que tocan la red o el shell, para atrapar la ejecución de código de la cadena de suministro antes de que corra.
Tip #169El system prompt no es un límite de seguridad, el código sí
Una instrucción de no-revelar en tu system prompt no detiene nada, porque un usuario motivado puede convencer al modelo de saltarse cualquier instrucción. Impón la seguridad con código determinista que rodee la llamada al modelo: un filtro de entrada antes, un limpiador de salida después.
Tip #170La configuración de tu agente es una superficie de ataque
Los archivos de instrucciones, los settings y las configuraciones de servidores MCP dirigen a tu agente de código, así que una instrucción oculta o una clave filtrada ahí es una vía de brecha real. Escanéalos como código en busca de permisos comodín, secretos hardcodeados e instrucciones inyectadas.
Tip #171Cuando tu pipeline lee cargas, el contenido es el atacante
Cuando tu pipeline de IA ingiere cargas o páginas scrapeadas, el contenido mismo es el atacante. Trata el contenido no confiable como datos, nunca como instrucciones: delimítalo antes de que el modelo lo vea y nunca lo dejes fluir sin escapar hacia un shell, SQL o una ruta de archivo.
Tip #194Dale a cada nivel de severidad un piso de confianza
Cuando cada hallazgo de la IA se marca como crítico, la gente deja de leer. Condiciona cada severidad a un piso de confianza y baja un nivel ante la incertidumbre, para que un crítico signifique de verdad detente y corrige.