Base de Conocimiento de Yeda AI

Evaluación y Seguridad de LLMs

Mide si tu IA realmente funciona, y contén el daño cuando no lo hace.

English

← Todas las categorías

Tip #049

Los guardrails son dos puntos de control, no uno

La mayoría de los guardrails de IA solo revisan un lado de la conversación. Aquí te explicamos por qué necesitas una verificación de entrada y otra de salida, y cómo construir ambas.

Tip #050

Un Prompt Se Va a Romper, Así que Limita el Radio de Impacto

No puedes filtrar cada inyección de prompt. Así se limita lo que un agente de IA secuestrado puede hacer realmente, con herramientas de mínimo privilegio y aprobación humana.

Tip #051

Tu juez de I.A. tiene favoritos, compruébalo

LLM-as-judge escala la evaluación más allá de la revisión manual, pero hereda sesgos. Así se corre una prueba de intercambio posicional antes de confiar en el puntaje.

Tip #139

Ejecuta una unidad antes de escalar

Antes de correr 10.000 llamadas de IA, corre una. Mide el costo real y luego escala — con la cuenta exacta por unidad y el 50% de descuento del batch.

Tip #140

Pon un límite fijo por trabajo en cada llamada de IA automatizada

Un bug en un trabajo de IA automatizado debe producir una factura acotada, no una ilimitada — limita tokens, elementos y tiempo por llamada, y pon una alarma de presupuesto en la cuenta.

Tip #166

Los secretos borrados en una capa posterior de Docker siguen vivos en el historial

Un secreto copiado o usado en un paso RUN del Dockerfile queda grabado en esa capa para siempre — borrarlo después no lo elimina, y cualquiera puede extraerlo con un solo comando. Usa build secrets.

Tip #167

Reemplaza las claves de AWS de larga duración con OIDC

Las claves de acceso estáticas de AWS en CI nunca expiran, así que una sola filtración funciona hasta que alguien lo note. Cámbialas por asunción de rol con OIDC y obtén credenciales de corta duración sin nada guardado que robar.

Tip #168

Audita los scripts de postinstall de cualquier paquete

npm install puede ejecutar el script de shell de un desconocido en el instante de instalar. Audita los hooks postinstall y prepare y marca los que tocan la red o el shell, para atrapar la ejecución de código de la cadena de suministro antes de que corra.

Tip #169

El system prompt no es un límite de seguridad, el código sí

Una instrucción de no-revelar en tu system prompt no detiene nada, porque un usuario motivado puede convencer al modelo de saltarse cualquier instrucción. Impón la seguridad con código determinista que rodee la llamada al modelo: un filtro de entrada antes, un limpiador de salida después.

Tip #170

La configuración de tu agente es una superficie de ataque

Los archivos de instrucciones, los settings y las configuraciones de servidores MCP dirigen a tu agente de código, así que una instrucción oculta o una clave filtrada ahí es una vía de brecha real. Escanéalos como código en busca de permisos comodín, secretos hardcodeados e instrucciones inyectadas.

Tip #171

Cuando tu pipeline lee cargas, el contenido es el atacante

Cuando tu pipeline de IA ingiere cargas o páginas scrapeadas, el contenido mismo es el atacante. Trata el contenido no confiable como datos, nunca como instrucciones: delimítalo antes de que el modelo lo vea y nunca lo dejes fluir sin escapar hacia un shell, SQL o una ruta de archivo.

Tip #194

Dale a cada nivel de severidad un piso de confianza

Cuando cada hallazgo de la IA se marca como crítico, la gente deja de leer. Condiciona cada severidad a un piso de confianza y baja un nivel ante la incertidumbre, para que un crítico signifique de verdad detente y corrige.