Dale a cada nivel de severidad un piso de confianza
¿Por qué las advertencias críticas de tu IA no significan nada? Demasiadas son suposiciones.
Cuando un revisor o escáner de IA etiqueta todo como crítico, la etiqueta deja de llevar información. La gente aprende que "crítico" es ruido, lo pasa por alto y con el tiempo se pierde el único hallazgo que sí era crítico. Una etiqueta de severidad solo es útil si es escasa y ganada. La solución no es un mejor modelo, es una regla: ningún hallazgo puede reclamar una severidad que no tiene la confianza suficiente para sostener.
Por qué los críticos ruidosos erosionan la confianza
La severidad es una promesa sobre cuánto importa esto. La confianza es un eje distinto: qué tan seguro está el modelo de que el hallazgo es real. Los modelos suelen confundirlos, emitiendo un "crítico" que suena seguro para una suposición endeble. Una vez que caen unos cuantos de esos, el lector se recalibra: descuenta cada crítico, incluidos los verdaderos. Un solo crítico inflado grava la credibilidad de todos. La precisión en la severidad más alta es lo que mantiene legible todo el sistema.
El mecanismo: un piso de confianza por nivel
Dale a cada severidad una confianza mínima que debe superar, y haz que el modelo reporte su confianza de forma explícita. Un hallazgo solo puede ocupar un nivel si su confianza alcanza el piso de ese nivel.
| Severidad | Piso de confianza |
|---|---|
| Crítico | 8 / 10 |
| Alto | 7 / 10 |
| Medio | 6 / 10 |
| Bajo | 4 / 10 |
Dos reglas lo hacen funcionar:
- Ante la incertidumbre, baja un nivel. Un supuesto crítico del que el modelo solo tiene confianza 7 se vuelve un alto, no un crítico. Igual se reporta, solo en el nivel que su evidencia sostiene.
- Nunca infles por las dudas. "Lo marco crítico por si acaso" es exactamente el comportamiento que destruye la señal. La incertidumbre baja un hallazgo, nunca lo sube.
Hallazgo: posible inyección SQL en el handler de reportes
Severidad estimada si es cierto: Crítico
Confianza del modelo: 7/10
Piso de crítico: 8 -> no alcanzado
Acción: bajar a Alto (piso 7, alcanzado). Reportarlo, como Alto.
El beneficio
Ahora un crítico significa de verdad detente y corrige. Como nada llega a ese nivel sin alta confianza, el lector puede confiar en él y actuar de inmediato. Los niveles bajos absorben los hallazgos inciertos, así que nada se descarta, solo se clasifica con honestidad. La señal sobrevive porque la cima de la escala se mantiene limpia.
Movidas avanzadas
- Haz de la confianza un campo de salida obligatorio. Que el modelo emita una confianza numérica por hallazgo para poder imponer el piso de forma programática, no dejarlo a la intuición.
- Impón el descenso en el código, no en el prompt. Calcula la severidad final a partir de
(severidad_estimada, confianza)en un post-paso determinista, para que un modelo demasiado entusiasta no pueda saltarse la regla. - Ajusta los pisos a tu tolerancia. Un control de seguridad que bloquea merges puede querer un piso de crítico más alto; un linter de aviso puede correr más laxo. Pon los números según el costo de un falso crítico.
- Rastrea la precisión en el nivel más alto. Muestrea los críticos y mide cuántos eran reales. Si la precisión baja, sube el piso.
Recursos
- CVSS — Common Vulnerability Scoring System (guía de severidad)
- NIST AI Risk Management Framework
- OWASP Risk Rating Methodology
- Calibración de la confianza en predicciones de machine learning — resumen
¿Desarrollas sistemas de IA o en la nube? Yeda AI audita y refuerza pipelines de LLM y contenedores en producción. Hablemos · Lee el blog