Yeda AI Tips · #165

English

Haz que tu IA diga UNVERIFIED

Lo más caro que hace tu IA es sonar segura. Una firma de método alucinada — client.stream(on_delta=...) para un callback que nunca existió — se lee exactamente igual que una real. No hay subrayado rojo, no hay advertencia. La pegas, la conectas y pierdes una hora rastreando un AttributeError hasta una función que el modelo inventó.

Por qué la confianza es el error

El análisis de OpenAI de 2025 lo cuantifica: su auditoría de los principales benchmarks encontró que 9 de 10 usaban calificación binaria que premiaba la respuesta segura y penalizaba el "no lo sé". Un modelo entrenado y evaluado con esos incentivos aprende que adivinar paga. Así que cuando no conoce el nombre exacto de un parámetro, no duda — emite la secuencia de tokens más plausible, que para código de API es una firma que se ve perfectamente idiomática y es completamente falsa.

Lo plausible es todo el problema. Las alucinaciones en prosa se huelen. Un parámetro específico de un framework no, hasta que falla en tiempo de ejecución.

La solución: cita o dilo

Dale al modelo una tercera opción explícita además de "responder" y "adivinar": abstenerse, y marcarlo. Dos reglas en tu system prompt hacen casi todo el trabajo.

  1. Todo patrón específico de un framework debe citar una documentación oficial. Nombres de métodos, claves de configuración, flags de CLI, decoradores — si no puede señalar una fuente, no puede afirmar la línea como un hecho.
  2. Cuando no pueda verificar, escribe UNVERIFIED. No silencio, no una duda enterrada en la prosa — un token literal que puedes buscar con grep antes de que el código llegue a producción.

La guía de Anthropic es el mismo instinto, dicho de tres formas:

TécnicaLo que le dices al modelo
Permitir incertidumbre"Si no estás seguro, di 'No tengo suficiente información para evaluarlo con confianza'."
Verificar con citasCita una fuente por cada afirmación; si no encuentras una, retira la afirmación
Restringir el conocimientoUsa solo la documentación provista, no el conocimiento general

Esa fila del medio es casi textualmente la regla del reel: una afirmación sin respaldo se elimina, no se suaviza.

Un prompt que puedes pegar

For any framework-specific API (method names, parameters, config keys,
CLI flags), cite the official doc URL you're relying on. If you cannot
verify a pattern against official docs, do NOT guess — write the line
and tag it: # UNVERIFIED: confirm against docs before prod.
Prefer an honest "I don't know" over a plausible invention.

Ahora el modo de falla es ruidoso. En lugar de una firma falsa escondida entre 40 líneas, obtienes una marca # UNVERIFIED y un enlace a la documentación para revisar. La hora que habrías gastado depurando se convierte en un grep de diez segundos.

Para usuarios avanzados

El objetivo no es hacer al modelo más inteligente. Es hacer su ignorancia visible. La honestidad sobre lo que no pudo verificar le gana a la falsa confianza siempre.

Recursos

<div class="cta">

¿Construyendo una función con IA? Yeda AI diseña, audita y lanza sistemas LLM de producción que fallan en voz alta, no en silencio.

Habla con nosotros · Lee el blog

</div>