Haz que tu IA diga UNVERIFIED
Lo más caro que hace tu IA es sonar segura. Una firma de método alucinada — client.stream(on_delta=...) para un callback que nunca existió — se lee exactamente igual que una real. No hay subrayado rojo, no hay advertencia. La pegas, la conectas y pierdes una hora rastreando un AttributeError hasta una función que el modelo inventó.
Por qué la confianza es el error
El análisis de OpenAI de 2025 lo cuantifica: su auditoría de los principales benchmarks encontró que 9 de 10 usaban calificación binaria que premiaba la respuesta segura y penalizaba el "no lo sé". Un modelo entrenado y evaluado con esos incentivos aprende que adivinar paga. Así que cuando no conoce el nombre exacto de un parámetro, no duda — emite la secuencia de tokens más plausible, que para código de API es una firma que se ve perfectamente idiomática y es completamente falsa.
Lo plausible es todo el problema. Las alucinaciones en prosa se huelen. Un parámetro específico de un framework no, hasta que falla en tiempo de ejecución.
La solución: cita o dilo
Dale al modelo una tercera opción explícita además de "responder" y "adivinar": abstenerse, y marcarlo. Dos reglas en tu system prompt hacen casi todo el trabajo.
- Todo patrón específico de un framework debe citar una documentación oficial. Nombres de métodos, claves de configuración, flags de CLI, decoradores — si no puede señalar una fuente, no puede afirmar la línea como un hecho.
- Cuando no pueda verificar, escribe
UNVERIFIED. No silencio, no una duda enterrada en la prosa — un token literal que puedes buscar con grep antes de que el código llegue a producción.
La guía de Anthropic es el mismo instinto, dicho de tres formas:
| Técnica | Lo que le dices al modelo |
|---|---|
| Permitir incertidumbre | "Si no estás seguro, di 'No tengo suficiente información para evaluarlo con confianza'." |
| Verificar con citas | Cita una fuente por cada afirmación; si no encuentras una, retira la afirmación |
| Restringir el conocimiento | Usa solo la documentación provista, no el conocimiento general |
Esa fila del medio es casi textualmente la regla del reel: una afirmación sin respaldo se elimina, no se suaviza.
Un prompt que puedes pegar
For any framework-specific API (method names, parameters, config keys,
CLI flags), cite the official doc URL you're relying on. If you cannot
verify a pattern against official docs, do NOT guess — write the line
and tag it: # UNVERIFIED: confirm against docs before prod.
Prefer an honest "I don't know" over a plausible invention.
Ahora el modo de falla es ruidoso. En lugar de una firma falsa escondida entre 40 líneas, obtienes una marca # UNVERIFIED y un enlace a la documentación para revisar. La hora que habrías gastado depurando se convierte en un grep de diez segundos.
Para usuarios avanzados
- Extrae citas primero. Para documentos largos (>20k tokens), Anthropic recomienda pedirle al modelo que extraiga citas palabra por palabra antes de responder, y luego razone solo a partir de esas citas. El anclaje le gana a la memoria.
- Pasada de retractación posterior. Después de un borrador, haz que el modelo relea cada afirmación y busque una cita de respaldo; lo que no pueda respaldar se elimina y se marca con corchetes vacíos
[]. Segunda pasada barata que atrapa los restos confiados. - Restringe a la documentación provista. Prohíbe explícitamente el conocimiento general para la tarea — "usa solo la documentación pegada". Apaga justamente el recuerdo que produce falsificaciones plausibles.
- temperature=0 para código factual. Bajar la temperatura de muestreo estrecha al modelo hacia sus tokens de mayor confianza, lo que para tareas ancladas significa menos invenciones creativas.
- Busca
UNVERIFIEDen el diff con grep en la revisión o en CI. Una marca que nadie revisa es solo un comentario.
El objetivo no es hacer al modelo más inteligente. Es hacer su ignorancia visible. La honestidad sobre lo que no pudo verificar le gana a la falsa confianza siempre.
Recursos
- Reduce hallucinations — Claude Docs — permitir "no lo sé", verificar con citas, retirar afirmaciones sin respaldo
- Why language models hallucinate — OpenAI — el incentivo a adivinar
- Why language models hallucinate (paper, PDF) — Kalai, Nachum, Vempala, Zhang
- Evaluating LLMs for accuracy incentivizes hallucinations — Nature — el hallazgo sobre la calificación de benchmarks
<div class="cta">
¿Construyendo una función con IA? Yeda AI diseña, audita y lanza sistemas LLM de producción que fallan en voz alta, no en silencio.
Habla con nosotros · Lee el blog
</div>