Tu IA tiene perillas de creatividad
Cuando un modelo de lenguaje escribe, no "elige" la siguiente palabra — calcula una probabilidad para cada posible token siguiente y luego muestrea uno. Los parámetros de muestreo son tus perillas sobre esa elección. La mayoría de los desarrolladores lanzan con los valores por defecto y luego se preguntan por qué su pipeline de extracción es inestable o su bot de lluvia de ideas es aburrido.
Las tres perillas
- Temperature — escala la distribución de probabilidad antes del muestreo. Baja (0–0.3): el token más probable casi siempre gana — predecible, fáctico, repetitivo. Alta (0.8–1.0+): los tokens improbables reciben oportunidades reales — creativa, sorprendente, ocasionalmente desquiciada.
- Top-K — limita de forma rígida el grupo de candidatos: "elige solo entre los K tokens más probables".
top_k: 5sobre "el cielo está ___" significa que el modelo elige entre ~azul, nublado, oscuro, despejado, cayendo — y nada más raro. Contundente pero eficaz. - Top-P (muestreo de núcleo) — la versión adaptativa: elige del grupo más pequeño de tokens cuyas probabilidades sumen P. Con
top_p: 0.9, un modelo confiado podría tener un grupo de 2 tokens; uno inseguro, de 15. Se flexibiliza según la propia confianza del modelo, y por eso en la práctica suele superar a top-k.
Reglas prácticas
| Tarea | Ajuste |
|---|---|
| Extracción de datos, salida JSON | temperature ≈ 0–0.2 |
| Generación de código | temperature ≈ 0–0.4 |
| Resúmenes, respuestas de soporte | temperature ≈ 0.3–0.6 |
| Lluvia de ideas, textos creativos | temperature ≈ 0.8–1.0 |
| Combatir salidas raras | top_p 0.9 (no lo combines con temperature alta) |
Configura temperature o top_p, no ambos — en los modelos Claude 4+ pasar ambos es un error, y en el resto es simplemente pelearte contigo mismo.
La advertencia para usuarios avanzados: los modelos más nuevos quitaron las perillas
Claude Opus 4.7+, Opus 4.8, Sonnet 5 y Fable 5 rechazan temperature, top_p y top_k por completo (HTTP 400). En esos modelos diriges con:
output_config.effort(low→max) — cuánto se esfuerza el modelo al pensar;- Prompting — "varía tu forma de expresarte entre respuestas" para dar variedad, o "propón 4 direcciones distintas y pídeme que elija" para trabajo de diseño.
Si usabas temperature: 0 para lograr "determinismo" — nunca garantizó salidas idénticas de todas formas. Prompts más ajustados + effort bajo es el equivalente moderno.
Recursos
- Referencia de la API Messages de Anthropic (parámetros)
- Guía de migración de modelos — parámetros de muestreo eliminados en Opus 4.7+
- El parámetro effort
¿Estás construyendo una función de IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.