Costo por tarea, no por token
La página de precios te miente. Cuando sale un modelo nuevo, lo primero que casi todos revisan es la etiqueta: dólares por millón de tokens de entrada, dólares por millón de tokens de salida. Un número más bajo parece un modelo más barato. Casi nunca lo es. El número que de verdad sale de tu cuenta a fin de mes es el costo por tarea completada, y los modelos más baratos por token pierden en ese número una y otra vez.
Los tokens son la unidad, no el costo
Un token es un trozo de texto que un modelo lee o escribe — más o menos una palabra, a veces un fragmento de una (la palabra "programmatic" se parte en "program" y "matic"). Se factura por millón de tokens de entrada y por millón de salida, y los de salida son los caros: en un modelo de frontera, la salida puede costar seis veces más que la entrada. Esa diferencia importa, porque la etapa en la que un modelo escribe mucho — generar el código de verdad — es donde el contador corre más caliente.
Aquí está la trampa. El precio de etiqueta compara tokens como si cada token hiciera la misma cantidad de trabajo. No es así. En una comparación independiente, un modelo abierto costaba alrededor de $3 por millón de tokens de entrada frente a los aproximadamente $5 de un modelo de frontera — más barato en el papel. Pero el modelo abierto usó cerca del doble de tokens para pensar y resolver la misma tarea. Mitad de precio por el doble de tokens te devuelve más o menos al mismo total. La ventaja que creías tener se evapora hasta unos centavos.
El número que importa: costo por tarea
Los modelos más baratos por token que queman tokens de más para llegar a la misma respuesta tienen un nombre en esta conversación: token hogs (devoradores de tokens). La métrica que los desenmascara es el costo por tarea completada — a veces llamada densidad de inteligencia, o cuánto trabajo útil obtienes por token. Rastreadores independientes como Artificial Analysis lo publican directo: corren un benchmark fijo y reportan lo que cuesta a cada modelo terminarlo, no lo que sus tokens cuestan de lista.
Con esa medición el orden se reacomoda. Frente a un modelo cerrado de frontera mucho más caro, un modelo abierto barato es una ganga real por tarea. Pero frente a un modelo de frontera eficiente en tokens, la opción abierta "a mitad de precio" queda dentro de un 10% — y en ciertas configuraciones el modelo eficiente termina la tarea por menos. La misma respuesta, menos tokens, cuenta más baja.
El tiempo también es un costo
El dinero por tarea no es todo el balance. La velocidad es otra moneda que estás gastando. En un enfrentamiento directo de construcción de front-end, un modelo abierto era más barato por token pero tardó unos 90 minutos y más de 20 millones de tokens en producir su resultado, mientras que un modelo de frontera terminó el trabajo comparable en menos de 20 minutos con una fracción de los tokens. Si una tarea que toma 30 minutos en un modelo toma una hora en otro, pagaste la diferencia con tu propio tiempo — un costo que ninguna página de precios imprime.
Cómo comparar modelos de verdad
- Ignora la etiqueta por token como señal de primer orden. Te dice la tarifa, no la cuenta.
- Busca el costo por tarea en un rastreador independiente (Artificial Analysis corre una suite estándar) antes de comprometer un modelo a trabajo real.
- Pesa el tiempo de reloj. Un modelo más barato por tarea pero el doble de lento puede seguir siendo la elección equivocada para trabajo interactivo o de alto volumen.
- Mide sobre tu propia carga de trabajo. Los benchmarks son un punto de partida; tus prompts, tu base de código y tu configuración de caché mueven los números. Corre una tarea representativa por cada candidato y lee el total.
En resumen
Nunca ordenes modelos por la página de precios. Un token no es un commodity — el token de un modelo puede cargar mucho más trabajo terminado que el de otro, así que una tarifa más baja por token puede costarte en silencio más por tarea y más en tiempo. Compara el número que de verdad pagas: costo por tarea completada, más el reloj.
Recursos
- Planifica caro, construye barato, revisa con filo — Yeda AI Tips #205
- El caché es donde los modelos abiertos se abaratan — Yeda AI Tips #207
- Artificial Analysis — benchmarks de costo por tarea
¿Estás construyendo una función con IA? Yeda AI diseña, audita y lanza sistemas LLM en producción.