El costo unitario de utilizar inteligencia artificial está cayendo a una velocidad difícil de encontrar en otras tecnologías. Un gráfico difundido por Andreessen Horowitz, basado en datos de Goldman Sachs y del Departamento de Comercio de EE.UU., compara esta disminución con la de los ordenadores personales: la IA habría logrado en unos tres años lo que los PC necesitaron casi dos décadas para alcanzar en bajada de precios. Sin embargo, los costos empresariales no siguen la misma tendencia.
Las claves del coste de la IA en 20 segundos
- Los modelos son más económicos por token, pero las aplicaciones consumen muchos más tokens.
- Los agentes planifican, consultan herramientas, revisan resultados y repiten pasos.
- Una misma tarea mediante agentes puede variar hasta 30 veces en consumo de tokens.
- La métrica relevante ya no es solo el precio de la API, sino el coste por trabajo completado con éxito.
Esta aparente contradicción tiene una explicación técnica. Los primeros chatbots realizaban solicitudes sencillas: recibían una pregunta, procesaban el contexto y respondían. Los agentes actuales pueden hacer decenas de llamadas, mantener historiales extensos, consultar buscadores, ejecutar código, abrir documentos y solicitar revisiones a otros agentes.
El costo por token ha bajado, pero cada proceso requiere significativamente más tokens.
El precio por millón de tokens ya no refleja el coste real
La competencia entre OpenAI, Anthropic, Google, DeepSeek y otros desarrolladores de modelos de código abierto ha expandido considerablemente el rango de precios.
DeepSeek V4 Flash cobra 0,14 dólares por millón de tokens de entrada sin caché y 0,28 dólares por los de salida. Google sitúa Gemini 2.5 Flash-Lite en 0,10 y 0,40 dólares, respectivamente. En el extremo opuesto, Claude Fable 5 cuesta 10 dólares por millón de tokens de entrada y 50 dólares por los de salida.
OpenAI también ha dividido GPT-5.6 en tres niveles: Luna, que cuesta 1 dólar de entrada y 6 de salida; Terra, con tarifas de 2,50 y 15 dólares; y Sol, que requiere 5 y 30 dólares. Las lecturas desde la caché tienen un descuento del 90 %, aunque escribir en ella se factura a 1,25 veces el precio normal de entrada.
| Modelo | Entrada por millón de tokens | Salida por millón de tokens |
|---|---|---|
| Gemini 2.5 Flash-Lite | 0,10 dólares | 0,40 dólares |
| DeepSeek V4 Flash | 0,14 dólares | 0,28 dólares |
| GPT-5.6 Luna | 1 dólar | 6 dólares |
| GPT-5.6 Sol | 5 dólares | 30 dólares |
| Claude Fable 5 | 10 dólares | 50 dólares |
Es importante destacar que esta tabla no clasifica los modelos por calidad. Cada uno ofrece diferentes capacidades, latencias, límites, políticas de datos y niveles de soporte. Una tarea que requiere cinco intentos con un modelo económico puede costar más que una ejecución exitosa desde el inicio con otro modelo inicialmente más caro.
El uso del precio por token como única métrica es problemático. No considera cuántos tokens necesita cada modelo para obtener un resultado válido, cuántas llamadas a herramientas realiza ni cuánto trabajo humano se requiere para revisar las respuestas.
La métrica más útil es el coste por tarea completada con la calidad requerida. Por ejemplo, en programación puede ser el coste por incidencia resuelta o por cambio aceptado; en atención al cliente, el coste por conversación que se cierra sin intervención humana; y en análisis documental, el coste por expediente procesado correctamente.
Los agentes multiplican el consumo de contexto
Un chatbot tradicional puede realizar una o dos llamadas. Un agente completo sigue un ciclo más extenso:
- Interpreta el objetivo.
- Elabora un plan.
- Selecciona una herramienta.
- Lee el resultado.
- Actualiza el contexto.
- Decide el siguiente paso.
- Repite hasta completar o alcanzar un límite.
En cada iteración, puede volver a procesar la pregunta original, las instrucciones del sistema, documentos consultados, respuestas previas y resultados de herramientas. El contexto se expande, incluso si la respuesta final sólo ocupa unas pocas líneas.
Un estudio del Stanford Digital Economy Lab sobre agentes de programación encontró que estas tareas pueden consumir hasta 1.000 veces más tokens que ejercicios de conversación o razonamiento sobre código. También se observaron diferencias de hasta 30 veces al repetir la misma tarea con el mismo sistema. Además, gastar más tokens no garantiza una mayor probabilidad de éxito.
Estos resultados corresponden a programación y no deben aplicarse mecánicamente a otras áreas. Sin embargo, evidencian un problema operativo: los agentes siguen trayectorias variables y no siempre saben cuántos recursos necesitarán para completar un trabajo.
Las llamadas a herramientas generan costos adicionales: búsquedas web con múltiples consultas, ejecución de código, procesamiento de resultados, capturas de pantalla, PDF e imágenes que también consumen contexto.
Google cobra por separado las operaciones con Search y Maps, mientras que OpenAI indica que algunas herramientas aplican tarifas por llamada además del costo del modelo. Los contextos largos también aumentan los costos; en GPT-5.6, solicitudes que superan los 272,000 tokens duplican el precio de entrada y aumentan en un 50% el de salida.
Por qué el gasto crece aunque el precio sea más barato
La reducción de precios permite automatizar más procesos. Una empresa que antes usaba IA sólo para resumir algunos documentos ahora puede aplicarla a todos sus correos, contratos, incidencias, repositorios y reuniones.
La economía de escala genera más demanda: según Andreessen Horowitz, la caída en precios de la inteligencia va acompañada por un aumento aún mayor en su consumo, similar a la paradoja de Jevons: mejorar la eficiencia incrementa la utilización total del recurso.
Asimismo, se está transitando de respuestas puntuales a trabajos prolongados. GPT-5.6 permite coordinar subagentes en paralelo. Claude Fable 5 está diseñado para proyectos que pueden mantenerse activos días. Estas capacidades elevan la productividad, pero también multiplican los llamados, el uso de herramientas y el tamaño del contexto.
Por ello, una reducción del 50% en el precio del token no implica que el presupuesto se reduzca a la mitad. Si la nueva aplicación realiza diez veces más llamadas, el gasto total seguirá creciendo.
La optimización debe abarcar todo el proceso:
| Medida técnica | Efecto esperado |
|---|---|
| Enrutamiento entre modelos | Reservar los modelos más costosos para tareas complejas |
| Límites de pasos y reintentos | Evitar ciclos agenticos infinitos |
| Caché de prompts y documentos | Reducir procesamiento repetido |
| Resumir el historial | Controlar el crecimiento del contexto |
| Procesamiento por lotes | Reducir costos cuando no se requiere respuesta inmediata |
| Resultados estructurados | Minimizar respuestas largas y facilitar validaciones |
| Evaluaciones automáticas | Identificar qué modelo resuelve mejor cada caso |
| Observabilidad por tarea | Relacionar consumo, latencia, errores y calidad |
Elegir siempre el modelo más barato no siempre es la opción más eficiente. Un modelo más avanzado puede resolver antes, usar menos herramientas y requerir menos correcciones. La decisión debe basarse en pruebas con tareas reales, no solo en los precios publicados.
Una arquitectura multimodelo para reducir costos y dependencia
La rápida fluctuación de precios también recomienda no construir una aplicación alrededor de una sola API. Una capa de abstracción puede normalizar mensajes, herramientas, respuestas estructuradas, métricas y políticas de reintento. La lógica del producto se mantiene arriba, mientras que los modelos pueden cambiar según coste, calidad, latencia, ubicación de los datos o disponibilidad.
Este enfoque permite usar un modelo económico para clasificar solicitudes, otro especializado en programación y uno de frontera solo en casos excepcionales. Además, facilita el uso de modelos de código abierto en infraestructura propia cuando los datos no deben salir del entorno controlado.
Sin embargo, la portabilidad no es automática, ya que cada proveedor tiene funciones distintas para herramientas, caché, razonamiento, salidas estructuradas y contexto. Una app que dependa mucho de una característica exclusiva tendrá costos de migración elevados, aún usando interfaces compatibles.
Por ello, es recomendable probar la compatibilidad antes de que sea necesaria, manteniendo conjuntos de evaluación, registros de respuestas de referencia y mediciones periódicas de costos y calidad con distintos proveedores.
El precio de la IA seguirá siendo una métrica atractiva, pero cada vez tendrá menos peso por sí solo. La clave técnica radica en gestionar cuánta inteligencia consume el sistema para resolver cada problema.
Preguntas frecuentes
¿Por qué aumenta la factura si los modelos son más baratos?
Porque las aplicaciones con agentes hacen más llamadas, mantienen contextos más extensos y utilizan más herramientas externas. El volumen puede crecer más rápido que la reducción del costo por token.
¿Cuál es la mejor métrica para medir el costo de una aplicación de IA?
El coste por tarea completada con éxito, considerando también la tasa de éxito, latencia, reintentos y trabajo humano de revisión.
¿Siempre es mejor usar el modelo más económico para reducir gastos?
No necesariamente. Un modelo más barato puede consumir más tokens, fallar más o requerir más intentos, por lo que el costo total del flujo es lo que importa.
¿Qué beneficios tiene una arquitectura multimodelo?
Permite asignar cada tarea al modelo más adecuado, introducir alternativas ante caídas o variaciones de precio, y disminuir la dependencia de un solo proveedor.
