Consumo de inferencia: ejemplo práctico (aproximado)
Imagine un agente de soporte B2B SaaS: cuatrocientas conversaciones al día, ocho turnos de media, ~750 tokens de entrada y ~450 de salida por turno (aproximado; sus prompts variarán). Eso son unos 3,200 turnos/día × 1,200 tokens ≈ 3.8M tokens/día → ~115M tokens/mes.
Los precios cambian cada vez que los proveedores lanzan nuevos modelos, por lo que conviene tomar las cifras siguientes como órdenes de magnitud, no como contabilidad exacta. Con tarifas combinadas ilustrativas de aproximadamente $4 por millón de tokens para un modelo de clase frontier (mezcla de entrada/salida), el gasto bruto de API a esta escala ronda cientos de dólares al mes, antes de la recuperación, antes de la redundancia y antes de la revisión humana de los casos límite.
Ahora duplique su estimación para reintentos, ejecuciones de evaluación y entornos de staging. Después añada un 30 % de margen de optimismo, porque marketing pedirá «respuestas más inteligentes» (salidas más largas) tras el lanzamiento.