Cuando alguien propone implementar un agente de IA en una empresa, la conversación suele ir directo a las capacidades: qué puede hacer, qué integra, qué tan “inteligente” es. El costo operativo aparece después, cuando ya hay un prototipo funcionando y la factura de OpenAI llega más alta de lo esperado.
Este artículo desglosa los costos reales de operar un agente a escala en un contexto B2B latinoamericano: manufactura, servicios profesionales, retail. Sin estimaciones optimistas.
El error de calcular solo el costo del modelo
El costo de la API es la parte visible. La mayoría de los equipos lo calculan así: “GPT-4o cuesta $5 USD por millón de tokens de input y $15 por millón de output — eso es barato.” Y sí, en abstracto lo es. El problema es que un agente real no consume solo tokens del LLM.
Un stack típico de agente en producción incluye:
- LLM API (OpenAI, Anthropic, Google, o modelo propio): el costo más variable, depende del volumen y del modelo elegido.
- Base de datos vectorial (Pinecone, Supabase pgvector, Qdrant): necesaria si el agente usa RAG para consultar documentos internos. Entre $0 y $70 USD/mes según volumen.
- Infraestructura de ejecución: el servidor, función serverless o contenedor donde corre el agente. En AWS Lambda o Cloud Run, puede ser marginal a bajo volumen ($5–$20 USD/mes) y escalar con el tráfico.
- Almacenamiento de conversaciones: historial, logs de errores, trazas de ejecución. Si usas una base relacional estándar, el costo es bajo; si necesitas retención larga o búsqueda, sube.
- Monitoreo y alertas: Langfuse, Helicone o herramientas similares para detectar errores, alucinaciones y latencia. Versiones gratuitas existen, pero a escala se paga.
- Mantenimiento de ingeniería: el costo más subestimado. Un agente en producción necesita ajustes de prompt, actualizaciones cuando el proveedor cambia el modelo, y revisión de casos borde. Estima entre 4 y 10 horas/mes de ingeniería para un agente maduro.
Lo que vemos en Eurema con clientes que llegan con un prototipo propio: el costo del LLM representa entre el 30% y el 60% del costo operativo total. El resto está distribuido en infraestructura y tiempo de equipo.
Cuánto cuesta realmente según el volumen
Para aterrizar los números, tomemos tres escenarios reales de empresas B2B en LatAm:
Escenario A — Volumen bajo (1,000–5,000 interacciones/mes) Empresa de servicios profesionales con un agente que responde preguntas de clientes sobre estatus de expedientes. Modelo: GPT-4o-mini. Contexto promedio por interacción: ~800 tokens input, ~300 output.
| Componente | Costo mensual estimado |
|---|---|
| LLM API (GPT-4o-mini) | $4–$18 USD |
| Infraestructura (serverless) | $3–$8 USD |
| Base vectorial (tier gratuito) | $0 USD |
| Monitoreo básico | $0–$20 USD |
| Total operativo | $7–$46 USD/mes |
Escenario B — Volumen medio (20,000–50,000 interacciones/mes) Retailer con un agente de atención a distribuidores: consultas de inventario, precios y pedidos. Modelo mixto: GPT-4o-mini para clasificación, GPT-4o para casos complejos (20% del volumen). Contexto promedio: ~1,200 tokens input, ~500 output.
| Componente | Costo mensual estimado |
|---|---|
| LLM API (mixto) | $180–$420 USD |
| Infraestructura (contenedor dedicado) | $40–$80 USD |
| Base vectorial (tier pagado) | $25–$70 USD |
| Monitoreo + logging | $30–$60 USD |
| Total operativo | $275–$630 USD/mes |
Escenario C — Volumen alto (200,000+ interacciones/mes) Manufactura con agente integrado a ERP para clasificación de órdenes, alertas de producción y soporte interno a operadores. Modelo: Claude Haiku para la mayoría, Claude Sonnet para excepciones. Contexto promedio largo (~3,000 tokens input).
| Componente | Costo mensual estimado |
|---|---|
| LLM API (Anthropic) | $900–$1,800 USD |
| Infraestructura (Kubernetes o ECS) | $150–$300 USD |
| Base vectorial + búsqueda | $80–$150 USD |
| Monitoreo + alertas | $60–$120 USD |
| Total operativo | $1,190–$2,370 USD/mes |
Estos números asumen que el agente ya está construido. No incluyen el costo de desarrollo inicial ni el mantenimiento de ingeniería mensual.
Cómo elegir el modelo correcto sin soberpagar
El error más frecuente es usar GPT-4o para todo porque “es el mejor”. En la práctica, la mayoría de las tareas empresariales no requieren el modelo más capaz — requieren el modelo más confiable para esa tarea específica.
El criterio que usamos en Eurema para decidir qué modelo asignar a cada tarea dentro de un agente:
-
¿La tarea es estructurada o abierta? Extraer datos de un formulario, clasificar una queja en categorías, o generar un JSON con campos definidos → modelo pequeño. Redactar una propuesta comercial personalizada o analizar un contrato → modelo grande.
-
¿Qué pasa si el modelo se equivoca? Si el error lo detecta un humano antes de ejecutarse (aprobación de cotización, revisión de documento), el riesgo es bajo y puedes usar un modelo más económico. Si el error se ejecuta automáticamente (enviar un correo, actualizar un registro en el ERP), necesitas el modelo más preciso o una capa de validación adicional.
-
¿Cuánto contexto necesita? Prompts largos con mucho historial o documentos extensos disparan el costo. Antes de usar contexto largo, evalúa si una búsqueda vectorial (RAG) puede entregar solo el fragmento relevante.
Una regla práctica: empieza con el modelo más barato que pase tu umbral de calidad en pruebas, no con el más caro que después intentas optimizar.
El costo que nadie presupuesta: el mantenimiento
Un agente en producción no es software estático. Los modelos cambian (OpenAI depreca versiones, Anthropic lanza actualizaciones que alteran el comportamiento), los datos internos de la empresa evolucionan, y los usuarios encuentran formas de usar el agente que no contemplaste en el diseño.
En proyectos de Eurema, el mantenimiento de un agente maduro representa entre 4 y 12 horas de ingeniería al mes, dependiendo de la complejidad. Eso equivale a $200–$800 USD/mes si lo externalizas, o tiempo de tu equipo técnico interno.
Los mantenimientos más comunes:
- Ajuste de prompts cuando el modelo actualiza y el comportamiento cambia.
- Expansión de la base de conocimiento (nuevos documentos, catálogos, políticas).
- Revisión de casos borde detectados en logs: preguntas que el agente no supo responder o respondió mal.
- Optimización de costos: revisar si el mix de modelos sigue siendo el óptimo conforme crece el volumen.
Si tu proveedor de agentes no incluye un plan de mantenimiento claro en el contrato, pregunta explícitamente cómo se maneja esto. Es donde más proyectos se caen a los 6 meses.
Cuándo el costo se justifica (y cuándo no)
El ROI de un agente se calcula comparando el costo operativo total contra el valor del proceso que reemplaza o mejora. La comparación honesta:
Proceso manual reemplazado: un coordinador de atención a distribuidores que dedica 3 horas/día a responder consultas repetitivas de inventario y pedidos. Costo mensual de esas 3 horas: ~$400–$700 USD en México (salario + prestaciones prorrateado).
Agente equivalente (Escenario B): $275–$630 USD/mes operativo + ~$300 USD/mes de mantenimiento = $575–$930 USD/mes total.
En este caso el ROI no es dramático en costo puro — pero el agente opera 24/7, responde en segundos, y libera al coordinador para tareas de mayor valor. El argumento no es “ahorramos el 80% del costo” sino “hacemos más con el mismo equipo”.
Donde el agente claramente no se justifica: procesos con menos de 500 interacciones/mes (el costo de mantenimiento supera el ahorro), tareas que requieren juicio contextual complejo sin datos estructurados, o empresas sin el dato limpio que el agente necesita para funcionar.
Si estás evaluando si un agente tiene sentido para tu operación, el punto de partida es calcular el volumen real de interacciones actuales y el costo de atenderlas hoy. Puedes revisar cómo estructuramos ese análisis en la página de Agentes personalizados.
La IA es útil donde hay un proceso repetible, volumen suficiente y datos ordenados. Donde no hay eso, el costo operativo del agente se convierte en un gasto, no en una inversión.