Cuando la IA funciona dentro de un sistema de la empresa, se paga por token, y una conversación de atención cuesta centavos: en Balcão, nuestra plataforma de atención por WhatsApp, el filtro de entrada sale a unos R$ 0,15 (cerca de US$ 0,03) por conversación. Lo que más pesa es el texto que la IA relee en cada respuesta, y la caché de prompt cobra esa parte al 10% del precio o menos; el tamaño del modelo viene después, con una diferencia de hasta 100 veces entre el mayor y el menor de la misma empresa. La cuenta también cambia cuando se mide el resultado: en la simulación de un agente de ventas, el modelo cuatro veces más caro llevó más leads a la llamada, y la cuenta por resultado quedó a su favor.
Cuánto cuesta una conversación atendida por IA#
Una conversación atendida por IA dentro de un sistema cuesta centavos. En el filtro de entrada que configuramos en Balcão, nuestra plataforma de atención por WhatsApp, para Fitness Academia y la agencia OKSE, la estimación va de R$ 0,10 en cuatro turnos a R$ 0,47 en dieciséis, en gpt-5.1 de OpenAI (US$ 0,02 a US$ 0,09). En el modelo menor de la misma línea, de R$ 0,02 a R$ 0,09.
Son estimaciones, calculadas con el conteo real de tokens del prompt del filtro que funciona en Fitness, con la tabla de precios de OpenAI y con el dólar a R$ 5,50. Un turno es un mensaje del contacto y la respuesta de la IA. La conversación típica del filtro, de seis turnos, queda en R$ 0,15. Fitness Academia, una cadena de gimnasios, y OKSE están en el sur de Brasil, donde WhatsApp es el canal principal entre empresas y clientes.
| Conversación | gpt-5.1 | gpt-5-mini |
|---|---|---|
| 4 turnos | R$ 0,10 | R$ 0,02 |
| 6 turnos | R$ 0,15 | R$ 0,03 |
| 10 turnos | R$ 0,26 | R$ 0,05 |
| 16 turnos | R$ 0,47 | R$ 0,09 |
La cuenta crece más rápido que el número de turnos porque, en cada respuesta, la IA relee la conversación desde el principio. OKSE sigue en gpt-5.1 a propósito: el modelo menor es un ahorro que todavía estamos validando, y solo cambiamos el modelo de una atención que ya funciona cuando podemos medir la diferencia sin otro cambio al mismo tiempo.
Esta cuenta vale cuando la IA funciona dentro de un sistema de la empresa, conectada por la API, que es la puerta por la que un programa habla con el modelo, como en los proyectos de IA y automatización. La suscripción mensual de ChatGPT o de Claude tiene un precio fijo por persona y es otra cuenta.
Qué es un token y por qué escribir cuesta más que leer#
Un token es el pedazo de texto por el que cobra la IA, algo entre una sílaba y una palabra. La cuenta separa lo que entra, todo lo que la IA lee antes de responder, de lo que sale, lo que escribe. En la línea GPT-6 de OpenAI y en los modelos actuales de Anthropic, cada token escrito cuesta cinco veces el token leído, y en gpt-5.1 cuesta ocho veces.
OpenAI dice que, en inglés, un token tiene unas cuatro letras, o tres cuartos de una palabra, y que en otros idiomas la proporción cambia. Redondeando, una página de texto da cerca de mil tokens. Los precios se dan por millón de tokens, así que US$ 2 por millón quiere decir, más o menos, dos dólares por cada mil páginas leídas.
Lo que entra es más de lo que parece. En cada respuesta, la IA lee las instrucciones de la empresa, que forman el prompt, la lista de herramientas que puede usar, el historial de la conversación y el mensaje nuevo. La cuenta paga todo eso.
Lo que sale también es más de lo que se ve. Los modelos que razonan antes de responder gastan tokens en ese razonamiento, y OpenAI explica que no aparecen en la respuesta, pero se cobran como salida. Una respuesta corta puede costar más de lo que su tamaño sugiere, y por eso el nivel de esfuerzo de razonamiento es una palanca de costo dentro del mismo modelo.
Por qué el tamaño del modelo cambia la cuenta hasta 100 veces#
OpenAI y Anthropic venden sus modelos en tamaños, y el precio acompaña al tamaño. El 8 de octubre de 2026, el modelo grande de las dos costaba 100 veces el pequeño: US$ 10 frente a US$ 0,10 por millón de tokens leídos y US$ 50 frente a US$ 0,50 por millón de tokens escritos. En 10.000 atenciones cortas al mes, es la diferencia entre US$ 3 y US$ 300.
| Empresa | Tamaño | Modelo | Entrada (US$ por millón) | Entrada releída de la caché | Salida | 10.000 atenciones |
|---|---|---|---|---|---|---|
| OpenAI | pequeño | GPT-6 Luna | 0,10 | 0,01 | 0,50 | US$ 3 |
| OpenAI | mediano | GPT-6.1 Sol | 2 | 0,10 | 10 | US$ 60 |
| OpenAI | grande | GPT-6 Astra | 10 | 1 | 50 | US$ 300 |
| Anthropic | pequeño | Claude Haiku 5.5 | 0,10 | 0,01 | 0,50 | US$ 3 |
| Anthropic | mediano | Claude Sonnet 5.5 | 2 | 0,10 | 10 | US$ 60 |
| Anthropic | entre mediano y grande | Claude Opus 5.5 | 4 | 0,20 | 20 | US$ 120 |
| Anthropic | grande | Claude Fable 5.1 | 10 | 0,25 | 50 | US$ 300 |
La última columna supone 1.500 tokens de entrada y 300 de salida por atención, sin caché, que es una conversación corta. Leída así, la tabla muestra que el modelo del medio cuesta un quinto del grande en las dos empresas, y que el pequeño cuesta un veinteavo del mediano. La comparación entre las empresas es por token: Anthropic avisa que sus modelos desde Claude 4.7 cuentan cerca de un 30% más de tokens para el mismo texto, así que la misma atención sale un poco más cara en Claude. El precio de Haiku 5.5 vale para pedidos de hasta 100.000 tokens, y salió el 7 de octubre de 2026 costando, según Anthropic, cerca de un 75% menos que Haiku 4.5.
Quien elige el tamaño es la tarea. El modelo pequeño resuelve decisiones cortas y repetidas, como separar correos, clasificar una factura o responder el horario de atención. El mediano se ocupa del día a día con reglas: atención que sigue un guion, resumen de reunión, borrador de propuesta. El grande queda para lo raro y difícil, como leer un contrato largo o cruzar datos de varios sistemas.
Empezar por el mediano suele ser el camino más seguro: se sube cuando la respuesta no sirve y se baja lo que es repetitivo. Cuánto decide la IA por su cuenta es otra elección, explicada en chat, asistente o agente de IA.
Lo que más pesa: el texto que la IA relee en cada respuesta#
Lo que más pesa en la cuenta de una atención con IA es el texto que ella relee en cada respuesta: las instrucciones de la empresa, las herramientas y el historial de la conversación. La caché de prompt contiene ese costo, cobrando la parte que se repite igual desde el principio al 10% del precio de entrada en la mayoría de los modelos de OpenAI y de Anthropic.
En las conversaciones simuladas de un agente de ventas que armamos en Balcão para una consultoría de entrenamiento y dieta en línea, la IA relee cerca de 13.000 tokens en cada respuesta en gpt-5.1, y cerca del 90% viene de la caché. Son más de ocho veces los 1.500 tokens que suelen suponer las cuentas de ejemplo. Según nuestra cuenta sobre los tokens medidos, sin caché cada conversación costaría cerca de R$ 0,55 (US$ 0,10), y no los R$ 0,15 que costó.
La caché funciona por el principio del texto. El proveedor guarda el tramo inicial que ya procesó y, cuando la llamada siguiente empieza exactamente igual, cobra ese tramo más barato. Cualquier cambio al principio hace que el resto se cobre completo. Por eso, en Balcão, el prompt fijo va siempre adelante, y lo que cambia de un contacto a otro (la fecha, el nombre, lo que la persona respondió en el formulario) va al final. Grabar el tramo en la caché cuesta 1,25 veces el precio de entrada en los modelos más nuevos de las dos empresas, y el descuento llega en las lecturas siguientes.
De ahí sale una conclusión que sorprende: acortar el prompt rinde poco mientras la caché funciona, y acortarlo de una forma que cambia el principio en cada llamada sale más caro. Con el prompt del filtro de entrada de Balcão, de unos 4.000 tokens, la parte fija cuesta R$ 0,05 en una conversación de seis turnos. La mitad de ese prompt, elegida de nuevo en cada mensaje, costaría R$ 0,13. Cómo organizar el conocimiento que va en ese prefijo está en cómo organizar el conocimiento de la empresa para la IA.
El 7 de octubre de 2026, Anthropic redujo a la mitad el precio de lectura de caché de Sonnet 5.5, de US$ 0,20 a US$ 0,10 por millón, y dijo que, como esa lectura es gran parte del consumo, el modelo quedó cerca de un 20% más barato en la mayor parte del trabajo de agentes.
Medir sin separar la caché engaña. Hasta septiembre, Balcão calculaba todo el texto leído a precio completo, como margen de seguridad, y el panel mostraba un costo de hasta el doble de la factura de OpenAI. Hoy cada llamada registra cuánto vino de la caché y guarda el costo en centavos de real, redondeado hacia arriba. Quien va a poner IA en producción debe pedir que el costo se mida así antes de definir un precio con ese número.
Filtro de entrada: cada pedido va al modelo de su tamaño#
El filtro de entrada consiste en mandar cada pedido al modelo del tamaño que necesita. Un modelo pequeño lee todos los mensajes, resuelve los simples y pasa adelante solo los que necesitan más. En una cuenta armada con 10.000 atenciones cortas al mes y los precios del 8 de octubre de 2026, el filtro lleva la cuenta de US$ 300, todo en el modelo grande, a US$ 17,40.
La cuenta armada es esta. El modelo pequeño lee los 10.000 mensajes y resuelve 8.000 solo, por US$ 3. El mediano responde 1.900, por US$ 11,40. El grande responde los 100 que son raros y difíciles, por US$ 3. Con el mismo número de tokens, la cuenta es la misma con GPT-6 Luna, Sol y Astra o con Claude Haiku 5.5, Sonnet 5.5 y Fable 5.1, porque los precios por token coinciden; con el mismo texto, la cuenta en Claude queda cerca de un 30% más alta. La división entre 8.000, 1.900 y 100 es un ejemplo; la de cada empresa sale de su historial real de atención.
Para el paso que solo decide, hay incluso modelos hechos para eso. Jev, de TypeSafe AI, en acceso anticipado, no escribe texto: devuelve un sí o no, una nota o una elección entre opciones dadas. Según la empresa, la entrada cuesta US$ 0,042 por millón de tokens y la salida no se cobra.
El filtro más barato ocurre antes de la IA. En esa consultoría, el anuncio lleva a un formulario antes de WhatsApp, y casi todos los que conversan con el agente de ventas ya lo respondieron. Quien solo tenía curiosidad casi nunca llega a la IA, y cada conversación pagada ya empieza con alguien interesado. En el filtro de Fitness y de OKSE, que funciona con un solo modelo, la IA atiende el primer contacto, completa la ficha y pasa al equipo lo que necesita una persona, lo que le devuelve tiempo al equipo sin poner un modelo grande a responder preguntas de horario.
Cuándo el modelo más caro sale más barato#
El modelo más caro sale más barato cuando la cuenta se hace por resultado, y no por conversación. En la simulación del agente de ventas de esa consultoría, Claude Opus 5.5 costó R$ 0,65 por conversación, cuatro veces gpt-5.1, pero el 44% de los leads simulados aceptó la llamada de venta, frente a 19% a 31%. Según nuestra cuenta, si esa diferencia se repite con leads reales, cada llamada de más sale a R$ 2 a R$ 4 de IA.
El agente lleva la conversación en WhatsApp hasta la invitación a una llamada con el equipo de la consultoría. Para medir la diferencia, corrimos 16 conversaciones simuladas, con ocho tipos de lead (el desconfiado, el que va directo al precio, el que pide una persona), cada uno dos veces, y comparamos con las tres últimas rondas en gpt-5.1, la última con la misma configuración.
En Opus, el 94% de las conversaciones terminó sin error de forma, frente a 31% a 56% en gpt-5.1. Un error de forma es el mensaje que rompe las reglas de la atención, como hacer dos preguntas a la vez o usar un tono fuera de lo acordado. El costo fue de R$ 0,65 por conversación frente a R$ 0,14 a R$ 0,16, con el 91% del texto releído viniendo de la caché, frente a 88% a 89%. Es simulación, y no producción: pocas conversaciones, con leads simulados, hechas antes de que el agente saliera al aire.
Según la cuenta del resultado, la diferencia se paga. Si la tasa de aceptación de la simulación se repite en producción, por cada mil conversaciones Opus cuesta unos R$ 500 (cerca de US$ 90) más y trae entre 130 y 250 llamadas más, lo que da R$ 2 a R$ 4 (US$ 0,36 a US$ 0,70) de IA por llamada adicional. La consultoría siguió en Opus 5.5, y la reducción de costo quedó para después, con el agente funcionando. Lo que hace que un modelo siga el guion de venta al pie de la letra es cómo está escrito el método, y eso está en cómo hacer que la IA siga el método de tu empresa.
Cómo poner un límite al gasto antes de encender#
El límite de gasto se pone antes de encender la IA, en tres capas: un tope diario para cada cliente u operación, un tope global para todo el sistema y una alerta cada vez que se alcanza cualquier tope. En Balcão, el valor estándar de cada cliente es R$ 15 (unos US$ 2,70) de IA por día y 500 llamadas al modelo, y ningún límite pasa en silencio.
Los topes de cada cliente se cambian desde el panel, sin publicar una versión nueva. También hay límites por contacto, de 40 turnos y 10 archivos multimedia por día, que contienen la cuenta y a quien intenta usar la atención para otra cosa, un riesgo de seguridad cuyo caso más conocido es la inyección de prompt. El tope global, de toda la plataforma, queda con nuestra administración.
Cuando se alcanza cualquier tope, el sistema registra el evento y manda una alerta a la guardia de Epicora y, cuando el tope es de costo o de volumen del cliente, también a las personas que el cliente indicó. Si es el tope de costo o de llamadas del cliente, la IA deja de responder para ese cliente hasta que cambia el día o alguien sube el tope; si es un límite por contacto, solo ese contacto se ve afectado.
Antes de encender una atención con IA, este es el orden que seguimos:
- Contar los tokens del prompt real, y no de un ejemplo, y simular conversaciones del tamaño de las que recibe la empresa.
- Multiplicar por los precios del modelo elegido, separando lo que viene de la caché.
- Definir el tope diario y el tope global, con alerta para alguien que pueda actuar.
- Comparar el costo medido con la factura del proveedor en la primera semana.
Preguntas frecuentes#
¿La suscripción de ChatGPT o de Claude sirve para poner IA en la atención de la empresa?#
Para un sistema, no. La suscripción es un precio fijo por persona para usar el chat: ChatGPT Plus cuesta US$ 20 al mes, según OpenAI. OpenAI y Anthropic dicen que el uso por la API, que es la puerta por la que un sistema habla con el modelo, se cobra aparte y por token. Anthropic empezó a dar un crédito mensual de API en los planes Max y Team, pero la cuenta de una atención con volumen es la de la API.
¿Cuánto cuesta al mes atender mil conversaciones con IA?#
En nuestra estimación para el filtro de entrada de Balcão, con conversaciones de seis turnos en gpt-5.1 a unos R$ 0,15 cada una, mil conversaciones cuestan cerca de R$ 150 (unos US$ 27) de IA al mes, y 10.000, cerca de R$ 1.500 (unos US$ 270). En gpt-5-mini, el modelo menor de la misma línea, mil conversaciones quedan en unos R$ 30. Las conversaciones más largas y los modelos mayores suben la cuenta. El canal, el servidor y el desarrollo quedan fuera de este número.
¿Puedo usar siempre el modelo más barato?#
Para decisiones simples y repetidas, como separar correos o responder el horario, casi siempre. Para conversaciones con reglas, ventas o documentos largos, el modelo pequeño se equivoca más, y el error cuesta más que la diferencia de precio. El camino seguro es probar la misma atención en dos modelos con conversaciones simuladas y comparar el resultado, además del costo.
¿Vale la pena acortar el prompt para gastar menos?#
Rinde poco mientras la caché funciona, porque el texto que se repite desde el principio ya se cobra al 10% del precio o menos. Acortarlo de una forma que cambia el principio del prompt en cada llamada sale más caro: según nuestra cuenta con el prompt del filtro de entrada de Balcão, un prompt fijo de 4.000 tokens cuesta R$ 0,05 por conversación, y la mitad, cambiando cada vez, costaría R$ 0,13.
¿Cómo saber cuánto va a costar la IA antes de ponerla en marcha?#
Cuenta los tokens del prompt real, simula conversaciones del tamaño de las que recibe la empresa y multiplica por los precios del modelo elegido, separando lo que viene de la caché. Después de encenderla, compara en la primera semana el costo medido con la factura del proveedor. Comparando así descubrimos que el panel de Balcão mostraba hasta el doble de la factura.
Fuentes#
- OpenAI, precios de la API, consultados el 8 de octubre de 2026 (precio estándar por millón de tokens: GPT-6 Astra, GPT-6.1 Sol, GPT-6 Luna, gpt-5.1 y gpt-5-mini): https://developers.openai.com/api/docs/pricing
- OpenAI, guía de prompt caching (caché por el principio del texto, escritura a 1,25 veces y lectura a 0,1 veces la entrada en los modelos desde GPT-5.6, 0,05 veces en GPT-6.1 Sol): https://developers.openai.com/api/docs/guides/prompt-caching
- OpenAI Help Center, Understanding and counting tokens (un token tiene unas cuatro letras en inglés; el razonamiento se cobra como salida): https://help.openai.com/en/articles/4936856-understanding-and-counting-tokens
- OpenAI Help Center, What is ChatGPT Plus? (US$ 20 al mes; uso de la API cobrado aparte): https://help.openai.com/en/articles/6950777-what-is-chatgpt-plus
- OpenAI Help Center, Managing billing for ChatGPT and the API platform: https://help.openai.com/en/articles/9039756-managing-billing-for-chatgpt-and-the-api-platform
- Anthropic, precios de la API de Claude, consultados el 8 de octubre de 2026 (Fable 5.1, Opus 5.5, Sonnet 5.5, Haiku 5.5 y los multiplicadores de caché): https://platform.claude.com/docs/en/about-claude/pricing
- Anthropic, "Introducing Claude Haiku 5.5", 7 de octubre de 2026 (Haiku 5.5 cerca de un 75% más barato que Haiku 4.5; lectura de caché de Sonnet 5.5 a la mitad; crédito mensual de API en los planes Max y Team): https://www.anthropic.com/claude-haiku-5-5
- Claude Help Center, por qué el uso de la API se cobra aparte del plan pago: https://support.claude.com/en/articles/9876003-i-have-a-paid-claude-subscription-pro-max-team-or-enterprise-plans-why-is-claude-api-usage-billed-separately-from-my-paid-claude-plan
- TypeSafe AI, "Introducing System One Models & Jev" (respuestas solo de decisión; entrada a US$ 0,042 por millón, salida sin cobro): https://typesafe.ai/blog/introducing-system-one-models-and-jev
Próximo paso#
Si quieres poner IA en la atención, en el filtro de entrada o en la lectura de documentos y necesitas saber cuánto va a costar antes de encenderla, es el trabajo que hacemos en IA y automatización: la cuenta con tu prompt real, el modelo elegido por la tarea y los topes de gasto en su lugar, como en el filtro de entrada de la agencia OKSE.

