Quando a IA roda dentro de um sistema da empresa, a conta é por token, e uma conversa de atendimento custa centavos: no Balcão, nossa plataforma de atendimento por WhatsApp, a triagem sai por cerca de R$ 0,15 a conversa. O que mais pesa é o texto que a IA relê a cada resposta, e o cache de prompt cobra esse trecho a 10% do preço ou menos; o tamanho do modelo vem em seguida, com diferença de até 100 vezes entre o maior e o menor da mesma empresa. A conta também muda quando se mede o resultado: na simulação de um agente de vendas, o modelo quatro vezes mais caro levou mais leads à call, e a conta por resultado ficou a favor dele.
Quanto custa uma conversa atendida por IA#
Uma conversa de atendimento feita por IA dentro de um sistema custa centavos. Na triagem que configuramos no Balcão, nossa plataforma de atendimento por WhatsApp, para a Fitness Academia e a agência OKSE, a estimativa vai de R$ 0,10 numa conversa de quatro turnos a R$ 0,47 numa de dezesseis, no gpt-5.1 da OpenAI. No modelo menor da mesma linha, de R$ 0,02 a R$ 0,09.
São estimativas, calculadas com a contagem real de tokens do prompt de triagem que roda na Fitness, com a tabela de preços da OpenAI e com o dólar a R$ 5,50. Um turno é uma mensagem do contato e a resposta da IA. A conversa típica da triagem, de seis turnos, fica em R$ 0,15.
| Conversa | gpt-5.1 | gpt-5-mini |
|---|---|---|
| 4 turnos | R$ 0,10 | R$ 0,02 |
| 6 turnos | R$ 0,15 | R$ 0,03 |
| 10 turnos | R$ 0,26 | R$ 0,05 |
| 16 turnos | R$ 0,47 | R$ 0,09 |
A conta cresce mais rápido que o número de turnos porque, a cada resposta, a IA relê a conversa desde o começo. A OKSE continua no gpt-5.1 de propósito: o modelo menor é uma economia que ainda estamos validando, e só trocamos o modelo de um atendimento que já funciona quando conseguimos medir a diferença sem outra mudança acontecendo ao mesmo tempo.
Essa conta vale quando a IA roda dentro de um sistema da empresa, ligada pela API, que é a porta por onde um programa conversa com o modelo, como nos projetos de IA e automação. A assinatura mensal do ChatGPT ou do Claude tem preço fixo por pessoa e é outra conta.
O que é token e por que escrever custa mais que ler#
Token é o pedaço de texto pelo qual a IA cobra, algo entre uma sílaba e uma palavra. A conta separa o que entra, que é tudo o que a IA lê antes de responder, do que sai, que é o que ela escreve. Na linha GPT-6 da OpenAI e nos modelos atuais da Anthropic, cada token escrito custa cinco vezes o token lido, e no gpt-5.1 custa oito vezes.
Para ter uma ideia de tamanho, a OpenAI diz que, em inglês, um token tem umas quatro letras, ou três quartos de uma palavra, e que em outras línguas a proporção muda. Arredondando, uma página de texto dá perto de mil tokens. Os preços são dados por milhão de tokens, então US$ 2 por milhão quer dizer, mais ou menos, dois dólares a cada mil páginas lidas.
O que entra é maior do que parece. Num atendimento, a cada resposta a IA lê as instruções da empresa, que formam o prompt, a lista de ferramentas que ela pode usar, o histórico da conversa e a mensagem nova. A conta paga tudo isso.
O que sai também é maior do que aparece. Os modelos que raciocinam antes de responder gastam tokens nesse raciocínio, e a OpenAI explica que eles não aparecem na resposta, mas são cobrados como saída. Uma resposta curta pode custar mais do que o tamanho dela sugere, e é por isso que o nível de esforço de raciocínio é uma alavanca de custo dentro do mesmo modelo.
Por que o tamanho do modelo muda a conta em até 100 vezes#
A OpenAI e a Anthropic vendem os modelos em tamanhos, e o preço acompanha o tamanho. Em 8 de outubro de 2026, o modelo grande das duas custava 100 vezes o pequeno: US$ 10 contra US$ 0,10 por milhão de tokens lidos e US$ 50 contra US$ 0,50 por milhão de tokens escritos. Em 10 mil atendimentos curtos por mês, é a diferença entre US$ 3 e US$ 300.
| Empresa | Tamanho | Modelo | Entrada (US$ por milhão) | Entrada relida do cache | Saída | 10 mil atendimentos |
|---|---|---|---|---|---|---|
| OpenAI | pequeno | GPT-6 Luna | 0,10 | 0,01 | 0,50 | US$ 3 |
| OpenAI | médio | GPT-6.1 Sol | 2 | 0,10 | 10 | US$ 60 |
| OpenAI | grande | GPT-6 Astra | 10 | 1 | 50 | US$ 300 |
| Anthropic | pequeno | Claude Haiku 5.5 | 0,10 | 0,01 | 0,50 | US$ 3 |
| Anthropic | médio | Claude Sonnet 5.5 | 2 | 0,10 | 10 | US$ 60 |
| Anthropic | entre médio e grande | Claude Opus 5.5 | 4 | 0,20 | 20 | US$ 120 |
| Anthropic | grande | Claude Fable 5.1 | 10 | 0,25 | 50 | US$ 300 |
A última coluna supõe 1.500 tokens de entrada e 300 de saída por atendimento, sem cache, o que é uma conversa curta. Lida assim, a tabela mostra que o modelo do meio custa um quinto do grande nas duas empresas, e que o pequeno custa um vigésimo do médio. A comparação entre as empresas é por token: a Anthropic avisa que os modelos dela a partir do Claude 4.7 contam cerca de 30% mais tokens para o mesmo texto, então o mesmo atendimento sai um pouco mais caro no Claude. O preço do Haiku 5.5 vale para pedidos de até 100 mil tokens, e ele saiu em 7 de outubro de 2026 custando, segundo a Anthropic, cerca de 75% menos que o Haiku 4.5.
Quem escolhe o tamanho é a tarefa. O modelo pequeno dá conta de decisões curtas e repetidas, como separar e-mail, classificar nota fiscal ou responder o horário de funcionamento. O médio cuida do dia a dia com regra: atendimento que segue um roteiro, resumo de reunião, rascunho de proposta. O grande fica para o que é raro e difícil, como ler um contrato longo ou cruzar dados de vários sistemas.
Começar pelo médio costuma ser o caminho mais seguro: sobe-se quando a resposta não serve e desce-se o que é repetitivo. Quanto a IA decide sozinha é outra escolha, explicada em chat, assistente ou agente de IA.
O que mais pesa: o texto que a IA relê a cada resposta#
O que mais pesa na conta de um atendimento com IA é o texto que ela relê a cada resposta: as instruções da empresa, as ferramentas e o histórico da conversa. O cache de prompt segura esse custo, cobrando o trecho que se repete igual desde o começo a 10% do preço de entrada na maioria dos modelos da OpenAI e da Anthropic.
Nas conversas simuladas de um agente de vendas que montamos no Balcão para uma consultoria de treino e dieta on-line, a IA relê perto de 13 mil tokens a cada resposta no gpt-5.1, e perto de 90% disso vem do cache. São mais de oito vezes os 1.500 tokens que as contas de exemplo costumam supor. Pela nossa conta sobre os tokens medidos, sem o cache cada conversa custaria perto de R$ 0,55, e não os R$ 0,15 que custou.
O cache funciona pelo começo do texto. O fornecedor guarda o trecho inicial que já processou e, quando a chamada seguinte começa exatamente igual, cobra esse trecho mais barato. Qualquer mudança no começo faz o resto ser cobrado cheio. Por isso, no Balcão, o prompt fixo vai sempre na frente, e o que muda de um contato para outro (a data, o nome, o que a pessoa respondeu no formulário) vai no fim. Gravar o trecho no cache custa 1,25 vez o preço de entrada nos modelos mais novos das duas empresas, e o desconto vem nas leituras seguintes.
Disso sai uma conclusão que surpreende: encurtar o prompt rende pouco quando o cache funciona, e encurtar de um jeito que muda o começo a cada chamada sai mais caro. Com o prompt de triagem do Balcão, de cerca de 4 mil tokens, a parte fixa custa R$ 0,05 numa conversa de seis turnos. A metade desse prompt, escolhida de novo a cada mensagem, custaria R$ 0,13. O que vale pôr nesse prefixo é o conhecimento da empresa que a IA precisa para responder, e como organizá-lo está em como organizar o conhecimento da empresa para a IA.
Em 7 de outubro de 2026, a Anthropic cortou pela metade a leitura de cache do Sonnet 5.5, de US$ 0,20 para US$ 0,10 por milhão, e disse que, como essa leitura é grande parte do consumo, o modelo ficou cerca de 20% mais barato na maior parte do trabalho de agente.
Medir sem separar o cache engana. Até setembro, o Balcão calculava todo o texto lido a preço cheio, como margem de segurança, e o painel mostrava um custo até duas vezes maior que a fatura da OpenAI. Hoje cada chamada registra quanto veio do cache e guarda o custo em centavos de real, arredondado para cima. Quem vai pôr IA em produção deve pedir que o custo seja medido assim antes de usar o número para definir preço.
Triagem: cada pedido vai para o modelo do tamanho dele#
Triagem é mandar cada pedido para o modelo do tamanho que ele pede. Um modelo pequeno lê todas as mensagens, resolve as simples e passa adiante só as que precisam de mais. Numa conta montada com 10 mil atendimentos curtos por mês e os preços de 8 de outubro de 2026, a triagem leva a conta de US$ 300, tudo no modelo grande, para US$ 17,40.
A conta montada é esta. O modelo pequeno lê as 10 mil mensagens e resolve 8 mil sozinho, por US$ 3. O médio responde 1.900, por US$ 11,40. O grande responde as 100 que são raras e difíceis, por US$ 3. Com o mesmo número de tokens, os valores são os mesmos com GPT-6 Luna, GPT-6.1 Sol e GPT-6 Astra e com Claude Haiku 5.5, Sonnet 5.5 e Fable 5.1, porque os preços por token dos três tamanhos coincidem; com o mesmo texto, a conta no Claude fica perto de 30% maior. A divisão entre 8 mil, 1.900 e 100 é um exemplo; a de cada empresa sai do histórico real de atendimento.
Para a etapa que só decide, existem até modelos feitos para isso. O Jev, da TypeSafe AI, em acesso antecipado, não escreve texto: devolve um sim ou não, uma nota ou uma escolha entre opções dadas. Segundo a empresa, a entrada custa US$ 0,042 por milhão de tokens e a saída não é cobrada.
A triagem mais barata acontece antes da IA. Nessa consultoria, o anúncio leva a um formulário antes do WhatsApp, e quase todo mundo que conversa com o agente de vendas já respondeu a ele. Quem só estava curioso quase nunca chega à IA, e cada conversa paga já começa com alguém interessado. Já na triagem da Fitness e da OKSE, que roda num modelo só, a IA atende o primeiro contato, preenche a ficha e passa para a equipe o que precisa de gente, o que devolve tempo à equipe sem pôr um modelo grande para responder pergunta de horário.
Quando o modelo mais caro sai mais barato#
O modelo mais caro sai mais barato quando a conta é feita pelo resultado, e não pela conversa. Na simulação do agente de vendas dessa consultoria, o Claude Opus 5.5 custou R$ 0,65 por conversa, quatro vezes o gpt-5.1, mas 44% dos leads simulados aceitaram a call de venda, contra 19% a 31%. Pela nossa conta, se essa diferença se repetir com leads reais, cada call a mais sai por R$ 2 a R$ 4 de IA.
O agente conduz a conversa no WhatsApp até o convite para uma call com a equipe da consultoria. Para medir a diferença, rodamos 16 conversas simuladas, com oito tipos de lead (o desconfiado, o que entra direto no preço, o que pede uma pessoa), cada um duas vezes, e comparamos com as três últimas rodadas no gpt-5.1, a última delas com a mesma configuração.
No Opus, 94% das conversas terminaram sem erro de forma, contra 31% a 56% no gpt-5.1. Erro de forma é a mensagem que quebra as regras do atendimento, como fazer duas perguntas de uma vez ou usar um tom fora do combinado. O custo foi de R$ 0,65 por conversa contra R$ 0,14 a R$ 0,16, com 91% do texto relido vindo do cache, contra 88% a 89%. É simulação, e não produção: são poucas conversas, com leads simulados, feitas antes de o agente ir ao ar.
Pela conta do resultado, a diferença se paga. Se a taxa de aceite da simulação se repetir em produção, a cada mil conversas o Opus custa uns R$ 500 a mais e traz entre 130 e 250 calls a mais, o que dá R$ 2 a R$ 4 de IA por call adicional. A consultoria seguiu no Opus 5.5, e a redução de custo ficou para depois, com o agente rodando. O que faz um modelo seguir o roteiro de venda à risca é a forma como o método é escrito, e isso está em como fazer a IA seguir o método da sua empresa.
Como pôr limite no gasto antes de ligar#
O limite de gasto se põe antes de ligar a IA, em três camadas: um teto por dia para cada cliente ou operação, um teto global para o sistema inteiro e um alerta sempre que qualquer teto é atingido. No Balcão, o padrão de cada cliente é R$ 15 de IA por dia e 500 chamadas ao modelo, e nenhum limite passa em silêncio.
Os tetos de cada cliente mudam pelo painel, sem publicar versão nova do sistema. Há também limites por contato, de 40 turnos e 10 arquivos de mídia por dia, que seguram a conta e quem tenta usar o atendimento para outra coisa, um risco de segurança cujo caso mais conhecido é a injeção de prompt. O teto global, da plataforma inteira, fica com a nossa administração.
Quando qualquer teto é atingido, o sistema registra o evento e manda um alerta para o plantão da Epicora e, quando o teto é de custo ou de volume do cliente, também para as pessoas que o cliente indicou. Se o teto batido é o de custo ou o de chamadas do cliente, a IA para de responder naquele cliente até o dia virar ou alguém subir o teto; se é o limite de um contato, só aquele contato é afetado.
Antes de ligar um atendimento com IA, a ordem que seguimos é esta:
- Contar os tokens do prompt real, e não de um exemplo, e simular conversas do tamanho das que a empresa recebe.
- Multiplicar pelos preços do modelo escolhido, separando o que vem do cache.
- Definir o teto por dia e o teto global, com alerta para alguém que possa agir.
- Comparar o custo medido com a fatura do fornecedor na primeira semana.
Perguntas frequentes#
A assinatura do ChatGPT ou do Claude serve para pôr IA no atendimento da empresa?#
Para um sistema, não. A assinatura é um preço fixo por pessoa para usar o chat: o ChatGPT Plus custa US$ 20 por mês, segundo a OpenAI. A OpenAI e a Anthropic dizem que o uso pela API, que é a porta por onde um sistema conversa com o modelo, é cobrado à parte e por token. A Anthropic passou a dar um crédito mensal de API nos planos Max e Team, mas a conta de um atendimento em volume é a da API.
Quanto custa por mês atender mil conversas com IA?#
Na nossa estimativa para a triagem do Balcão, com conversas de seis turnos no gpt-5.1 a cerca de R$ 0,15 cada, mil conversas custam perto de R$ 150 de IA por mês e 10 mil, perto de R$ 1.500. No gpt-5-mini, o modelo menor da mesma linha, mil conversas ficam perto de R$ 30. Conversas mais longas e modelos maiores sobem a conta. O canal, o servidor e o desenvolvimento ficam fora desse número.
Posso usar sempre o modelo mais barato?#
Para decisões simples e repetidas, como separar e-mail ou responder horário, quase sempre. Para conversa com regra, venda ou documento longo, o modelo pequeno erra mais, e o erro custa mais que a diferença de preço. O caminho seguro é testar o mesmo atendimento em dois modelos com conversas simuladas e comparar o resultado, além do custo.
Vale a pena encurtar o prompt para gastar menos?#
Rende pouco quando o cache está funcionando, porque o texto que se repete desde o começo já é cobrado a 10% do preço ou menos. Encurtar de um jeito que muda o começo do prompt a cada chamada sai mais caro: pela nossa conta com o prompt de triagem do Balcão, um prompt fixo de 4 mil tokens custa R$ 0,05 por conversa, e a metade dele, variando, custaria R$ 0,13.
Como saber quanto a IA vai custar antes de pôr no ar?#
Conte os tokens do prompt real, simule conversas com o tamanho das que a empresa recebe e multiplique pelos preços do modelo escolhido, separando o que vem do cache. Depois de ligar, compare na primeira semana o custo medido com a fatura do fornecedor. Foi comparando assim que descobrimos que o painel do Balcão mostrava até o dobro da fatura.
Fontes#
- OpenAI, preços da API, consultados em 8 de outubro de 2026 (preço padrão por milhão de tokens: GPT-6 Astra, GPT-6.1 Sol, GPT-6 Luna, gpt-5.1 e gpt-5-mini): https://developers.openai.com/api/docs/pricing
- OpenAI, guia de prompt caching (cache pelo começo do texto, gravação a 1,25 vez e leitura a 0,1 vez da entrada nos modelos a partir do GPT-5.6, 0,05 vez no GPT-6.1 Sol): https://developers.openai.com/api/docs/guides/prompt-caching
- OpenAI Help Center, Understanding and counting tokens (um token tem umas quatro letras em inglês; o raciocínio é cobrado como saída): https://help.openai.com/en/articles/4936856-understanding-and-counting-tokens
- OpenAI Help Center, What is ChatGPT Plus? (US$ 20 por mês; uso da API cobrado à parte): https://help.openai.com/en/articles/6950777-what-is-chatgpt-plus
- OpenAI Help Center, Managing billing for ChatGPT and the API platform: https://help.openai.com/en/articles/9039756-managing-billing-for-chatgpt-and-the-api-platform
- Anthropic, preços da API do Claude, consultados em 8 de outubro de 2026 (Fable 5.1, Opus 5.5, Sonnet 5.5, Haiku 5.5 e os multiplicadores de cache): https://platform.claude.com/docs/en/about-claude/pricing
- Anthropic, "Introducing Claude Haiku 5.5", 7 de outubro de 2026 (Haiku 5.5 cerca de 75% mais barato que o Haiku 4.5; leitura de cache do Sonnet 5.5 pela metade; crédito mensal de API nos planos Max e Team): https://www.anthropic.com/claude-haiku-5-5
- Claude Help Center, por que o uso da API é cobrado à parte do plano pago: https://support.claude.com/en/articles/9876003-i-have-a-paid-claude-subscription-pro-max-team-or-enterprise-plans-why-is-claude-api-usage-billed-separately-from-my-paid-claude-plan
- TypeSafe AI, "Introducing System One Models & Jev" (respostas só de decisão; entrada a US$ 0,042 por milhão, saída sem cobrança): https://typesafe.ai/blog/introducing-system-one-models-and-jev
Próximo passo#
Se você quer pôr IA no atendimento, na triagem ou na leitura de documentos e precisa saber quanto vai custar antes de ligar, é o trabalho que fazemos em IA e automação: a conta com o seu prompt real, o modelo escolhido pela tarefa e os tetos de gasto no lugar, como na triagem da agência OKSE.

