Pular para o conteúdo

Quanto custa pôr IA para trabalhar dentro do sistema da empresa, e o que faz essa conta subir ou cair

Pedro Cunha
Pedro Cunha
CTO da Epicora

Publicado em
atualizado em · 17 min de leitura

Em resumo

Quando a IA roda dentro de um sistema da empresa, a conta é por token, e uma conversa de atendimento custa centavos: no Balcão, nossa plataforma de atendimento por WhatsApp, a triagem sai por cerca de R$ 0,15 a conversa. O que mais pesa é o texto que a IA relê a cada resposta, e o cache de prompt cobra esse trecho a 10% do preço ou menos; o tamanho do modelo vem em seguida, com diferença de até 100 vezes entre o maior e o menor da mesma empresa. A conta também muda quando se mede o resultado: na simulação de um agente de vendas, o modelo quatro vezes mais caro levou mais leads à call, e a conta por resultado ficou a favor dele.

Quanto custa uma conversa atendida por IA#

Uma conversa de atendimento feita por IA dentro de um sistema custa centavos. Na triagem que configuramos no Balcão, nossa plataforma de atendimento por WhatsApp, para a Fitness Academia e a agência OKSE, a estimativa vai de R$ 0,10 numa conversa de quatro turnos a R$ 0,47 numa de dezesseis, no gpt-5.1 da OpenAI. No modelo menor da mesma linha, de R$ 0,02 a R$ 0,09.

São estimativas, calculadas com a contagem real de tokens do prompt de triagem que roda na Fitness, com a tabela de preços da OpenAI e com o dólar a R$ 5,50. Um turno é uma mensagem do contato e a resposta da IA. A conversa típica da triagem, de seis turnos, fica em R$ 0,15.

Conversagpt-5.1gpt-5-mini
4 turnosR$ 0,10R$ 0,02
6 turnosR$ 0,15R$ 0,03
10 turnosR$ 0,26R$ 0,05
16 turnosR$ 0,47R$ 0,09

A conta cresce mais rápido que o número de turnos porque, a cada resposta, a IA relê a conversa desde o começo. A OKSE continua no gpt-5.1 de propósito: o modelo menor é uma economia que ainda estamos validando, e só trocamos o modelo de um atendimento que já funciona quando conseguimos medir a diferença sem outra mudança acontecendo ao mesmo tempo.

Essa conta vale quando a IA roda dentro de um sistema da empresa, ligada pela API, que é a porta por onde um programa conversa com o modelo, como nos projetos de IA e automação. A assinatura mensal do ChatGPT ou do Claude tem preço fixo por pessoa e é outra conta.

O que é token e por que escrever custa mais que ler#

Token é o pedaço de texto pelo qual a IA cobra, algo entre uma sílaba e uma palavra. A conta separa o que entra, que é tudo o que a IA lê antes de responder, do que sai, que é o que ela escreve. Na linha GPT-6 da OpenAI e nos modelos atuais da Anthropic, cada token escrito custa cinco vezes o token lido, e no gpt-5.1 custa oito vezes.

Para ter uma ideia de tamanho, a OpenAI diz que, em inglês, um token tem umas quatro letras, ou três quartos de uma palavra, e que em outras línguas a proporção muda. Arredondando, uma página de texto dá perto de mil tokens. Os preços são dados por milhão de tokens, então US$ 2 por milhão quer dizer, mais ou menos, dois dólares a cada mil páginas lidas.

O que entra é maior do que parece. Num atendimento, a cada resposta a IA lê as instruções da empresa, que formam o prompt, a lista de ferramentas que ela pode usar, o histórico da conversa e a mensagem nova. A conta paga tudo isso.

O que sai também é maior do que aparece. Os modelos que raciocinam antes de responder gastam tokens nesse raciocínio, e a OpenAI explica que eles não aparecem na resposta, mas são cobrados como saída. Uma resposta curta pode custar mais do que o tamanho dela sugere, e é por isso que o nível de esforço de raciocínio é uma alavanca de custo dentro do mesmo modelo.

Por que o tamanho do modelo muda a conta em até 100 vezes#

A OpenAI e a Anthropic vendem os modelos em tamanhos, e o preço acompanha o tamanho. Em 8 de outubro de 2026, o modelo grande das duas custava 100 vezes o pequeno: US$ 10 contra US$ 0,10 por milhão de tokens lidos e US$ 50 contra US$ 0,50 por milhão de tokens escritos. Em 10 mil atendimentos curtos por mês, é a diferença entre US$ 3 e US$ 300.

EmpresaTamanhoModeloEntrada (US$ por milhão)Entrada relida do cacheSaída10 mil atendimentos
OpenAIpequenoGPT-6 Luna0,100,010,50US$ 3
OpenAImédioGPT-6.1 Sol20,1010US$ 60
OpenAIgrandeGPT-6 Astra10150US$ 300
AnthropicpequenoClaude Haiku 5.50,100,010,50US$ 3
AnthropicmédioClaude Sonnet 5.520,1010US$ 60
Anthropicentre médio e grandeClaude Opus 5.540,2020US$ 120
AnthropicgrandeClaude Fable 5.1100,2550US$ 300

A última coluna supõe 1.500 tokens de entrada e 300 de saída por atendimento, sem cache, o que é uma conversa curta. Lida assim, a tabela mostra que o modelo do meio custa um quinto do grande nas duas empresas, e que o pequeno custa um vigésimo do médio. A comparação entre as empresas é por token: a Anthropic avisa que os modelos dela a partir do Claude 4.7 contam cerca de 30% mais tokens para o mesmo texto, então o mesmo atendimento sai um pouco mais caro no Claude. O preço do Haiku 5.5 vale para pedidos de até 100 mil tokens, e ele saiu em 7 de outubro de 2026 custando, segundo a Anthropic, cerca de 75% menos que o Haiku 4.5.

Quem escolhe o tamanho é a tarefa. O modelo pequeno dá conta de decisões curtas e repetidas, como separar e-mail, classificar nota fiscal ou responder o horário de funcionamento. O médio cuida do dia a dia com regra: atendimento que segue um roteiro, resumo de reunião, rascunho de proposta. O grande fica para o que é raro e difícil, como ler um contrato longo ou cruzar dados de vários sistemas.

Começar pelo médio costuma ser o caminho mais seguro: sobe-se quando a resposta não serve e desce-se o que é repetitivo. Quanto a IA decide sozinha é outra escolha, explicada em chat, assistente ou agente de IA.

O que mais pesa: o texto que a IA relê a cada resposta#

O que mais pesa na conta de um atendimento com IA é o texto que ela relê a cada resposta: as instruções da empresa, as ferramentas e o histórico da conversa. O cache de prompt segura esse custo, cobrando o trecho que se repete igual desde o começo a 10% do preço de entrada na maioria dos modelos da OpenAI e da Anthropic.

Nas conversas simuladas de um agente de vendas que montamos no Balcão para uma consultoria de treino e dieta on-line, a IA relê perto de 13 mil tokens a cada resposta no gpt-5.1, e perto de 90% disso vem do cache. São mais de oito vezes os 1.500 tokens que as contas de exemplo costumam supor. Pela nossa conta sobre os tokens medidos, sem o cache cada conversa custaria perto de R$ 0,55, e não os R$ 0,15 que custou.

O cache funciona pelo começo do texto. O fornecedor guarda o trecho inicial que já processou e, quando a chamada seguinte começa exatamente igual, cobra esse trecho mais barato. Qualquer mudança no começo faz o resto ser cobrado cheio. Por isso, no Balcão, o prompt fixo vai sempre na frente, e o que muda de um contato para outro (a data, o nome, o que a pessoa respondeu no formulário) vai no fim. Gravar o trecho no cache custa 1,25 vez o preço de entrada nos modelos mais novos das duas empresas, e o desconto vem nas leituras seguintes.

Disso sai uma conclusão que surpreende: encurtar o prompt rende pouco quando o cache funciona, e encurtar de um jeito que muda o começo a cada chamada sai mais caro. Com o prompt de triagem do Balcão, de cerca de 4 mil tokens, a parte fixa custa R$ 0,05 numa conversa de seis turnos. A metade desse prompt, escolhida de novo a cada mensagem, custaria R$ 0,13. O que vale pôr nesse prefixo é o conhecimento da empresa que a IA precisa para responder, e como organizá-lo está em como organizar o conhecimento da empresa para a IA.

Em 7 de outubro de 2026, a Anthropic cortou pela metade a leitura de cache do Sonnet 5.5, de US$ 0,20 para US$ 0,10 por milhão, e disse que, como essa leitura é grande parte do consumo, o modelo ficou cerca de 20% mais barato na maior parte do trabalho de agente.

Medir sem separar o cache engana. Até setembro, o Balcão calculava todo o texto lido a preço cheio, como margem de segurança, e o painel mostrava um custo até duas vezes maior que a fatura da OpenAI. Hoje cada chamada registra quanto veio do cache e guarda o custo em centavos de real, arredondado para cima. Quem vai pôr IA em produção deve pedir que o custo seja medido assim antes de usar o número para definir preço.

Triagem: cada pedido vai para o modelo do tamanho dele#

Triagem é mandar cada pedido para o modelo do tamanho que ele pede. Um modelo pequeno lê todas as mensagens, resolve as simples e passa adiante só as que precisam de mais. Numa conta montada com 10 mil atendimentos curtos por mês e os preços de 8 de outubro de 2026, a triagem leva a conta de US$ 300, tudo no modelo grande, para US$ 17,40.

A conta montada é esta. O modelo pequeno lê as 10 mil mensagens e resolve 8 mil sozinho, por US$ 3. O médio responde 1.900, por US$ 11,40. O grande responde as 100 que são raras e difíceis, por US$ 3. Com o mesmo número de tokens, os valores são os mesmos com GPT-6 Luna, GPT-6.1 Sol e GPT-6 Astra e com Claude Haiku 5.5, Sonnet 5.5 e Fable 5.1, porque os preços por token dos três tamanhos coincidem; com o mesmo texto, a conta no Claude fica perto de 30% maior. A divisão entre 8 mil, 1.900 e 100 é um exemplo; a de cada empresa sai do histórico real de atendimento.

Para a etapa que só decide, existem até modelos feitos para isso. O Jev, da TypeSafe AI, em acesso antecipado, não escreve texto: devolve um sim ou não, uma nota ou uma escolha entre opções dadas. Segundo a empresa, a entrada custa US$ 0,042 por milhão de tokens e a saída não é cobrada.

A triagem mais barata acontece antes da IA. Nessa consultoria, o anúncio leva a um formulário antes do WhatsApp, e quase todo mundo que conversa com o agente de vendas já respondeu a ele. Quem só estava curioso quase nunca chega à IA, e cada conversa paga já começa com alguém interessado. Já na triagem da Fitness e da OKSE, que roda num modelo só, a IA atende o primeiro contato, preenche a ficha e passa para a equipe o que precisa de gente, o que devolve tempo à equipe sem pôr um modelo grande para responder pergunta de horário.

Quando o modelo mais caro sai mais barato#

O modelo mais caro sai mais barato quando a conta é feita pelo resultado, e não pela conversa. Na simulação do agente de vendas dessa consultoria, o Claude Opus 5.5 custou R$ 0,65 por conversa, quatro vezes o gpt-5.1, mas 44% dos leads simulados aceitaram a call de venda, contra 19% a 31%. Pela nossa conta, se essa diferença se repetir com leads reais, cada call a mais sai por R$ 2 a R$ 4 de IA.

O agente conduz a conversa no WhatsApp até o convite para uma call com a equipe da consultoria. Para medir a diferença, rodamos 16 conversas simuladas, com oito tipos de lead (o desconfiado, o que entra direto no preço, o que pede uma pessoa), cada um duas vezes, e comparamos com as três últimas rodadas no gpt-5.1, a última delas com a mesma configuração.

No Opus, 94% das conversas terminaram sem erro de forma, contra 31% a 56% no gpt-5.1. Erro de forma é a mensagem que quebra as regras do atendimento, como fazer duas perguntas de uma vez ou usar um tom fora do combinado. O custo foi de R$ 0,65 por conversa contra R$ 0,14 a R$ 0,16, com 91% do texto relido vindo do cache, contra 88% a 89%. É simulação, e não produção: são poucas conversas, com leads simulados, feitas antes de o agente ir ao ar.

Pela conta do resultado, a diferença se paga. Se a taxa de aceite da simulação se repetir em produção, a cada mil conversas o Opus custa uns R$ 500 a mais e traz entre 130 e 250 calls a mais, o que dá R$ 2 a R$ 4 de IA por call adicional. A consultoria seguiu no Opus 5.5, e a redução de custo ficou para depois, com o agente rodando. O que faz um modelo seguir o roteiro de venda à risca é a forma como o método é escrito, e isso está em como fazer a IA seguir o método da sua empresa.

Como pôr limite no gasto antes de ligar#

O limite de gasto se põe antes de ligar a IA, em três camadas: um teto por dia para cada cliente ou operação, um teto global para o sistema inteiro e um alerta sempre que qualquer teto é atingido. No Balcão, o padrão de cada cliente é R$ 15 de IA por dia e 500 chamadas ao modelo, e nenhum limite passa em silêncio.

Os tetos de cada cliente mudam pelo painel, sem publicar versão nova do sistema. Há também limites por contato, de 40 turnos e 10 arquivos de mídia por dia, que seguram a conta e quem tenta usar o atendimento para outra coisa, um risco de segurança cujo caso mais conhecido é a injeção de prompt. O teto global, da plataforma inteira, fica com a nossa administração.

Quando qualquer teto é atingido, o sistema registra o evento e manda um alerta para o plantão da Epicora e, quando o teto é de custo ou de volume do cliente, também para as pessoas que o cliente indicou. Se o teto batido é o de custo ou o de chamadas do cliente, a IA para de responder naquele cliente até o dia virar ou alguém subir o teto; se é o limite de um contato, só aquele contato é afetado.

Antes de ligar um atendimento com IA, a ordem que seguimos é esta:

  1. Contar os tokens do prompt real, e não de um exemplo, e simular conversas do tamanho das que a empresa recebe.
  2. Multiplicar pelos preços do modelo escolhido, separando o que vem do cache.
  3. Definir o teto por dia e o teto global, com alerta para alguém que possa agir.
  4. Comparar o custo medido com a fatura do fornecedor na primeira semana.

Perguntas frequentes#

A assinatura do ChatGPT ou do Claude serve para pôr IA no atendimento da empresa?#

Para um sistema, não. A assinatura é um preço fixo por pessoa para usar o chat: o ChatGPT Plus custa US$ 20 por mês, segundo a OpenAI. A OpenAI e a Anthropic dizem que o uso pela API, que é a porta por onde um sistema conversa com o modelo, é cobrado à parte e por token. A Anthropic passou a dar um crédito mensal de API nos planos Max e Team, mas a conta de um atendimento em volume é a da API.

Quanto custa por mês atender mil conversas com IA?#

Na nossa estimativa para a triagem do Balcão, com conversas de seis turnos no gpt-5.1 a cerca de R$ 0,15 cada, mil conversas custam perto de R$ 150 de IA por mês e 10 mil, perto de R$ 1.500. No gpt-5-mini, o modelo menor da mesma linha, mil conversas ficam perto de R$ 30. Conversas mais longas e modelos maiores sobem a conta. O canal, o servidor e o desenvolvimento ficam fora desse número.

Posso usar sempre o modelo mais barato?#

Para decisões simples e repetidas, como separar e-mail ou responder horário, quase sempre. Para conversa com regra, venda ou documento longo, o modelo pequeno erra mais, e o erro custa mais que a diferença de preço. O caminho seguro é testar o mesmo atendimento em dois modelos com conversas simuladas e comparar o resultado, além do custo.

Vale a pena encurtar o prompt para gastar menos?#

Rende pouco quando o cache está funcionando, porque o texto que se repete desde o começo já é cobrado a 10% do preço ou menos. Encurtar de um jeito que muda o começo do prompt a cada chamada sai mais caro: pela nossa conta com o prompt de triagem do Balcão, um prompt fixo de 4 mil tokens custa R$ 0,05 por conversa, e a metade dele, variando, custaria R$ 0,13.

Como saber quanto a IA vai custar antes de pôr no ar?#

Conte os tokens do prompt real, simule conversas com o tamanho das que a empresa recebe e multiplique pelos preços do modelo escolhido, separando o que vem do cache. Depois de ligar, compare na primeira semana o custo medido com a fatura do fornecedor. Foi comparando assim que descobrimos que o painel do Balcão mostrava até o dobro da fatura.

Fontes#

Próximo passo#

Se você quer pôr IA no atendimento, na triagem ou na leitura de documentos e precisa saber quanto vai custar antes de ligar, é o trabalho que fazemos em IA e automação: a conta com o seu prompt real, o modelo escolhido pela tarefa e os tetos de gasto no lugar, como na triagem da agência OKSE.

Compartilhar
Pedro Cunha
Quem escreve
Pedro Cunha
CTO da Epicora

Pedro Cunha lidera a engenharia da Epicora, em Chapecó (SC). Escreve aqui sobre as decisões técnicas dos sistemas que a equipe coloca em produção — arquitetura, escopo, estimativa e IA aplicada.

Artigos de Pedro Cunha

Contato

Vamos conversar sobre o seu projeto

Conte o que você precisa resolver. Retornamos rápido, com gente que entende de tecnologia e de negócio.

Prefere falar direto?

Escolha o canal que preferir. Respondemos rápido, no horário comercial.

Da primeira conversa ao go-live: eficiência, segurança e inovação.