- Home
- Ferramentas
- Calculadora de custo
Quanto custa um agente de IA no seu processo
Informe o volume e o tipo de trabalho. A calculadora estima o custo mensal, o custo por interação e o que sobra quando você compara com o custo de hoje. Sem cadastro.
Estimativa mensal de modelo e operação com Claude Haiku 4.5
R$ 165,79
US$ 32,51 na cotação informada
- Por interação
- R$ 0,0829
- Em 12 meses
- R$ 1.989,49
Onde o custo está
- Entrada (prompt)US$ 9,45
- Contexto recuperadoUS$ 5,04
- Saída (resposta)US$ 12,60
- OperaçãoAproximação proporcional ao custo de modelo: subestima em volume baixo, onde o custo real é praticamente fixo.US$ 5,42
Comparar com o custo de hoje
Opcional. Informe o que o processo custa hoje para ver economia e payback.
Como esta conta é feita
O custo de um agente é o número de chamadas ao modelo multiplicado pelo texto que entra e sai em cada uma, aos preços que o provedor publica por milhão de tokens. Chamadas por interação, retentativas e contexto recuperado entram na conta porque é exatamente aí que o custo real se afasta da estimativa feita no guardanapo.
A linha de custo de operação existe pelo mesmo motivo. Um agente em produção precisa de observabilidade, revisão das respostas e manutenção quando o processo muda. Deixar isso de fora produz um número bonito que não sobrevive ao primeiro mês. Ela é calculada como um percentual do custo de modelo, a forma mais simples de escalar a conta com o volume, mas custo de operação é majoritariamente fixo: um engenheiro mantendo o agente custa o mesmo com 500 ou com 5.000 interações. Por isso a aproximação tende a subestimar exatamente em volume baixo, onde o custo fixo pesa mais.
O que esta conta não inclui
Esta calculadora estima custo de modelo e operação. De propósito, ela não modela outros itens que também entram na conta de um agente em produção:
- Taxa por conversa do canal. WhatsApp Business e outros provedores cobram por conversa, e em atendimento esse item costuma superar o custo dos tokens.
- Infraestrutura. Banco vetorial, hospedagem e o provedor de API do canal têm custo próprio, fora da tabela de tokens.
- Implementação e integração. Conectar o agente aos sistemas existentes é trabalho de projeto, não custo recorrente de token.
- Tempo do time. Operar, revisar e evoluir o agente consome tempo de pessoas, com ou sem token consumido no mês.
Faixas típicas de consumo por caso de uso
São estes os números que alimentam os presets da calculadora acima, mesmo com o modo avançado desligado. Confira aqui o que está por trás do resultado antes de confiar nele.
| Caso de uso | Tamanho | Entrada (tokens) | Saída (tokens) | Chamadas por interação | Contexto recuperado (tokens) |
|---|---|---|---|---|---|
| Atendimento e suporte | Curta | 800 | 200 | 2 | 400 |
| Atendimento e suporte | Média | 1.500 | 400 | 3 | 800 |
| Atendimento e suporte | Longa | 3.000 | 800 | 5 | 1.500 |
| Análise documental | Curta | 3.000 | 500 | 2 | 0 |
| Análise documental | Média | 8.000 | 1.000 | 2 | 0 |
| Análise documental | Longa | 20.000 | 2.000 | 3 | 0 |
| Qualificação comercial | Curta | 700 | 250 | 2 | 300 |
| Qualificação comercial | Média | 1.200 | 400 | 3 | 600 |
| Qualificação comercial | Longa | 2.500 | 700 | 4 | 1.200 |
Atendimento e suporte. O contexto recuperado cresce junto com o tamanho da interação: uma dúvida curta puxa um trecho pequeno da base de conhecimento, uma conversa longa busca mais vezes e passa por mais chamadas de roteamento e verificação.
Análise documental. O contexto recuperado é zero em qualquer tamanho porque o documento anexado já é a entrada, sem busca adicional. O que cresce é o próprio documento, de um resumo curto a um contrato longo.
Qualificação comercial. O contexto recuperado é o histórico do lead e os dados de enriquecimento consultados a cada chamada, e cresce com a complexidade do perfil analisado.
O que costuma estourar a conta
- Chamadas escondidas. Um agente com roteamento, chamada de ferramenta e verificação faz três a cinco chamadas onde parecia haver uma.
- Contexto recuperado. Cada busca na base de conhecimento é somada à entrada de cada chamada, todo mês, para sempre.
- Histórico completo. Reenviar a conversa inteira a cada turno faz o custo de uma conversa crescer com o quadrado do número de turnos.
- Retentativas. Falha de formato e verificação automática cobram o dobro sem aparecer em lugar nenhum da demo.
Preços usados
Preços por milhão de tokens, em dólar, conforme publicado pelos provedores. Última verificação em 09/09/2026.
| Modelo | Entrada | Saída | Cache |
|---|---|---|---|
| Anthropic Claude Sonnet 5 | US$ 2 | US$ 10 | US$ 0,2 |
| Anthropic Claude Haiku 4.5 | US$ 1 | US$ 5 | US$ 0,1 |
| OpenAI GPT-5 | US$ 1,25 | US$ 10 | US$ 0,125 |
| Google Gemini 2.5 Flash | US$ 0,3 | US$ 2,5 | US$ 0,03 |
Perguntas frequentes
- Quanto custa um agente de IA por mês?
- Depende de três coisas: quantas interações por mês, quanto texto entra e sai em cada uma, e qual modelo. Um agente de atendimento com 2.000 conversas mensais, no modelo pré-selecionado desta calculadora, fica na faixa de poucas centenas de reais por mês só em tokens; num modelo mais barato, essa mesma conta cai para dezenas de reais. O que muda a ordem de grandeza não é o preço da tabela, é o desenho do agente: quantas chamadas ele faz por interação e quanto contexto carrega em cada uma.
- O que é um token?
- É o pedaço de texto que o modelo cobra, geralmente menor que uma palavra inteira. A proporção exata varia conforme o modelo e o idioma: tokenizadores costumam ser menos eficientes em português do que em inglês, gerando mais tokens para o mesmo texto. Por isso esta calculadora conta em tokens, não em palavras. Você paga pelos tokens que entram (a pergunta, o histórico, os documentos anexados) e pelos que saem (a resposta), com preços diferentes para cada um.
- Por que a saída custa mais caro que a entrada?
- Gerar texto exige uma passagem do modelo por token produzido, enquanto a entrada é processada de uma vez. Por isso a saída costuma custar pelo menos cinco vezes o preço da entrada, chegando a mais de oito vezes dependendo do modelo, e por isso limitar o tamanho da resposta é uma das formas mais diretas de cortar custo.
- O que faz a conta de um agente de IA estourar?
- Quatro coisas, nesta ordem: o número de chamadas por interação (um agente com roteamento, ferramenta e verificação faz três a cinco chamadas onde parecia haver uma), o contexto recuperado somado a cada chamada, as retentativas por falha, e o histórico completo da conversa reenviado a cada turno. Nenhuma delas aparece numa demo, e todas aparecem na fatura.
- Cache de prompt reduz o custo de verdade?
- Sim, quando há trecho fixo grande e repetido, como instruções longas ou uma base de conhecimento estável. O provedor cobra a leitura em cache a uma fração do preço normal da entrada. O desconto vale só para a entrada: a resposta gerada continua no preço cheio, e o contexto recuperado por busca (RAG) muda a cada consulta, então não entra nessa conta. Mas o cache também tem custo e requisito próprios. Gravar um trecho pela primeira vez custa mais caro que a entrada normal, cerca de 1,25 vez o preço, e só compensa se esse trecho for reaproveitado depois. Há um tamanho mínimo para um trecho ser cacheável, algo entre 1.024 e 2.048 tokens dependendo do modelo, abaixo do qual o provedor processa a chamada sem cachear nada. E o cache expira: passado um intervalo sem uso, a chamada seguinte volta a pagar a gravação inteira.
- O custo de token é o custo total de um agente em produção?
- Não. Token é a parte visível. Um agente em operação também custa observabilidade, revisão das respostas, ajuste de prompt e manutenção quando o processo muda. Por isso esta calculadora tem uma linha separada de custo de operação: sem ela, a conta fica bonita e errada.
O custo é a parte fácil da conta
A pergunta que decide o projeto é outra: seu processo está pronto para um agente operar de verdade. O AI Score responde isso em dois minutos.