A cobrança que pega você de surpresa
A maioria das pessoas que usa Claude ou ChatGPT para trabalhar todos os dias nunca examinou de fato pelo que está pagando. Há uma assinatura mensal ou uma chave de API com um saldo que diminui silenciosamente, e o número muda - às vezes mais devagar do que o esperado, às vezes muito mais rápido. Se você já se perguntou por que uma semana "leve" de trabalho com assistência de AI custou mais do que uma semana intensa, a resposta quase nunca é que a AI é "cara". Geralmente tem a ver com o que você está enviando, não apenas com o que está perguntando.
Esta publicação explica a matemática de verdade - em linguagem simples, sem jargão - para que você veja de onde o custo realmente vem e por que a solução não é "usar menos AI", mas "parar de pagar para se explicar novamente a cada mensagem".
Tokens, em linguagem simples
Cada mensagem que você envia e cada resposta que recebe de volta é dividida em pequenos blocos chamados tokens. Como regra geral, um token equivale a cerca de três quartos de uma palavra - portanto, 1.000 palavras de texto correspondem aproximadamente a 1.300-1.400 tokens. Palavras curtas, frases comuns e código geralmente são compactados em menos tokens por palavra; palavras incomuns, formatação e textos que não estão em inglês podem usar mais.
Duas coisas costumam confundir as pessoas quando elas pensam nisso pela primeira vez:
- As duas direções contam. As palavras que você digita (entrada) e as palavras que a AI escreve de volta (saída) são cobradas ou contabilizadas. Uma resposta longa e detalhada custa mais do que uma resposta de uma linha, mesmo para a mesma pergunta.
- Cada mensagem reenvia a conversa inteira. Essa é a parte que quase ninguém percebe até vê-la explicada. Os modelos de IA baseados em chat não têm memória persistente entre as mensagens como um colega humano teria. Para gerar uma resposta que faça sentido no contexto, o sistema precisa reler toda a conversa até aquele momento - sua primeira mensagem, a primeira resposta dele, sua segunda mensagem, a segunda resposta dele e assim por diante - toda vez que você clica em enviar.
Por que "apenas conversar" fica caro à medida que a conversa cresce
Aqui está a parte que realmente importa. Imagine uma conversa que começa curta e cresce naturalmente, como acontece nas conversas de trabalho reais:
- Mensagem 1: você envia 200 palavras de contexto e recebe 150 palavras de volta.
- Mensagem 2: agora o sistema precisa processar a mensagem 1 e sua nova mensagem, e depois responder novamente.
- Mensagem 3: ela reprocessa as mensagens 1 e 2, além da sua nova mensagem.
Na mensagem 10, você não está pagando por "uma nova pergunta". Você está pagando para reenviar tudo o que veio antes, todas as vezes. O histórico da conversa é cumulativo - ele não é redefinido nem compactado sozinho. Uma conversa de 20 turnos não custa o dobro de uma de 10; por causa do efeito de reenvio, ela pode acabar custando várias vezes mais, mesmo que o conteúdo "novo" por mensagem tenha permanecido aproximadamente do mesmo tamanho.
Isto é uma conta indicativa, não uma tabela de preços - os provedores definem e alteram suas próprias tarifas por token, e você deve sempre consultar os preços publicados atuais no site do provedor (anthropic.com ou openai.com) se quiser valores exatos para o seu plano. Mas o mecanismo permanece válido independentemente da tarifa: até mesmo um custo modesto por token, multiplicado por um histórico de conversa cada vez maior, aumenta rapidamente. A tarifa não é o principal fator. É o tamanho do que você está reenviando.
Onde o desperdício realmente está
Agora, considere como a maioria das pessoas realmente trabalha. Um profissional do conhecimento típico que realiza tarefas com auxílio de AI - redigindo e-mails, resumindo chamadas, analisando uma planilha, escrevendo um briefing, verificando uma cláusula contratual - não começa cada tarefa do zero. Ele reexplica, todas as vezes:
- "Você é um [role] experiente. Aja como um [X] sênior. Aqui estão a voz da nossa marca / o contexto da nossa equipe / nossas preferências de formatação..."
- Informações básicas sobre a empresa, o projeto, o público e as restrições.
- As mesmas instruções de tom e estilo que a pessoa digitou ontem e no dia anterior.
Nada disso é informação "nova" para a tarefa em questão - é texto padrão. Mas, como é digitado novamente na janela de chat (ou, pior ainda, construído organicamente dentro de uma conversa longa e divagante), ele é contabilizado, reenviado e cobrado novamente toda vez.
Um exemplo ilustrativo: 10 tarefas por dia, de duas maneiras diferentes
Vamos comparar duas abordagens para o mesmo dia de trabalho - 10 tarefas assistidas por AI, cada uma exigindo que a AI atue como um tipo específico de especialista (por exemplo, um analista de marketing examinando números de campanha ou um gerente de operações aprimorando um documento de processo).
Abordagem A: prompts redigitados de forma improvisada
Cada uma das 10 tarefas começa com a pessoa redigitando (ou copiando e colando de um documento antigo) um ou dois parágrafos de contextualização do papel: "Você é um analista sênior de marketing, especializado em atribuição e ROI de campanhas. Analise os dados a seguir e me forneça um resumo estruturado com recomendações..." Em seguida vem a tarefa propriamente dita. Depois, geralmente, algumas mensagens de acompanhamento na mesma conversa para esclarecer ou refinar algo - e cada uma reenvia tudo o que veio antes. Multiplique esse padrão de texto padrão mais acompanhamento por 10 tarefas separadas e você estará pagando novamente, na prática, pelas mesmas instruções, dezenas de vezes, o dia inteiro, todos os dias.
Abordagem B: uma configuração enxuta baseada em arquivo de habilidades
O papel, o tom, os padrões e o método de trabalho são escritos uma única vez, com cuidado, como um prompt de sistema compacto - um "arquivo de habilidades" - e carregados no início da sessão, em vez de serem redigitados. Ele é preparado de uma só vez, mantido enxuto (sem divagações nem instruções redundantes) e reutilizado em todas as tarefas daquele papel. A pessoa apenas informa a tarefa. Não é preciso reexplicar quem a AI deve ser, como formatar as respostas ou o que significa fazer um bom trabalho - tudo isso já está definido de forma concisa no início.
A diferença na matemática dos tokens não está em a AI "trabalhar mais" na Abordagem B - está no fato de que a parte repetida e padronizada de cada mensagem diminui drasticamente. Menos texto padrão reenviado por mensagem, em todas as mensagens de cada tarefa, todos os dias - isso se acumula rapidamente, assim como o problema do crescimento da conversa, mas na direção oposta.
Um prompt de sistema pré-configurado que transforma Claude ou ChatGPT em um analista sênior de marketing - com ROI de campanhas, atribuição e padrões de relatórios definidos de uma vez, para que você não precise reexplicar o papel toda vez que colar novos números.
Ver Rafa - Especialista em Análise de Marketing →Por que um arquivo de Skill bem elaborado supera um prompt improvisado
Nem todos os "prompts reutilizáveis" resolvem esse problema. Um prompt de sistema inchado e genérico demais - cinco páginas de instruções vagas "para garantir" - pode ser tão desperdiçador quanto redigitar tudo, porque continua sendo texto padrão reenviado a cada mensagem, apenas colado uma vez em vez de digitado do zero todas as vezes. O fator que realmente importa é a concisão: um arquivo de Skill que diga exatamente qual é o papel, exatamente como formatar a saída e exatamente o que significa "concluído" - nada além disso - fornecido uma única vez no início de cada sessão.
Essa é a verdadeira diferença entre um arquivo de Skill e um prompt solto que você continua reescrevendo: não se trata apenas de conveniência, mas de reduzir permanentemente a parte repetida de cada mensagem que você envia, durante toda a duração daquela sessão de trabalho.
Configura Claude ou ChatGPT como um gerente sênior de operações - com POPs, auditorias de processos e estruturas de priorização integrados, para que cada nova tarefa comece de forma enxuta, sem reexplicar seu contexto operacional do zero.
Ver Owen - Gerente de Operações →Hábitos práticos que realmente fazem diferença
Independentemente da ferramenta ou do plano que você usa, alguns hábitos reduzem mais do que qualquer outra coisa a "taxa oculta de reenvio":
- Comece novas tarefas em novas conversas em vez de colocar tudo em uma única thread cada vez maior. Uma conversa nova e focada reenvia muito menos histórico a cada mensagem.
- Forneça o papel e o contexto uma única vez, de forma concisa, em vez de reexplicá-los dentro da própria tarefa todas as vezes.
- Mantenha concisas as instruções fornecidas no início. Um prompt de sistema longo e prolixo continua sendo texto padrão reenviado - reduza-o ao que realmente muda a saída.
- Peça o tamanho de saída de que você realmente precisa. Os tokens de saída também entram na conta, e "dê-me um resumo estruturado" tende a custar menos do que um pedido aberto como "conte-me tudo sobre isso".
- Consulte diretamente com seu provedor os preços publicados atuais se quiser calcular seus próprios custos com precisão - as tarifas e os modelos mudam, e é melhor confirmar os números exatos na fonte do que em qualquer estimativa de terceiros.
Uma skill de agente de operações configurada para tarefas recorrentes e estruturadas - projetada para manter as instruções compactas e consistentes, em vez de fazê-las crescer a cada nova solicitação.
Ver Arthur - Agente de operações de AI →Insira como você (ou sua equipe) realmente usa os chats de AI e obtenha uma estimativa mensal real do desperdício de tokens e do custo em dólares ao refazer prompts em comparação com o uso de um arquivo de skill persistente. Sem cadastro, sem e-mail - apenas os cálculos desta publicação aplicados aos seus números.
Experimente a calculadora →Perguntas frequentes
Eu realmente pago pelas respostas da AI, e não apenas pelas minhas mensagens?
Sim. Tanto o que você envia quanto o que recebe de volta é contabilizado. Um modelo que escreve respostas longas e detalhadas por padrão usará mais tokens de saída do que um modelo que escreve respostas objetivas e focadas - mesmo para exatamente a mesma pergunta.
Por que uma conversa longa custa muito mais do que uma curta, tarefa por tarefa?
Porque a maioria das ferramentas de AI baseadas em chat não retém memória entre as mensagens por conta própria - para responder de forma coerente à mensagem 20, o sistema precisa reprocessar as 19 primeiras mensagens (e suas próprias 19 respostas) junto com ela. O histórico da conversa é reenviado integralmente, todas as vezes, então o custo tende a crescer muito mais rápido do que a própria duração da conversa.
Um arquivo de skill é apenas um nome sofisticado para um prompt salvo?
Funcionalmente, sim - é um prompt de sistema ou uma instrução de projeto que você escreve uma vez e reutiliza. O que diferencia um bom prompt de um prompt improvisado é a disciplina: ele define a função, os padrões e o formato de saída de maneira precisa e concisa, para que a parte de "texto padronizado" reenviada a cada mensagem permaneça a menor possível, sem deixar de cumprir seu objetivo.
Devo me preocupar com valores exatos em dólares ou apenas com o comportamento?
Concentre-se primeiro no comportamento - reduzir o contexto repetido e iniciar novas conversas para novas tarefas diminuirá seu uso independentemente de qual seja a tarifa por token neste mês. Se quiser calcular os custos exatos para o seu próprio volume, consulte as tarifas atuais publicadas na página de preços do seu provedor e faça as contas com base na quantidade típica de mensagens que você envia.
Em resumo:
O custo de tokens do trabalho diário com AI é muito mais influenciado pelo contexto repetido e padronizado do que pela tarifa por token em si - a cada mensagem, toda a conversa é reenviada, então prompts redigitados de forma improvisada se acumulam rapidamente. Um arquivo de skill conciso e com as informações essenciais logo no início, como o Rafa ou o Owen, minimiza esse desperdício ao carregar a função uma única vez, de forma precisa, em vez de explicá-la novamente a cada mensagem.


