Inteligência artificial24 de setembro de 202612 min de leitura

Prompt caching da OpenAI: como reduzir custo e latência de agentes

Organize contexto estável, acompanhe acertos de cache e diagnostique perdas para reduzir tokens processados, tempo de resposta e custo em agentes de IA.

Busca respondida: como reduzir custo da API OpenAI com prompt caching

Engenheiro de software analisando o reaproveitamento de contexto e métricas de desempenho de um agente de IA

O prompt caching reaproveita o início idêntico de solicitações feitas à API da OpenAI, evitando processar novamente instruções, ferramentas e contexto que não mudaram. Em modelos GPT-6, entradas em cache podem receber desconto de até 90 por cento, com menor tempo para a primeira resposta. Para obter o benefício, a aplicação precisa colocar o conteúdo estável antes do conteúdo variável, preservar a ordem das ferramentas e medir tokens lidos e gravados no cache em vez de assumir que toda conversa longa ficou mais barata.

Use cache onde existe contexto realmente repetido

Agentes persistentes costumam reenviar políticas, instruções, definições de ferramentas, esquemas e trechos de referência em várias chamadas. Quando esse prefixo permanece igual, a plataforma pode reutilizar o trabalho anterior. Atendimento com regras fixas, análise recorrente de documentos e fluxos que usam o mesmo conjunto de ferramentas são candidatos claros.

Não desenhe o processo apenas para alcançar cache. Uma entrada curta, uma tarefa isolada ou um fluxo em que quase todo o contexto muda pode não gerar economia relevante. Primeiro identifique volume, repetição, latência e custo atuais; depois escolha um caso com prefixo estável e tráfego suficiente para comparar antes e depois.

Coloque o conteúdo estável no início

A correspondência acontece a partir do começo da entrada. Mantenha instruções permanentes, exemplos reutilizáveis, material de referência e definições de ferramentas antes da pergunta ou dos dados específicos do usuário. Alterações no início podem invalidar todo o trecho posterior que seria reutilizado.

Versione o prefixo como um componente do produto. Quando uma política mudar, registre a versão, faça avaliação de qualidade e estime o impacto de custo. Para modelos GPT-6 e posteriores, a documentação informa um prefixo mínimo de 1.024 tokens visíveis e permite pontos de cache explícitos. Conteúdo variável ou de baixa reutilização deve ficar depois do ponto escolhido.

  • Instruções de sistema e políticas estáveis primeiro
  • Ferramentas com nomes, esquemas e ordem consistentes
  • Exemplos e referências compartilhadas antes do caso atual
  • Pergunta, arquivos e dados variáveis no final

Meça leitura, gravação, latência e custo total

A resposta da API informa input_tokens e, nos detalhes, cached_tokens e cache_write_tokens. Calcule a taxa de leitura em cache sobre os tokens elegíveis, acompanhe a gravação necessária para criar novos prefixos e compare tempo até a primeira resposta. Uma taxa alta sem redução de custo total pode esconder saídas longas, muitas chamadas ou escrita frequente de contexto que não será reutilizado.

Na tabela atual para GPT-6 e posteriores, a leitura do cache custa 0,1 vez a taxa de entrada sem cache e a gravação custa 1,25 vez. Isso torna a primeira escrita mais cara e favorece prefixos que serão reutilizados. Faça a conta por fluxo, cliente ou espaço de trabalho e inclua falhas, tentativas e chamadas de ferramenta no custo final.

Investigue quedas antes de alterar o prompt

O painel de Prompt Caching mostra a participação de tokens atendidos pelo cache ao longo do tempo. Quando a taxa cair, use o diagnóstico para comparar uma solicitação com uma resposta recente. A ferramenta pode indicar mudanças de modelo, ferramentas, formato de saída, nível de raciocínio, verbosidade ou outro elemento que impediu a reutilização.

Evite remover e recolocar ferramentas a cada turno. A orientação da OpenAI é manter definições e ordem estáveis, restringir as ferramentas disponíveis com allowed_tools ou usar tool_choice como none quando nenhuma deve executar. Acrescente novas instruções no fim do contexto quando possível, em vez de reescrever o prefixo inteiro.

Planeje duração, tráfego e separação entre clientes

Em GPT-5.6 e posteriores, o valor padrão e atualmente suportado para o tempo mínimo é 30 minutos depois da gravação ou da reutilização mais recente. O cache pode permanecer por mais tempo, mas a aplicação não deve depender disso. Se o intervalo entre tarefas é maior, estime a economia com base na duração garantida e não em um acerto ocasional.

Caches não são compartilhados entre organizações nem entre limites regionais de processamento. Em GPT-6, a chave de cache é opcional para desempenho, mas pode separar contabilização por cliente, usuário ou área. Essa separação ajuda a explicar cobrança e reduz o risco de inferir reutilização entre grupos por meio de observação de acertos.

Faça um piloto com qualidade e privacidade

Escolha um fluxo, registre versão de modelo e prefixo, execute uma amostra representativa e compare qualidade, taxa de acerto, tokens gravados, tokens lidos, latência e custo. O anúncio da OpenAI cita casos com reduções de custo e melhora de acerto, mas esses resultados dependem do contexto, do tráfego e da arquitetura de cada aplicação.

Cache não substitui minimização de dados, controle de acesso, retenção adequada ou avaliação da saída. A documentação explica que o estado pode usar tensores criptografados em armazenamento local de GPU e que políticas variam por modelo e configuração da organização. Confirme retenção e região contratadas antes de incluir informações sensíveis, e mantenha uma alternativa caso o cache não esteja disponível.

Para levar daqui

Prompt caching reduz custo e espera quando a aplicação preserva um prefixo útil e repetido. Estruture o contexto, mantenha ferramentas estáveis, acompanhe leitura e gravação e avalie qualidade, privacidade e custo total antes de ampliar o uso.

Fontes consultadas

De onde veio esta análise.

Continue a leitura