Pular para o conteúdo

Limites, concorrência e quotas

Os limites dependem da chave, projeto, modelo e capacidade autorizada. Esta documentação não fixa uma quota universal nem anuncia preço ou cobrança financeira.

  • RPM: requisições por minuto; consultar modelos também consome RPM.
  • TPM: orçamento de tokens aplicado pela política de admissão.
  • Concorrência: limite de chamadas simultâneas e capacidade compartilhada do deployment.
  • Quota: orçamento aplicado ao período configurado.
  • Contexto e saída: limites técnicos do modelo e políticas do projeto/deployment.

Uma chamada pode receber HTTP 429 com rate_limit_error, concurrency_exceeded ou quota_exceeded. Quando disponível, Retry-After informa segundos de espera. Quota esgotada não se resolve com retries rápidos: verifique o orçamento/período.

O gateway pode reservar um limite conservador antes de inferir e ajustar a contabilização depois. Uma reserva não prova contagem exata pelo tokenizer. Não estime cobrança a partir de respostas sem uso conhecido.

Em caso de HTTP 503 por admissão/contabilização, consulte erros.