Limites, concorrência e quotas
Os limites dependem da chave, projeto, modelo e capacidade autorizada. Esta documentação não fixa uma quota universal nem anuncia preço ou cobrança financeira.
- RPM: requisições por minuto; consultar modelos também consome RPM.
- TPM: orçamento de tokens aplicado pela política de admissão.
- Concorrência: limite de chamadas simultâneas e capacidade compartilhada do deployment.
- Quota: orçamento aplicado ao período configurado.
- Contexto e saída: limites técnicos do modelo e políticas do projeto/deployment.
Uma chamada pode receber HTTP 429 com rate_limit_error, concurrency_exceeded
ou quota_exceeded. Quando disponível, Retry-After informa segundos de espera.
Quota esgotada não se resolve com retries rápidos: verifique o orçamento/período.
O gateway pode reservar um limite conservador antes de inferir e ajustar a contabilização depois. Uma reserva não prova contagem exata pelo tokenizer. Não estime cobrança a partir de respostas sem uso conhecido.
Em caso de HTTP 503 por admissão/contabilização, consulte erros.