Quanto custa a IA (gratuito × pago)
Como funcionam os limites da camada gratuita, quando ela acaba e quanto se paga depois.
A IA do FireZAP roda com a sua chave de provedor. Nós não cobramos por mensagem de IA e não colocamos margem: o que você gasta vai direto para o Google, a OpenAI ou a Anthropic. Por isso vale entender como eles cobram.
O que é uma "requisição"
Cada vez que a IA precisa responder, o FireZAP manda ao provedor as instruções do seu agente + as últimas 25 mensagens da conversa, e recebe a resposta de volta. Isso é uma requisição. Uma conversa de dez idas e voltas gera dez requisições.
As instruções do agente vão inteiras em TODA requisição. Um cadastro enxuto custa menos que um cheio de texto repetido — e costuma responder melhor, porque o modelo não se perde.
A camada gratuita
Gemini e NVIDIA NIM têm camada gratuita. Ela não é ilimitada: o provedor conta requisições por minuto, tokens por minuto e requisições por dia, e estourar qualquer um dos três já bloqueia.
- A cota diária zera às 4h da manhã (meia-noite no fuso do Pacífico). É por isso que a IA volta a funcionar de madrugada e para de novo durante o expediente.
- Quando a cota acaba, a IA não responde e a conversa vai para Pendentes, esperando um atendente. Nada se perde, mas ninguém é atendido automaticamente.
- O Google não publica mais os números na documentação — o limite da sua conta aparece em aistudio.google.com/rate-limit.
Dá para bater no limite fazendo pouca coisa: a contagem é por janela de tempo e por cota compartilhada do serviço, não só pelo total do dia. Um pico de dez conversas ao mesmo tempo pode bloquear.
Como saber que a cota acabou
O sinal mais claro é a IA parar de responder e as conversas se acumularem em Pendentes, sem erro visível na tela. Se desconfiar, fale com o suporte: conseguimos ver no registro do servidor se o provedor está recusando as chamadas, e quantas.
Passar para o pago
É ativar o faturamento na conta do provedor (no Google: aistudio.google.com → Billing). A liberação é imediata e nada muda na configuração do FireZAP — a chave continua a mesma.
- Não há mensalidade nem valor mínimo: paga-se o que usar, e se o movimento cair, a conta cai junto.
- A cobrança é em dólar, no cartão internacional — some o IOF.
- Os modelos Flash Lite custam bem menos que os Flash comuns e dão conta do atendimento do dia a dia. Trocar o modelo é um clique em Agente IA → Edição avançada.
Os provedores mudam de preço e o Google já anunciou aumento para janeiro de 2027. Antes de fechar orçamento, confirme em ai.google.dev/gemini-api/docs/pricing (ou na página equivalente do provedor que você usa).
Ordem de grandeza
Para uma operação que responde algumas centenas de conversas por dia com um modelo Flash, o custo mensal costuma ficar na casa de poucas dezenas de dólares. Um cadastro de agente muito extenso, ou um modelo mais caro, multiplica isso. A melhor medida é a sua: ative o faturamento, use uma semana e olhe o painel de consumo do provedor.
Quando o cliente manda áudio, a IA transcreve antes de responder — e isso também é uma requisição ao provedor. Vale saber se o seu público manda muito áudio.
