Buscar documentação...

Comece a digitar para buscar documentação

Guia da plataforma

Modelos e preços

O sufixo :free, os preços e por que modelos somem.

A página de modelos lista janela de contexto, preços por token, endpoints e capacidades. Cada página de modelo traz exemplos de código. Nem todo modelo gratuito aceita chamadas de ferramentas ou visão, então confira os selos de capacidade.

Catálogo de modelos com preços e selos de desconto

Rankings mostra quais modelos gratuitos vão bem, a partir de testes da comunidade. Status acompanha a saúde dos provedores.

Novo por aqui? Obter uma chave e enviar a primeira requisição leva um minuto no Início rápido

Modelos gratuitos carregam um sufixo :free, por exemplo gpt-oss-120b:free

Um modelo :free é roteado apenas para provedores gratuitos e nunca usa seu saldo. O mesmo nome sem o sufixo é a versão paga: sem limite, cobrada por token. Trocar é mudar uma string.

Modelos gratuitos têm dois limites: o do próprio provedor e o nosso, por usuário e por modelo. Espere 429 nos horários de pico. Use um modelo pago quando precisar de confiabilidade.

Os tetos exatos, cabeçalhos e orientações de retry estão documentados em Limites de taxa e erros

Os modelos são roteados por grupos de provedores, cada um com preço próprio e listado em Group Pricing. Alta disponibilidade rende descontos automáticos. Um failover pode mudar o preço efetivo.

Tabela de preços por grupo na página de detalhes de um modelo

Para travar um modelo em grupos específicos e suas tarifas, veja Fixação de grupos

A maioria dos modelos cobra por token, com entrada e saída precificadas separadamente. Imagem e vídeo costumam cobrar um valor fixo por chamada. O preço na página do modelo é o que você paga.

A página de preços lista as opções de recarga. As páginas de modelo mostram os preços por token ao vivo.

Nos modelos com suporte, prefixos de prompt repetidos são cobrados a uma tarifa de cache mais baixa. Gravar uma entrada de cache custa cerca de 1,25x um token normal de entrada.

O cache é automático. Prompts de sistema longos e estáveis são os que mais ganham.

As requisições passam para o próximo grupo de provedores quando um atinge o limite ou cai. Um modelo só sai do catálogo quando todos os canais estão fora.

Um modelo sumir sob carga é esperado. Ele volta em minutos assim que um canal se recupera.

Chaves que fixam grupos de provedores só fazem failover dentro dos grupos fixados, veja Fixação de grupos

Para ser avisado assim que voltar, acompanhe-o em Notificações