Modelos e preços
O que o sufixo :free significa, como o uso é cobrado e por que um modelo às vezes desaparece.
A página de Modelos lista cada modelo com janela de contexto, preços por token, endpoints suportados e filtros de capacidade como chamadas de ferramentas e entrada de imagem. Cada modelo tem sua própria página com exemplos de código prontos para copiar e colar. Nem todo modelo gratuito suporta chamadas de ferramentas ou visão, então verifique os selos de capacidade antes de conectar um a um agente de programação.

Rankings mostra quais modelos gratuitos entregam de verdade, com base em testes da comunidade, e Status acompanha a saúde dos provedores ao vivo.
Novo por aqui? Obter uma chave e enviar a primeira requisição leva um minuto no Início rápido
Modelos gratuitos carregam um sufixo :free, por exemplo gpt-oss-120b:free
Um modelo :free é roteado somente para provedores upstream gratuitos e nunca toca seu saldo. O mesmo nome base sem o sufixo é a versão paga: estável, sem limite e cobrada por token. Ambos podem coexistir, então mudar de gratuito para pago é uma alteração de uma única string.
Modelos gratuitos têm duas camadas de limites. Os provedores upstream limitam seus pools gratuitos e, além disso, nós adicionamos nosso próprio limite por usuário e por modelo, para que um usuário intenso não esgote um pool compartilhado. Espere respostas 429 nos horários de pico e use um modelo pago quando precisar de confiabilidade.
Os tetos exatos, cabeçalhos e orientações de retry estão documentados em Erros e limites de taxa
Cada modelo roteia por um ou mais grupos de provedores, cada um com seu preço; a tabela Group Pricing na página do modelo lista todos. Alta disponibilidade rende descontos automáticos, e um failover para outro grupo pode mudar o preço efetivo.

Para travar um modelo em grupos específicos e suas tarifas, veja Fixação de grupos
A maioria dos modelos cobra por token, com preços separados de entrada e saída. Alguns poucos modelos (na maioria imagem e vídeo) cobram um preço fixo por chamada. O que você vê na página do modelo é o que você paga: sem assinaturas, sem taxas ocultas, seu saldo simplesmente diminui a cada requisição.
A página de Preços tem as opções de recarga atuais; cada página de modelo mostra os preços por token ao vivo.
Para modelos que suportam cache de prompt (Claude e outros), prefixos de prompt repetidos são cobrados a uma tarifa reduzida de entrada em cache, enquanto gravar uma nova entrada de cache custa um pouco mais do que um token de entrada normal (cerca de 1,25x).
O cache é automático. Cargas de trabalho com prompts de sistema longos e estáveis (agentes, presets de RP) são as que mais se beneficiam, sem nenhuma configuração.
As requisições fazem failover automático para o próximo grupo quando um atinge o limite ou cai. Só quando todos os canais de um modelo estão fora ele some do catálogo.
Um modelo sumir sob carga é esperado, não uma pane: ele reaparece sozinho quando um canal se recupera, geralmente em minutos.
Chaves que fixam grupos de provedores só fazem failover dentro dos grupos fixados, veja Fixação de grupos
Para ser avisado assim que voltar, acompanhe-o em Notificações