Reunimos mais de 190 modelos de IA gratuitos em um único endpoint
Conectamos 18 provedores gratuitos ao UnoRouter: 190+ linhas de modelos gratuitos, um endpoint OpenAI-compatible, $0 per token. Eles carregam limites de origem que não podemos aumentar, mais um pequeno teto de 1 por minuto que nós adicionamos para manter os pools compartilhados justos. Aqui vai a versão honesta.
O UnoRouter agrega as cotas gratuitas de muitos provedores upstream em mais de 190 modelos com nível gratuito de verdade atrás de uma única chave. Cada modelo gratuito permite cerca de 1 requisição por minuto por usuário; atingir o teto retorna HTTP 429 com um cabeçalho Retry-After, e pools esgotados retornam um erro explícito de que todos os provedores estão ocupados e se recuperam automaticamente. Modelos pagos cobram por consumo a partir de $1.
O cenário dos LLMs gratuitos é real, mas está espalhado: Groq, Gemini, Cloudflare, NVIDIA, SiliconFlow e uma dúzia de outros oferecem, cada um, capacidade genuína, atrás de uma dúzia de páginas de cadastro, uma dúzia de formatos de chave e uma dúzia de APIs incompatíveis. Descobrimos, testamos e unificamos no UnoRouter todos os provedores legítimos e permanentemente gratuitos que conseguimos encontrar. O resultado: 190+ linhas de modelos gratuitos de 18 provedores atrás de um único endpoint OpenAI-compatible e uma só chave.
O que adicionamos
Dezoito provedores gratuitos, um de cada vez: Groq, Gemini, Cerebras, SambaNova, Mistral, Cloudflare Workers AI (duas contas), GitHub Models, Z.ai, OVHcloud, AI Horde, Pollinations, Cohere, Jina, NVIDIA NIM (catálogo aberto completo: Nemotron, Llama, Qwen, gpt-oss, DeepSeek e mais), SiliconFlow (DeepSeek-V4, GLM-5.1, Qwen3.5/3.6, Kimi-K2.6, MiniMax-M3), o roteador da HuggingFace e o LLM7. São 190+ linhas de modelos gratuitos: Llama, gpt-oss, Qwen, Mistral, GLM, Nemotron, DeepSeek e mais, além de modelos gratuitos de embedding, imagem e áudio. Cada um é testado de ponta a ponta para HTTP, streaming e chamadas de ferramentas antes de entrar no ar, as mesmas verificações de autenticidade e de bancada que executamos nos modelos pagos.
Gratuitos por um motivo
Esses modelos são realmente gratuitos, e é exatamente por isso que têm limites. Cada origem impõe os seus: requisições por minuto, cotas diárias de tokens, orçamentos de neurônios da Cloudflare, prioridade na fila de voluntários. Ao atingir um teto, aquele provedor retorna 429 até que ele seja reiniciado. Uma chave gratuita que funcionava de manhã pode estar esgotada à tarde. O nível gratuito é throughput de melhor esforço, não uma garantia. Se sua carga de trabalho precisa de latência previsível e nenhum 429 de surpresa, use um modelo pago.
Nosso próprio limite de taxa, e por que ele existe
Além dos tetos de origem, adicionamos um pequeno limite nosso: uma requisição por minuto por modelo gratuito e por usuário. É proposital. Um único modelo gratuito costuma ser um só pool de origem compartilhado, de talvez um milhão de tokens por dia para todo mundo somado, de modo que, sem um teto, um punhado de usuários pesados o esvaziaria em minutos e todos os demais não veriam nada. Uma por minuto por modelo mantém o pool vivo e espalhado por toda a comunidade, e você pode distribuir o tráfego pelos muitos modelos gratuitos em vez de martelar um só. Quando você atinge o nosso teto, recebe um HTTP 429 com um cabeçalho Retry-After que informa exatamente quanto tempo esperar. Isso é separado do 429 de origem e do 503 mais abaixo. Se quiser throughput maior em um modelo específico, use o nível pago dele, onde o limite não se aplica.
Por que agrega-los, afinal
Porque a alternativa são dezoito contas. Cada provedor tem seu próprio cadastro, seu próprio formato de chave, sua própria base URL e suas próprias peculiaridades: a Z.ai fala o caminho Zhipu V4, a Cloudflare carrega o id da conta na URL, a AI Horde quer uma chave anonima, o GitHub limita modelos por escopo de token. Absorvemos tudo isso para que você os chame da mesma forma que chama todo o resto: um único endpoint OpenAI-compatible, uma chave, um nome de modelo. A regra honesta que seguimos para nos mesmos: uma conta real por provedor, limites aceitos, nada cultivado, nada agrupado. Oferecemos a camada gratuita como um presente, não como revenda da cota de outra pessoa.
Como suavizamos os limites
Muitos desses modelos são servidos por mais de um provedor gratuito. Só o Llama 3.3 70B roda em sete deles. Quando vários provedores oferecem o mesmo modelo, nós os agrupamos sob um único nome publicado e fazemos failover automaticamente: se uma origem retorna um 429 ou fica em silêncio, o próximo provedor saudável que serve aquele modelo assume a requisição. Essa é a única alavanca que de fato controlamos. Se, em um dado momento, todos os provedores de um modelo estão com a taxa limitada, a requisição retorna um HTTP 503 com uma mensagem explícita de "todos os provedores ocupados" (não um 404, nem um "modelo não encontrado"), e o canal é retestado e reativado em minutos pelo nosso cron de saúde. Assim, um modelo gratuito de múltiplas fontes continua respondendo muito depois de qualquer um de seus provedores se esgotar. Modelos gratuitos de fonte única não têm alternativa, então travam quando sua única origem se esgota.
O que não fizemos
Não adicionamos proxies reversos que reservem modelos de ponta da OpenAI ou da Claude sem permissão. Não incluimos agregadores de chaves pessoais cujos tokens são intransferiveis, nem serviços de pool de pools que cultivam e rotacionam chaves alheias. Eles existem, são tentadores e são exatamente a bagunca de mercado paralelo que este gateway veio substituir. Cada provedor da lista oferece sua camada gratuita de propósito, sob seus próprios termos. Se uma fonte não passou nesse critério, ela não está aqui.
Experimente
Todos os mais de 190 modelos gratuitos estão no ar atrás de um único endpoint OpenAI-compatible. Pegue uma chave de API ou explore o catálogo de modelos e filtre por gratuitos. Só lembre em qual nível você está quando um 429 ou um 503 aparecer.
Perguntas frequentes
Quantos modelos gratuitos o UnoRouter tem?
Mais de 190 a qualquer momento, de um catálogo de 200+ modelos. O conjunto exato muda conforme os pools gratuitos upstream se esgotam e se recuperam, e a lista ao vivo está em unorouter.com/models.
Quais são os limites de uso do nível gratuito?
Cerca de 1 requisição por minuto por modelo por usuário. O teto retorna HTTP 429 com um cabeçalho Retry-After. Com 190+ modelos gratuitos, a resposta prática é alternar entre modelos em vez de esperar.
Preciso de cartão de crédito para os modelos gratuitos?
Não. Cadastre-se com Discord ou GitHub, crie uma chave e use qualquer modelo com o sufixo :free. Um bônus único de $1 pela verificação no Discord pode ser gasto nos modelos pagos.
SpicyChat é um site de RP sem configuração cuja memória e contexto ficam presos atrás de níveis pagos. UnoRouter mantém o começo fácil mas adiciona mais de 200 modelos que você escolhe, lorebooks profundos e uma chave que também roda agentes de código.
Agnai é um front-end de RP open-source cujo destaque é o multiplayer de verdade: vários humanos e vários bots em um só chat. UnoRouter tem profundidade de RP single-user hospedada, onde a chave é a conta e também roda agentes de código.
Open WebUI é uma UI de chat auto-hospedada e centrada em Ollama que você roda e chaveia. UnoRouter é mais de 200 modelos hospedados em uma chave, sem infra, mais um cliente de personagens de verdade, e a chave também programa.