Abbiamo riunito oltre 190 modelli di IA gratuiti in un unico endpoint
Abbiamo collegato 18 provider gratuiti in UnoRouter: 190+ righe di modelli gratuiti, un endpoint OpenAI-compatible, $0 per token. Portano limiti a monte che non possiamo alzare, più un piccolo tetto di 1 al minuto che aggiungiamo noi per mantenere equi i pool condivisi. Ecco la versione onesta.
UnoRouter aggrega le quote gratuite di molti provider upstream in più di 190 modelli con un vero piano gratuito dietro un'unica chiave. Ogni modello gratuito consente circa 1 richiesta al minuto per utente; raggiungere il limite restituisce HTTP 429 con un header Retry-After, e i pool esauriti restituiscono un errore esplicito che tutti i provider sono occupati e si riprendono automaticamente. I modelli a pagamento fatturano a consumo a partire da $1.
Il panorama degli LLM gratuiti è reale ma frammentato: Groq, Gemini, Cloudflare, NVIDIA, SiliconFlow e una dozzina di altri regalano ciascuno capacità autentica, dietro una dozzina di pagine di registrazione, una dozzina di formati di chiave e una dozzina di API incompatibili. Abbiamo scoperto, testato e unito in UnoRouter ogni provider legittimo e permanentemente gratuito che siamo riusciti a trovare. Il risultato: 190+ righe di modelli gratuiti da 18 provider dietro un unico endpoint OpenAI-compatible e una sola chiave.
Cosa abbiamo aggiunto
Diciotto provider gratuiti, uno alla volta: Groq, Gemini, Cerebras, SambaNova, Mistral, Cloudflare Workers AI (due account), GitHub Models, Z.ai, OVHcloud, AI Horde, Pollinations, Cohere, Jina, NVIDIA NIM (catalogo aperto completo: Nemotron, Llama, Qwen, gpt-oss, DeepSeek e altri), SiliconFlow (DeepSeek-V4, GLM-5.1, Qwen3.5/3.6, Kimi-K2.6, MiniMax-M3), il router HuggingFace e LLM7. Fa 190+ righe di modelli gratuiti: Llama, gpt-oss, Qwen, Mistral, GLM, Nemotron, DeepSeek e altri, oltre a modelli gratuiti di embedding, immagine e audio. Ognuno viene sondato end to end per HTTP, streaming e chiamate a strumenti prima di andare in produzione, gli stessi controlli di autenticità e di banco di prova che eseguiamo sui modelli a pagamento.
Gratuiti per un motivo
Questi modelli sono davvero gratuiti, ed è esattamente per questo che hanno dei limiti. Ogni upstream impone i propri: richieste al minuto, quote giornaliere di token, budget di neuroni Cloudflare, priorità nella coda dei volontari. Raggiunto un tetto, quel provider restituisce 429 finché non si ripristina. Una chiave gratuita che funzionava stamattina può essere esaurita nel pomeriggio. Il piano gratuito offre throughput best-effort, non una garanzia. Se il tuo carico di lavoro richiede latenza prevedibile e nessun 429 a sorpresa, usa un modello a pagamento.
Il nostro limite di frequenza, e perché esiste
Oltre ai tetti a monte aggiungiamo un piccolo limite tutto nostro: una richiesta al minuto per modello gratuito e per utente. È una scelta deliberata. Un singolo modello gratuito è spesso un unico pool a monte condiviso, di forse un milione di token al giorno per tutti insieme, così che senza un tetto una manciata di utenti pesanti lo prosciugherebbe in pochi minuti e tutti gli altri non vedrebbero nulla. Una al minuto per modello tiene in vita il pool e lo distribuisce sull'intera comunità, e puoi distribuire il traffico sui molti modelli gratuiti invece di martellarne uno solo. Quando raggiungi il nostro tetto ricevi un HTTP 429 con un header Retry-After che ti dice esattamente quanto attendere. È distinto dal 429 a monte e dal 503 più sotto. Se vuoi un throughput più alto su un modello specifico, usa il suo piano a pagamento, dove il limite non si applica.
Perché aggregarli del tutto
Perché l'alternativa sono diciotto account. Ogni provider ha la propria registrazione, il proprio formato di chiave, il proprio base URL e le proprie stranezze: Z.ai parla il path Zhipu V4, Cloudflare porta l'account id nell'URL, AI Horde vuole una chiave anonima, GitHub blocca i modelli dietro uno scope del token. Abbiamo assorbito tutto questo così che tu li chiami come chiami tutto il resto: un unico endpoint OpenAI-compatible, una chiave, un nome di modello. La regola onesta a cui ci atteniamo: un account reale per provider, limiti accettati, niente di coltivato, niente messo in pool. Esponiamo il piano gratuito come un regalo, non come la rivendita della quota di qualcun altro.
Come attenuiamo i limiti
Molti di questi modelli sono serviti da più di un provider gratuito. Il solo Llama 3.3 70B gira su sette di essi. Quando più provider offrono lo stesso modello, li accorpiamo sotto un unico nome pubblicato e commutiamo automaticamente: se un upstream restituisce un 429 o resta muto, il provider sano successivo che serve quel modello prende in carico la richiesta. Questa è l'unica leva che controlliamo davvero. Se in un dato momento tutti i provider di un modello sono limitati in frequenza, la richiesta restituisce un HTTP 503 con un messaggio esplicito "tutti i provider occupati" (non un 404, né un "modello non trovato"), e il canale viene ritestato e riabilitato in pochi minuti dal nostro cron di salute. Così un modello gratuito multi-fonte continua a rispondere a lungo dopo l'esaurimento di uno qualsiasi dei suoi provider. I modelli gratuiti a fonte unica non hanno alcun ripiego e quindi si bloccano quando il loro unico upstream è esaurito.
Cosa non abbiamo fatto
Non abbiamo aggiunto reverse proxy che ri-servono i modelli di punta di OpenAI o Claude senza permesso. Non abbiamo incluso aggregatori di chiavi personali i cui token non sono trasferibili, né servizi pool-of-pools che coltivano e ruotano le chiavi altrui. Esistono, sono allettanti e sono esattamente il caos da mercato grigio che questo gateway intende sostituire. Ogni provider nell'elenco offre il proprio piano gratuito di proposito, secondo i propri termini. Se una sorgente non ha superato quella soglia, qui non c'è.
Provalo
Tutti gli oltre 190 modelli gratuiti sono in produzione dietro un unico endpoint OpenAI-compatible. Ottieni una chiave API oppure esplora il catalogo dei modelli e filtra per gratuiti. Ricorda solo su quale piano sei quando compare un 429 o un 503.
Domande frequenti
Quanti modelli gratuiti ha UnoRouter?
Più di 190 in ogni momento, su un catalogo di 200+ modelli. L'insieme esatto cambia man mano che i pool gratuiti upstream si esauriscono e si riprendono, e la lista in tempo reale è su unorouter.com/models.
Quali sono i limiti di richieste del piano gratuito?
Circa 1 richiesta al minuto per modello per utente. Il limite restituisce HTTP 429 con un header Retry-After. Con 190+ modelli gratuiti, la risposta pratica è ruotare i modelli invece di aspettare.
Serve una carta di credito per i modelli gratuiti?
No. Registrati con Discord o GitHub, crea una chiave e usa qualsiasi modello con il suffisso :free. Un bonus una tantum di $1 per la verifica Discord può essere speso sui modelli a pagamento.
SpicyChat è un sito di RP a configurazione zero la cui memoria e contesto sono chiusi dietro tier a pagamento. UnoRouter mantiene l'avvio facile ma aggiunge oltre 200 modelli che scegli tu, lorebook profondi e una chiave che esegue anche gli agenti di coding.
Agnai è un frontend di RP open source il cui punto forte è il vero multiplayer: più persone e più bot in una sola chat. UnoRouter ha la profondità RP single-user in hosting, dove la chiave è l'account ed esegue anche gli agenti di coding.
Open WebUI è una UI di chat in self-host, Ollama-first, che esegui e configuri con le chiavi. UnoRouter è 200+ modelli in hosting su una sola chiave, nessuna infrastruttura, più un vero client di personaggi, e la chiave scrive anche codice.