Nous avons regroupé plus de 190 modèles d'IA gratuits dans un seul endpoint
Nous avons branché 18 fournisseurs gratuits dans UnoRouter : 190+ lignes de modèles gratuits, un endpoint OpenAI-compatible, $0 per token. Ils portent des limites en amont que nous ne pouvons pas relever, plus un léger plafond d'une requête par minute que nous ajoutons pour que les pools partagés restent équitables. Voici la version honnête.
UnoRouter agrège les quotas gratuits de nombreux fournisseurs amont en plus de 190 modèles avec un vrai niveau gratuit derrière une seule clé. Chaque modèle gratuit autorise environ 1 requête par minute par utilisateur ; atteindre le plafond renvoie HTTP 429 avec un en-tête Retry-After, et les pools épuisés renvoient une erreur explicite indiquant que tous les fournisseurs sont occupés, puis se rétablissent automatiquement. Les modèles payants sont facturés à la consommation à partir de $1.
Le paysage des LLM gratuits est réel mais éparpillé : Groq, Gemini, Cloudflare, NVIDIA, SiliconFlow et une douzaine d'autres offrent chacun une capacité bien réelle, derrière une douzaine de pages d'inscription, une douzaine de formats de clé et une douzaine d'API incompatibles. Nous avons découvert, testé et fusionné dans UnoRouter tous les fournisseurs légitimes et gratuits en permanence que nous avons pu trouver. Résultat : 190+ lignes de modèles gratuits provenant de 18 fournisseurs, derrière un seul endpoint OpenAI-compatible et une seule clé.
Ce que nous avons ajoute
Dix-huit fournisseurs gratuits, un par un : Groq, Gemini, Cerebras, SambaNova, Mistral, Cloudflare Workers AI (deux comptes), GitHub Models, Z.ai, OVHcloud, AI Horde, Pollinations, Cohere, Jina, NVIDIA NIM (catalogue ouvert complet : Nemotron, Llama, Qwen, gpt-oss, DeepSeek et plus), SiliconFlow (DeepSeek-V4, GLM-5.1, Qwen3.5/3.6, Kimi-K2.6, MiniMax-M3), le routeur HuggingFace et LLM7. Cela fait 190+ lignes de modèles gratuits : Llama, gpt-oss, Qwen, Mistral, GLM, Nemotron, DeepSeek et plus, sans oublier des modèles gratuits d'embedding, d'image et d'audio. Chacun est sondé de bout en bout pour HTTP, le streaming et les appels d'outils avant sa mise en service, les mêmes contrôles d'authenticité et de banc de test que nous appliquons aux modèles payants.
Gratuits pour une raison
Ces modèles sont vraiment gratuits, et c'est précisément pour cela qu'ils ont des limites. Chaque amont impose les siennes : requêtes par minute, quotas quotidiens de tokens, budgets de neurones Cloudflare, priorité dans la file d'attente des bénévoles. Une fois un plafond atteint, ce fournisseur renvoie un 429 jusqu'à la réinitialisation. Une clé gratuite qui fonctionnait ce matin peut être épuisée cet après-midi. Le palier gratuit offre un débit au mieux, pas une garantie. Si votre charge de travail exige une latence prévisible et aucun 429 surprise, utilisez un modèle payant.
Notre propre limite de débit, et pourquoi elle existe
Par-dessus les plafonds en amont, nous ajoutons une petite limite bien à nous : une requête par minute par modèle gratuit et par utilisateur. C'est délibéré. Un seul modèle gratuit est souvent un unique pool en amont partagé, d'environ un million de tokens par jour pour tout le monde réuni, si bien que sans plafond une poignée de gros utilisateurs le viderait en quelques minutes et tous les autres ne verraient plus rien. Une requête par minute et par modèle garde le pool en vie et le répartit sur toute la communauté, et vous pouvez étaler votre trafic sur les nombreux modèles gratuits au lieu de marteler un seul. Lorsque vous atteignez notre plafond, vous recevez un HTTP 429 avec un en-tête Retry-After qui vous indique exactement combien de temps attendre. C'est distinct du 429 en amont et du 503 ci-dessous. Si vous voulez un débit plus élevé sur un modèle précis, utilisez son palier payant, où la limite ne s'applique pas.
Pourquoi les regrouper
Parce que l'alternative, c'est dix-huit comptes. Chaque fournisseur a sa propre inscription, son propre format de clé, sa propre URL de base et ses propres particularités : Z.ai parle le chemin Zhipu V4, Cloudflare transporte l'identifiant de compte dans l'URL, AI Horde veut une clé anonyme, GitHub verrouille ses modèles derrière une portée de token. Nous avons absorbé tout cela pour que vous les appeliez comme vous appelez tout le reste : un seul point d'accès compatible OpenAI-compatible, une seule clé, un nom de modèle. La règle honnête que nous nous imposons : un seul vrai compte par fournisseur, plafonds acceptes, rien de cultive, rien de mutualise. Nous offrons l'offre gratuite comme un cadeau, pas comme la revente du quota de quelqu'un d'autre.
Comment nous attenuons les limites
Beaucoup de ces modèles sont servis par plus d'un fournisseur gratuit. À lui seul, Llama 3.3 70B tourne chez sept d'entre eux. Quand plusieurs fournisseurs proposent le même modèle, nous les regroupons sous un seul nom publié et basculons automatiquement : si un amont renvoie un 429 ou se tait, le fournisseur sain suivant qui sert ce modèle prend la requête en charge. C'est le seul levier que nous contrôlons vraiment. Si, à un instant donné, tous les fournisseurs d'un modèle sont limités en débit, la requête renvoie un HTTP 503 avec un message explicite "tous les fournisseurs sont occupés" (pas un 404, ni un "modèle introuvable"), et le canal est retesté et réactivé en quelques minutes par notre cron de santé. Ainsi, un modèle gratuit multi-sources continue de répondre longtemps après l'épuisement de l'un de ses fournisseurs. Les modèles gratuits à source unique n'ont aucune solution de repli et se figent donc dès que leur unique amont est épuisé.
Ce que nous n'avons pas fait
Nous n'avons pas ajouté de proxys inverses qui reservent les modèles phares OpenAI ou Claude sans autorisation. Nous n'avons pas intégré d'agregateurs de clés personnelles dont les tokens sont non transferables, ni de services pool-of-pools qui cultivent et font tourner les clés d'autrui. Ces solutions existent, elles sont tentantes, et elles representent exactement le bazar du marche gris que cette passerelle est censée remplacer. Chaque fournisseur de la liste offre son offre gratuite délibérément, selon ses propres conditions. Si une source ne pouvait pas franchir cette barre, elle n'est pas ici.
Essayez-le
Les plus de 190 modèles gratuits sont en service derrière un seul endpoint OpenAI-compatible. Obtenez une clé d'API ou parcourez le catalogue de modèles et filtrez sur gratuit. Souvenez-vous simplement de votre palier lorsqu'un 429 ou un 503 apparaît.
Questions fréquentes
Combien de modèles gratuits UnoRouter propose-t-il ?
Plus de 190 à tout moment, sur un catalogue de 200+ modèles. L'ensemble exact évolue au gré des pools gratuits amont qui s'épuisent et se rétablissent, et la liste en direct se trouve sur unorouter.com/models.
Quelles sont les limites de débit du niveau gratuit ?
Environ 1 requête par minute par modèle par utilisateur. Le plafond renvoie HTTP 429 avec un en-tête Retry-After. Avec 190+ modèles gratuits, la réponse pratique est de tourner entre les modèles plutôt que d'attendre.
Faut-il une carte bancaire pour les modèles gratuits ?
Non. Inscrivez-vous avec Discord ou GitHub, créez une clé et utilisez n'importe quel modèle avec le suffixe :free. Un bonus unique de vérification Discord de $1 peut être dépensé sur les modèles payants.
SpicyChat est un site de RP sans configuration dont la mémoire et le contexte sont réservés aux paliers payants. UnoRouter garde le démarrage facile mais ajoute 200+ modèles que vous choisissez, des lorebooks profonds, et une clé qui fait aussi tourner les agents de code.
Agnai est une interface de RP open source dont le point fort est le vrai multijoueur : plusieurs humains et plusieurs bots dans une même conversation. UnoRouter offre la profondeur du RP mono-utilisateur en hébergé, où la clé est le compte et fait aussi tourner les agents de code.
Open WebUI est une interface de chat auto-hébergée, centrée sur Ollama, que vous exécutez et alimentez en clés. UnoRouter, c'est 200+ modèles hébergés sur une seule clé, sans infra, plus un vrai client de personnages, et la clé code aussi.