Nous avons regroupé plus de 190 modèles d'IA gratuits dans un seul endpoint
Nous avons branché 18 fournisseurs gratuits dans UnoRouter : 190+ lignes de modèles gratuits, un endpoint OpenAI-compatible, $0 per token. Ils portent des limites en amont que nous ne pouvons pas relever, plus un léger plafond d'une requête par minute que nous ajoutons pour que les pools partagés restent équitables. Voici la version honnête.
UnoRouter agrège les quotas gratuits de nombreux fournisseurs amont en plus de 190 modèles avec un vrai niveau gratuit derrière une seule clé. Chaque modèle gratuit autorise environ 1 requête par minute par utilisateur ; atteindre le plafond renvoie HTTP 429 avec un en-tête Retry-After, et les pools épuisés renvoient une erreur explicite indiquant que tous les fournisseurs sont occupés, puis se rétablissent automatiquement. Les modèles payants sont facturés à la consommation à partir de $1.
Le paysage des LLM gratuits est réel mais éparpillé : Groq, Gemini, Cloudflare, NVIDIA, SiliconFlow et une douzaine d'autres offrent chacun une capacité bien réelle, derrière une douzaine de pages d'inscription, une douzaine de formats de clé et une douzaine d'API incompatibles. Nous avons découvert, testé et fusionné dans UnoRouter tous les fournisseurs légitimes et gratuits en permanence que nous avons pu trouver. Résultat : 190+ lignes de modèles gratuits provenant de 18 fournisseurs, derrière un seul endpoint OpenAI-compatible et une seule clé.
Ce que nous avons ajoute
Dix-huit fournisseurs gratuits, un par un : Groq, Gemini, Cerebras, SambaNova, Mistral, Cloudflare Workers AI (deux comptes), GitHub Models, Z.ai, OVHcloud, AI Horde, Pollinations, Cohere, Jina, NVIDIA NIM (catalogue ouvert complet : Nemotron, Llama, Qwen, gpt-oss, DeepSeek et plus), SiliconFlow (DeepSeek-V4, GLM-5.1, Qwen3.5/3.6, Kimi-K2.6, MiniMax-M3), le routeur HuggingFace et LLM7. Cela fait 190+ lignes de modèles gratuits : Llama, gpt-oss, Qwen, Mistral, GLM, Nemotron, DeepSeek et plus, sans oublier des modèles gratuits d'embedding, d'image et d'audio. Chacun est sondé de bout en bout pour HTTP, le streaming et les appels d'outils avant sa mise en service, les mêmes contrôles d'authenticité et de banc de test que nous appliquons aux modèles payants.
Gratuits pour une raison
Ces modèles sont vraiment gratuits, et c'est précisément pour cela qu'ils ont des limites. Chaque amont impose les siennes : requêtes par minute, quotas quotidiens de tokens, budgets de neurones Cloudflare, priorité dans la file d'attente des bénévoles. Une fois un plafond atteint, ce fournisseur renvoie un 429 jusqu'à la réinitialisation. Une clé gratuite qui fonctionnait ce matin peut être épuisée cet après-midi. Le palier gratuit offre un débit au mieux, pas une garantie. Si votre charge de travail exige une latence prévisible et aucun 429 surprise, utilisez un modèle payant.
Notre propre limite de débit, et pourquoi elle existe
Par-dessus les plafonds en amont, nous ajoutons une petite limite bien à nous : une requête par minute par modèle gratuit et par utilisateur. C'est délibéré. Un seul modèle gratuit est souvent un unique pool en amont partagé, d'environ un million de tokens par jour pour tout le monde réuni, si bien que sans plafond une poignée de gros utilisateurs le viderait en quelques minutes et tous les autres ne verraient plus rien. Une requête par minute et par modèle garde le pool en vie et le répartit sur toute la communauté, et vous pouvez étaler votre trafic sur les nombreux modèles gratuits au lieu de marteler un seul. Lorsque vous atteignez notre plafond, vous recevez un HTTP 429 avec un en-tête Retry-After qui vous indique exactement combien de temps attendre. C'est distinct du 429 en amont et du 503 ci-dessous. Si vous voulez un débit plus élevé sur un modèle précis, utilisez son palier payant, où la limite ne s'applique pas.
Pourquoi les regrouper
Parce que l'alternative, c'est dix-huit comptes. Chaque fournisseur a sa propre inscription, son propre format de clé, sa propre URL de base et ses propres particularités : Z.ai parle le chemin Zhipu V4, Cloudflare transporte l'identifiant de compte dans l'URL, AI Horde veut une clé anonyme, GitHub verrouille ses modèles derrière une portée de token. Nous avons absorbé tout cela pour que vous les appeliez comme vous appelez tout le reste : un seul point d'accès compatible OpenAI-compatible, une seule clé, un nom de modèle. La règle honnête que nous nous imposons : un seul vrai compte par fournisseur, plafonds acceptes, rien de cultive, rien de mutualise. Nous offrons l'offre gratuite comme un cadeau, pas comme la revente du quota de quelqu'un d'autre.
Comment nous attenuons les limites
Beaucoup de ces modèles sont servis par plus d'un fournisseur gratuit. À lui seul, Llama 3.3 70B tourne chez sept d'entre eux. Quand plusieurs fournisseurs proposent le même modèle, nous les regroupons sous un seul nom publié et basculons automatiquement : si un amont renvoie un 429 ou se tait, le fournisseur sain suivant qui sert ce modèle prend la requête en charge. C'est le seul levier que nous contrôlons vraiment. Si, à un instant donné, tous les fournisseurs d'un modèle sont limités en débit, la requête renvoie un HTTP 503 avec un message explicite "tous les fournisseurs sont occupés" (pas un 404, ni un "modèle introuvable"), et le canal est retesté et réactivé en quelques minutes par notre cron de santé. Ainsi, un modèle gratuit multi-sources continue de répondre longtemps après l'épuisement de l'un de ses fournisseurs. Les modèles gratuits à source unique n'ont aucune solution de repli et se figent donc dès que leur unique amont est épuisé.
Ce que nous n'avons pas fait
Nous n'avons pas ajouté de proxys inverses qui reservent les modèles phares OpenAI ou Claude sans autorisation. Nous n'avons pas intégré d'agregateurs de clés personnelles dont les tokens sont non transferables, ni de services pool-of-pools qui cultivent et font tourner les clés d'autrui. Ces solutions existent, elles sont tentantes, et elles representent exactement le bazar du marche gris que cette passerelle est censée remplacer. Chaque fournisseur de la liste offre son offre gratuite délibérément, selon ses propres conditions. Si une source ne pouvait pas franchir cette barre, elle n'est pas ici.
Essayez-le
Les plus de 190 modèles gratuits sont en service derrière un seul endpoint OpenAI-compatible. Obtenez une clé d'API ou parcourez le catalogue de modèles et filtrez sur gratuit. Souvenez-vous simplement de votre palier lorsqu'un 429 ou un 503 apparaît.
Questions fréquentes
Combien de modèles gratuits UnoRouter propose-t-il ?
Plus de 190 à tout moment, sur un catalogue de 200+ modèles. L'ensemble exact évolue au gré des pools gratuits amont qui s'épuisent et se rétablissent, et la liste en direct se trouve sur unorouter.com/models.
Quelles sont les limites de débit du niveau gratuit ?
Environ 1 requête par minute par modèle par utilisateur. Le plafond renvoie HTTP 429 avec un en-tête Retry-After. Avec 190+ modèles gratuits, la réponse pratique est de tourner entre les modèles plutôt que d'attendre.
Faut-il une carte bancaire pour les modèles gratuits ?
Non. Inscrivez-vous avec Discord ou GitHub, créez une clé et utilisez n'importe quel modèle avec le suffixe :free. Un bonus unique de vérification Discord de $1 peut être dépensé sur les modèles payants.
ai-model-verifier est le moteur de notre testeur de modèles, publié sur npm sous licence AGPL-3.0. Donnez-lui une URL de base, une clé et un modèle, et il vous dit si le point de terminaison sert ce qu'il vend, désormais avec vérification de la signature de réflexion et de la facturation des tokens.
Porter le tag Discord UnoRouter réduit de 25 pour cent votre fenêtre de limitation sur les modèles gratuits : un modèle appelable une fois par minute devient appelable toutes les 45 secondes.
Nevika accepte n'importe quel endpoint compatible OpenAI comme proxy personnalisé. Voici la configuration en une minute, quel modèle choisir et les deux erreurs que l'on rencontre.