Modèles et tarifs
Ce que signifie le suffixe :free, comment l'utilisation est facturée et pourquoi un modèle disparaît parfois.
La page Modèles liste chaque modèle avec sa fenêtre de contexte, ses tarifs au jeton, ses endpoints pris en charge et des filtres de capacité comme l'appel d'outils et l'entrée d'images. Chaque modèle a sa propre page avec des exemples de code prêts à copier-coller. Tous les modèles gratuits ne prennent pas en charge l'appel d'outils ou la vision, vérifiez donc les badges de capacité avant d'en brancher un dans un agent de programmation.

Rankings montre quels modèles gratuits tiennent vraiment la route, d'après les tests de la communauté, et Status suit la santé des fournisseurs en direct.
Nouveau ici ? Obtenir une clé et envoyer une première requête prend une minute dans Démarrage rapide
Les modèles gratuits portent un suffixe :free, par exemple gpt-oss-120b:free
Un modèle :free n'est routé que vers des fournisseurs upstream gratuits et ne touche jamais votre solde. Le même nom de base sans le suffixe est la version payante : stable, sans plafond et facturée au jeton. Les deux peuvent coexister, donc passer du gratuit au payant est un changement d'une seule chaîne.
Les modèles gratuits ont deux niveaux de limites. Les fournisseurs upstream plafonnent leurs pools gratuits et, en plus, nous ajoutons notre propre limite par utilisateur et par modèle afin qu'un gros consommateur ne puisse pas vider un pool partagé. Attendez-vous à des réponses 429 aux heures de pointe et utilisez un modèle payant quand vous avez besoin de fiabilité.
Les plafonds exacts, les en-têtes et les conseils de retry sont documentés dans Erreurs et limites de débit
Chaque modèle passe par un ou plusieurs groupes de fournisseurs, chacun avec son prix ; le tableau Group Pricing de la page du modèle les liste tous. Une haute disponibilité vaut des remises automatiques, et une bascule vers un autre groupe peut décaler le prix effectif.

Pour verrouiller un modèle sur des groupes précis et leurs tarifs, voir Épinglage de groupes
La plupart des modèles facturent au jeton, avec des tarifs distincts pour l'entrée et la sortie. Quelques modèles (surtout image et vidéo) facturent plutôt un prix forfaitaire par appel. Ce que vous voyez sur la page du modèle est ce que vous payez : pas d'abonnements, pas de frais cachés, votre solde diminue simplement à chaque requête.
La page Tarifs présente les options de rechargement actuelles ; chaque page de modèle affiche les tarifs au jeton en direct.
Pour les modèles qui prennent en charge la mise en cache des prompts (Claude et d'autres), les préfixes de prompt répétés sont facturés à un tarif réduit d'entrée en cache, tandis que l'écriture d'une nouvelle entrée de cache coûte un peu plus qu'un jeton d'entrée normal (environ 1,25x).
La mise en cache est automatique. Les charges de travail avec de longs prompts système stables (agents, presets de RP) en profitent le plus, sans aucune configuration.
Les requêtes basculent automatiquement vers le groupe suivant quand l'un atteint sa limite ou tombe. Le modèle ne disparaît du catalogue que lorsque tous ses canaux sont hors service.
Un modèle qui disparaît sous charge est normal, pas une panne : il revient de lui-même dès qu'un canal récupère, en général en quelques minutes.
Les clés qui épinglent des groupes de fournisseurs ne basculent qu'au sein de leurs groupes épinglés, voir Épinglage de groupes
Pour être prévenu dès son retour, surveillez-le dans Notifications