Modèles et tarifs
Le suffixe :free, les tarifs, et pourquoi des modèles disparaissent.
La page Modèles liste la fenêtre de contexte, les prix par jeton, les points de terminaison et les capacités. Chaque page de modèle contient des exemples de code. Tous les modèles gratuits ne gèrent pas les appels d'outils ou la vision, vérifiez donc les badges de capacité.

Classements montre quels modèles gratuits sont performants, d'après les tests de la communauté. Statut suit la santé des fournisseurs.
Nouveau ici ? Obtenir une clé et envoyer une première requête prend une minute dans Démarrage rapide
Les modèles gratuits portent un suffixe :free, par exemple gpt-oss-120b:free
Un modèle :free n'est routé que vers des fournisseurs gratuits et n'utilise jamais votre solde. Le même nom sans le suffixe est la version payante : sans plafond, facturée au jeton. Basculer revient à changer une chaîne.
Les modèles gratuits ont deux limites : le plafond propre au fournisseur et notre plafond par utilisateur et par modèle. Attendez-vous à des 429 aux heures de pointe. Utilisez un modèle payant quand vous avez besoin de fiabilité.
Les plafonds exacts, les en-têtes et les conseils de retry sont documentés dans Limites de débit et erreurs
Les modèles sont routés entre des groupes de fournisseurs, chacun tarifé séparément et listé dans Group Pricing. Une haute disponibilité donne droit à des remises automatiques. Un basculement peut changer le prix effectif.

Pour verrouiller un modèle sur des groupes précis et leurs tarifs, voir Épinglage de groupes
La plupart des modèles facturent au jeton, entrée et sortie tarifées séparément. Image et vidéo facturent en général un forfait par appel. Le prix de la page du modèle est celui que vous payez.
La page Tarifs liste les options de rechargement. Les pages de modèle affichent les prix par jeton en direct.
Sur les modèles qui le prennent en charge, les préfixes de prompt répétés sont facturés à un tarif de cache réduit. Écrire une entrée de cache coûte environ 1,25x un jeton d'entrée normal.
La mise en cache est automatique. Les longs prompts système stables en profitent le plus.
Les requêtes basculent vers le groupe de fournisseurs suivant quand l'un est limité en débit ou hors service. Un modèle ne quitte le catalogue que lorsque tous les canaux sont indisponibles.
Qu'un modèle disparaisse sous la charge est normal. Il revient en quelques minutes dès qu'un canal se rétablit.
Les clés qui épinglent des groupes de fournisseurs ne basculent qu'au sein de leurs groupes épinglés, voir Épinglage de groupes
Pour être prévenu dès son retour, surveillez-le dans Notifications