Modelli e prezzi
Il suffisso :free, i prezzi e il motivo per cui i modelli spariscono.
La pagina Modelli elenca finestra di contesto, prezzi per token, endpoint e capacità. Ogni pagina di modello ha esempi di codice. Non tutti i modelli gratuiti supportano le chiamate agli strumenti o la visione, quindi controlla i badge delle capacità.

Le classifiche mostrano quali modelli gratuiti rendono, in base ai test della community. Lo stato monitora la salute dei provider.
Nuovo qui? Ottenere una chiave e inviare la prima richiesta richiede un minuto in Avvio rapido
I modelli gratuiti portano un suffisso :free, per esempio gpt-oss-120b:free
Un modello :free viene instradato solo verso provider gratuiti e non consuma mai il tuo credito. Lo stesso nome senza suffisso è la versione a pagamento: senza tetto, addebitata per token. Passare dall'una all'altra è una modifica di una stringa.
I modelli gratuiti hanno due limiti: il tetto del provider stesso e il nostro tetto per utente e per modello. Aspettati un 429 nelle ore di punta. Usa un modello a pagamento quando ti serve affidabilità.
I limiti esatti, gli header e le linee guida sui retry sono documentati in Limiti di frequenza ed errori
I modelli vengono instradati tra gruppi di provider, ciascuno con un prezzo a sé ed elencato in Group Pricing. Un'alta disponibilità ottiene sconti automatici. Un failover può cambiare il prezzo effettivo.

Per vincolare un modello a gruppi specifici e alle loro tariffe, vedi Blocco gruppi
La maggior parte dei modelli addebita per token, con input e output a prezzi separati. Immagini e video di solito hanno una tariffa fissa per chiamata. Il prezzo sulla pagina del modello è quello che paghi.
La pagina Prezzi elenca le opzioni di ricarica. Le pagine dei modelli mostrano i prezzi per token in tempo reale.
Sui modelli che lo supportano, i prefissi di prompt ripetuti vengono addebitati a una tariffa cache più bassa. Scrivere una voce di cache costa circa 1,25 volte un normale token di input.
La cache è automatica. Ne beneficiano soprattutto i prompt di sistema lunghi e stabili.
Le richieste passano al gruppo di provider successivo quando uno è a frequenza limitata o non risponde. Un modello lascia il catalogo solo quando tutti i canali sono fuori uso.
Che un modello sparisca sotto carico è previsto. Torna nel giro di minuti appena un canale si riprende.
Le chiavi che bloccano gruppi di provider fanno failover solo entro i gruppi bloccati, vedi Blocco gruppi
Per essere avvisato appena torna, osservalo in Notifiche