Modelli e prezzi
Cosa significa il suffisso :free, come viene addebitato l'uso e perché a volte un modello scompare.
La pagina Modelli elenca ogni modello con finestra di contesto, prezzi per token, endpoint supportati e filtri di capacità come le chiamate agli strumenti e l'input di immagini. Ogni modello ha una propria pagina con esempi di codice pronti da copiare e incollare. Non tutti i modelli gratuiti supportano le chiamate agli strumenti o la visione, quindi controlla i badge di capacità prima di collegarne uno a un agente di programmazione.

Rankings mostra quali modelli gratuiti rendono davvero, in base ai test della community, e Status segue in diretta la salute dei provider.
Nuovo qui? Ottenere una chiave e inviare la prima richiesta richiede un minuto in Avvio rapido
I modelli gratuiti portano un suffisso :free, per esempio gpt-oss-120b:free
Un modello :free viene instradato solo verso fornitori upstream gratuiti e non tocca mai il tuo saldo. Lo stesso nome base senza il suffisso è la versione a pagamento: stabile, senza limiti e addebitata per token. I due possono coesistere, quindi passare da gratuito a pagamento è un cambiamento di una sola stringa.
I modelli gratuiti hanno due livelli di limiti. I fornitori upstream limitano i loro pool gratuiti e, in aggiunta, noi applichiamo un nostro limite per utente e per modello, così un singolo utente intensivo non può prosciugare un pool condiviso. Aspettati risposte 429 nelle ore di punta e usa un modello a pagamento quando ti serve affidabilità.
I limiti esatti, gli header e le linee guida sui retry sono documentati in Errori e limiti di frequenza
Ogni modello passa per uno o più gruppi di provider, ciascuno con il proprio prezzo; la tabella Group Pricing nella pagina del modello li elenca tutti. L'alta disponibilità vale sconti automatici, e un failover verso un altro gruppo può spostare il prezzo effettivo.

Per vincolare un modello a gruppi specifici e alle loro tariffe, vedi Blocco gruppi
La maggior parte dei modelli addebita per token, con prezzi separati per input e output. Alcuni modelli (per lo più immagine e video) addebitano invece un prezzo fisso per chiamata. Quello che vedi nella pagina del modello è ciò che paghi: nessun abbonamento, nessuna commissione nascosta, il tuo saldo diminuisce semplicemente a ogni richiesta.
La pagina Prezzi contiene le opzioni di ricarica attuali; ogni pagina di modello mostra i prezzi per token in tempo reale.
Per i modelli che supportano la cache dei prompt (Claude e altri), i prefissi di prompt ripetuti vengono addebitati a una tariffa ridotta di input in cache, mentre scrivere una nuova voce di cache costa un po' più di un normale token di input (circa 1,25x).
La cache è automatica. I carichi di lavoro con prompt di sistema lunghi e stabili (agenti, preset di RP) ne traggono il massimo vantaggio, senza alcuna configurazione.
Le richieste passano automaticamente al gruppo successivo quando uno raggiunge il limite o cade. Solo quando ogni canale di un modello è fuori uso il modello sparisce dal catalogo.
Un modello che sparisce sotto carico è previsto, non un guasto: ricompare da solo appena un canale si riprende, di solito in pochi minuti.
Le chiavi che bloccano gruppi di provider fanno failover solo entro i gruppi bloccati, vedi Blocco gruppi
Per essere avvisato appena torna, osservalo in Notifiche