Docs durchsuchen...

Tippen Sie, um die Dokumentation zu durchsuchen

Plattform-Leitfaden

Modelle & Preise

Das Suffix :free, Preise und warum Modelle verschwinden.

Die Modellseite listet Kontextfenster, Preise je Token, Endpunkte und Fähigkeiten. Jede Modellseite hat Codebeispiele. Nicht alle kostenlosen Modelle unterstützen Werkzeugaufrufe oder Bilder, daher die Fähigkeitsabzeichen prüfen.

Modellkatalog mit Preisen und Rabatt-Badges

Rankings zeigt anhand von Community-Tests, welche kostenlosen Modelle etwas taugen. Status verfolgt den Zustand der Anbieter.

Neu hier? Key holen und erste Anfrage senden dauert eine Minute im Schnellstart

Kostenlose Modelle tragen ein Suffix :free, zum Beispiel gpt-oss-120b:free

Ein :free-Modell wird nur an kostenlose Anbieter geleitet und nutzt nie das Guthaben. Derselbe Name ohne das Suffix ist die kostenpflichtige Variante: ohne Deckel, je Token abgerechnet. Der Wechsel ist eine Zeichenkette.

Kostenlose Modelle haben zwei Grenzen: den Deckel des Anbieters selbst und unseren Deckel je Nutzer und Modell. Zu Spitzenzeiten ist mit 429 zu rechnen. Wo Verlässlichkeit zählt, ein kostenpflichtiges Modell nutzen.

Die genauen Limits, Header und Retry-Hinweise dokumentiert Ratenlimits & Fehler

Modelle werden über Anbietergruppen geleitet, die jeweils eigen bepreist und unter Group Pricing gelistet sind. Hohe Verfügbarkeit bringt automatische Rabatte. Ein Failover kann den effektiven Preis ändern.

Gruppenpreis-Tabelle auf einer Modell-Detailseite

Wie du ein Modell auf bestimmte Gruppen und deren Tarife festlegst, zeigt Gruppen-Pinning

Die meisten Modelle rechnen je Token ab, Eingabe und Ausgabe getrennt bepreist. Bild und Video rechnen meist pauschal je Aufruf ab. Der Preis auf der Modellseite ist der zu zahlende Preis.

Die Preisseite listet die Aufladeoptionen. Modellseiten zeigen aktuelle Preise je Token.

Bei Modellen, die das unterstützen, werden wiederholte Prompt-Anfänge zum günstigeren Cache-Tarif abgerechnet. Das Schreiben eines Cache-Eintrags kostet etwa das 1,25-fache eines normalen Eingabe-Tokens.

Das Caching läuft automatisch. Lange, stabile System-Prompts profitieren am meisten.

Anfragen weichen auf die nächste Anbietergruppe aus, wenn eine ratenbegrenzt oder ausgefallen ist. Ein Modell verlässt den Katalog erst, wenn jeder Kanal ausfällt.

Dass ein Modell unter Last verschwindet, ist zu erwarten. Es kommt binnen Minuten zurück, sobald sich ein Kanal erholt.

Schlüssel mit gepinnten Anbietergruppen weichen nur innerhalb ihrer gepinnten Gruppen aus, siehe Gruppen-Pinning

Um sofort benachrichtigt zu werden, wenn es zurück ist, beobachte es unter Benachrichtigungen