Połączyliśmy ponad 190 darmowych modeli AI w jeden endpoint
Podłączyliśmy do UnoRouter 18 darmowych dostawców: 190+ wierszy darmowych modeli, jeden endpoint OpenAI-compatible, $0 per token. Niosą one limity nadrzędne, których nie możemy podnieść, plus niewielki próg 1 na minutę, który dodajemy sami, aby wspólne pule pozostały sprawiedliwe. Oto uczciwa wersja.
UnoRouter agreguje darmowe pule wielu dostawców upstream w ponad 190 modeli z prawdziwym darmowym planem za jednym kluczem. Każdy darmowy model pozwala na około 1 zapytanie na minutę na użytkownika; po osiągnięciu limitu wraca HTTP 429 z nagłówkiem Retry-After, a wyczerpane pule zwracają jawny błąd, że wszyscy dostawcy są zajęci, i odzyskują się automatycznie. Płatne modele rozliczane są za zużycie już od $1.
Krajobraz darmowych LLM jest prawdziwy, ale rozproszony: Groq, Gemini, Cloudflare, NVIDIA, SiliconFlow i kilkunastu innych rozdaje realną moc, każdy za tuzinem stron rejestracji, tuzinem formatów kluczy i tuzinem niekompatybilnych API. Odkryliśmy, przetestowaliśmy i scaliliśmy w UnoRouter każdego legalnego, trwale darmowego dostawcę, jakiego udało nam się znaleźć. Efekt: 190+ wierszy darmowych modeli od 18 dostawców za jednym endpointem OpenAI-compatible i jednym kluczem.
Co dodaliśmy
Osiemnastu darmowych dostawców, jeden po drugim: Groq, Gemini, Cerebras, SambaNova, Mistral, Cloudflare Workers AI (dwa konta), GitHub Models, Z.ai, OVHcloud, AI Horde, Pollinations, Cohere, Jina, NVIDIA NIM (pełny otwarty katalog: Nemotron, Llama, Qwen, gpt-oss, DeepSeek i więcej), SiliconFlow (DeepSeek-V4, GLM-5.1, Qwen3.5/3.6, Kimi-K2.6, MiniMax-M3), router HuggingFace oraz LLM7. To 190+ wierszy darmowych modeli: Llama, gpt-oss, Qwen, Mistral, GLM, Nemotron, DeepSeek i więcej, a do tego darmowe modele embeddingów, obrazu i dźwięku. Każdy jest sprawdzany od początku do końca pod kątem HTTP, streamingu i wywołań narzędzi, zanim trafi na produkcję, te same kontrole autentyczności i testy stanowiskowe, które przeprowadzamy dla modeli płatnych.
Darmowe nie bez powodu
Te modele są naprawdę darmowe i właśnie dlatego mają limity. Każdy dostawca nadrzędny wymusza własne: żądania na minutę, dzienne limity tokenów, budżety neuronów Cloudflare, priorytet w kolejce wolontariuszy. Po osiągnięciu progu dany dostawca zwraca 429, dopóki limit się nie zresetuje. Darmowy klucz, który działał rano, po południu może być już wyczerpany. Poziom darmowy to przepustowość na miarę możliwości, a nie gwarancja. Jeśli Twoje obciążenie wymaga przewidywalnego opóźnienia i żadnych niespodziewanych 429, użyj modelu płatnego.
Nasz własny limit szybkości i dlaczego istnieje
Ponad limity nadrzędne dokładamy niewielki własny limit: jedno żądanie na minutę na darmowy model, na użytkownika. To celowe. Pojedynczy darmowy model to często jedna wspólna pula nadrzędna, licząca może milion tokenów dziennie dla wszystkich razem, więc bez progu garstka intensywnych użytkowników opróżniłaby ją w kilka minut, a reszta nie zobaczyłaby nic. Jedno żądanie na minutę na model utrzymuje pulę przy życiu i rozkłada ją na całą społeczność, a Ty możesz rozłożyć ruch na wiele darmowych modeli, zamiast walić w jeden. Po osiągnięciu naszego progu otrzymujesz HTTP 429 z nagłówkiem Retry-After, który dokładnie mówi, jak długo czekać. To coś odrębnego od nadrzędnego 429 i od 503 poniżej. Jeśli chcesz wyższej przepustowości dla konkretnego modelu, użyj jego poziomu płatnego, gdzie limit nie obowiązuje.
Po co w ogóle je agregować
Ponieważ alternatywą jest osiemnaście kont. Każdy dostawca ma własną rejestrację, własny format klucza, własny bazowy adres URL i własne dziwactwa: Z.ai mówi ścieżką Zhipu V4, Cloudflare przenosi id konta w adresie URL, AI Horde chce klucza anonimowego, a GitHub blokuje modele za zakresem tokena. Wzięliśmy to wszystko na siebie, żebyś wywoływał je tak samo jak wszystko inne: jeden punkt końcowy zgodny z OpenAI-compatible, jeden klucz, nazwa modelu. Uczciwa zasada, której się trzymamy: jedno prawdziwe konto na dostawcę, akceptacja limitów, nic na masówkę, nic że wspólnej puli. Udostępniamy darmowy poziom jako prezent, a nie jako odsprzedaż cudzego limitu.
Jak łagodzimy limity
Wiele z tych modeli obsługuje więcej niż jeden darmowy dostawca. Sam Llama 3.3 70B działa u siedmiu z nich. Gdy ten sam model oferuje kilku dostawców, scalamy ich pod jedną publikowaną nazwą i przełączamy się automatycznie: jeśli jeden dostawca nadrzędny zwróci 429 albo zamilknie, żądanie przejmuje kolejny sprawny dostawca obsługujący ten model. To jedyna dźwignia, którą faktycznie kontrolujemy. Jeśli w danej chwili wszyscy dostawcy modelu mają chwilowo przekroczony limit, żądanie zwraca HTTP 503 z wyraźnym komunikatem "wszyscy dostawcy zajęci" (nie 404 ani "nie znaleziono modelu"), a kanał zostaje ponownie przetestowany i włączony w ciągu minut przez nasz cron kondycji. Dzięki temu darmowy model wieloźródłowy odpowiada jeszcze długo po wyczerpaniu któregokolwiek z jego dostawców. Darmowe modele jednoźródłowe nie mają zapasu, więc zatrzymują się, gdy ich jedyny dostawca nadrzędny się wyczerpie.
Czego nie zrobiliśmy
Nie dodaliśmy reverse proxy, które bez pozwolenia ponownie serwują flagowe modele OpenAI czy Claude. Nie wciągnęliśmy agregatorów kluczy osobistych, których tokeny są nieprzenoszalne, ani usług typu pula pul, które masowo gromadzą i rotują cudze klucze. Takie rzeczy istnieją, kuszą i są dokładnie tym szarostrefowym bałaganem, który ten gateway ma zastąpić. Każdy dostawca z tej listy świadomie oddaje swój darmowy poziom, na własnych warunkach. Jeśli jakieś źródło nie przeszło tej poprzeczki, nie ma go tutaj.
Wypróbuj to
Wszystkie ponad 190 darmowych modeli działa za jednym endpointem OpenAI-compatible. Zdobądź klucz API lub przejrzyj katalog modeli i filtruj po darmowych. Pamiętaj tylko, na którym poziomie jesteś, gdy pojawi się 429 lub 503.
Najczęściej zadawane pytania
Ile darmowych modeli ma UnoRouter?
Ponad 190 w każdej chwili, z katalogu 200+ modeli. Dokładny zestaw zmienia się, gdy darmowe pule upstream wyczerpują się i odzyskują, a lista na żywo jest na unorouter.com/models.
Jakie są limity darmowego planu?
Około 1 zapytanie na minutę na model na użytkownika. Limit zwraca HTTP 429 z nagłówkiem Retry-After. Przy 190+ darmowych modelach praktyczna odpowiedź to rotowanie modeli zamiast czekania.
Czy potrzebuję karty kredytowej do darmowych modeli?
Nie. Zarejestruj się przez Discord lub GitHub, utwórz klucz i używaj dowolnego modelu z sufiksem :free. Jednorazowy bonus $1 za weryfikację Discord można wydać na płatne modele.
SpicyChat to strona RP bez konfiguracji, której pamięć i kontekst są ograniczone płatnymi progami. UnoRouter zachowuje łatwy start, ale dodaje ponad 200 modeli do wyboru, głębokie lorebooki oraz klucz, który uruchamia też agentów do kodowania.
Agnai to otwartoźródłowy frontend RP, którego wyróżnikiem jest prawdziwy multiplayer: kilku ludzi i kilka botów w jednym czacie. UnoRouter ma jednoosobową głębię RP hostowaną, gdzie klucz jest kontem i uruchamia też agentów do kodowania.
Open WebUI to hostowany samodzielnie interfejs czatu w duchu Ollamy, który sam uruchamiasz i podłączasz kluczami. UnoRouter to ponad 200 hostowanych modeli na jednym kluczu, bez infrastruktury, plus prawdziwy klient postaci, a klucz też koduje.