我們把 190+ 個免費 AI 模型匯聚到了一個端點
我們已將 18 家免費供應商接入 UnoRouter:190+ 條免費模型、一個 OpenAI-compatible 端點、$0 per token。它們自帶我們無法提高的上游限額,我們還額外加了一道輕量的每分鐘 1 次上限,以維持共享池的公平。這是誠實的說法。
UnoRouter 把眾多上游供應商的免費額度彙整成 190 多個帶真正免費額度的模型,全部在一把金鑰之後。每個免費模型允許每位使用者每分鐘約 1 次請求;達到上限會回傳帶 Retry-After 標頭的 HTTP 429,額度耗盡的池子會回傳明確的所有供應商忙碌錯誤,並自動恢復。付費模型按量計費,$1 起。
免費 LLM 的版圖是真實存在的,卻又零散:Groq、Gemini、Cloudflare、NVIDIA、SiliconFlow 以及另外十幾家,各自都在免費送出真實算力,只是藏在十幾個註冊頁面、十幾種金鑰格式和十幾套互不相容的 API 背後。我們把能找到的每一家合法且永久免費的供應商都發現、測試並合併進了 UnoRouter。結果就是:來自 18 家供應商的 190+ 條免費模型,全都收在一個 OpenAI-compatible 端點和一把金鑰之後。
我們新增了什麼
十八家免費供應商,逐一列出:Groq、Gemini、Cerebras、SambaNova、Mistral、Cloudflare Workers AI(兩個帳戶)、GitHub Models、Z.ai、OVHcloud、AI Horde、Pollinations、Cohere、Jina、NVIDIA NIM(完整開放目錄:Nemotron、Llama、Qwen、gpt-oss、DeepSeek 等)、SiliconFlow(DeepSeek-V4、GLM-5.1、Qwen3.5/3.6、Kimi-K2.6、MiniMax-M3)、HuggingFace 路由器,以及 LLM7。這樣就有了 190+ 條免費模型:Llama、gpt-oss、Qwen、Mistral、GLM、Nemotron、DeepSeek 等,外加免費的嵌入、圖像和音訊模型。每一個在上線前都會針對 HTTP、串流傳輸和工具呼叫做端到端探測,這與我們在付費模型上執行的真實性檢查和測試框架檢查完全相同。
免費自有原因
這些模型是真正免費的,也正因如此它們才有限制。每個上游都各自設限:每分鐘請求數、每日 token 配額、Cloudflare 的神經元預算、志工佇列的優先級。一旦觸及上限,該供應商就會回傳 429,直到限額重置。今早還能用的免費金鑰,到下午就可能已經耗盡。免費層是盡力而為的吞吐量,而非保證。如果你的工作負載需要可預測的延遲、不希望冒出意外的 429,請使用付費模型。
我們自己的速率限制,以及它為何存在
在上游限額之上,我們再加了一道自己的小限制:每位使用者、每個免費模型每分鐘一次請求。這是刻意為之。單個免費模型往往就是一個共享的上游池,全體使用者合計每天也許只有一百萬 token,所以若沒有上限,少數重度使用者幾分鐘內就會把它抽乾,其他人則什麼都拿不到。每模型每分鐘一次,讓這個池得以存續並分攤到整個社群,你也可以把流量分散到眾多免費模型上,而不是死磕某一個。當你觸及我們的上限時,你會收到一個 HTTP 429,並附帶一個 Retry-After 標頭,準確告訴你需要等待多久。這與上游的 429 以及下文的 503 是兩碼事。如果你想在某個特定模型上獲得更高吞吐量,請使用它的付費層,那裡不適用此限制。
為什麼要把它們整合起來
因為不整合的話,就得管十八個帳號。每個供應商都有自己的註冊流程、自己的金鑰格式、自己的 base URL,還有各自的怪癖:Z.ai 走的是 Zhipu V4 路徑,Cloudflare 把帳號 id 放在 URL 裡,AI Horde 想要一把匿名金鑰,GitHub 則把模型擋在一道 token 權限範圍之後。這些我們全都消化掉了,讓你能用呼叫其他一切的方式來呼叫它們:一個 OpenAI-compatible 端點、一把金鑰、一個模型名稱。我們對自己堅守的誠實準則是:每家供應商只用一個真實帳號,配額照收,不刷量、不共池。我們把免費方案當成一份禮物提供,而不是轉售別人的配額。
我們如何緩和這些限制
這些模型中有許多是由不止一家免費供應商供給的。單是 Llama 3.3 70B 就跑在其中七家上。當多家供應商提供同一個模型時,我們會把它們合併到一個對外發布的名稱下,並自動進行故障轉移:如果某個上游回傳 429 或陷入沉默,供給該模型的下一家健康供應商就會接手這次請求。這是我們確實能掌控的唯一槓桿。如果某個模型的所有供應商一時間都被限速,請求會回傳一個 HTTP 503,附帶明確的"所有供應商繁忙"訊息(既不是 404,也不是"找不到模型"),隨後我們的健康檢查 cron 會在幾分鐘內重新測試並重新啟用該通道。這樣一來,多源免費模型在其任一供應商枯竭之後,仍能長時間繼續應答。單源免費模型沒有退路,因此一旦其唯一的上游用盡,就會停擺。
我們沒有做什麼
我們沒有加入那種未經許可、轉手再供應 OpenAI 或 Claude 旗艦模型的反向代理。我們沒有納入那些 token 不可轉讓的個人金鑰聚合服務,也沒有納入那種刷量並輪換他人金鑰的多重池中池服務。這類東西確實存在,也確實誘人,而它們正是這個閘道想要取代的那團灰色市場亂象。清單上的每一家供應商,都是依自己的條款、刻意把免費方案釋出來的。一個來源若過不了這道門檻,就不會出現在這裡。
親自試試
全部 190+ 個免費模型都在一個 OpenAI-compatible 端點之後執行。取得一把 API 金鑰,或瀏覽模型目錄並按免費篩選。只要在出現 429 或 503 時記住自己身處哪一層就好。
常見問題
UnoRouter 有多少個免費模型?
在 200+ 個模型的目錄中,任何時刻都有 190 多個免費。確切名單會隨上游免費額度池的耗盡與恢復而變動,即時列表見 unorouter.com/models。
免費額度的速率限制是多少?
每位使用者每個模型每分鐘約 1 次請求。達到上限會回傳帶 Retry-After 標頭的 HTTP 429。既然有 190+ 個免費模型,實際做法是輪換模型而不是空等。
使用免費模型需要信用卡嗎?
不需要。用 Discord 或 GitHub 註冊、建立金鑰,就能使用任何帶 :free 字尾的模型。一次性的 $1 Discord 驗證獎勵可以用在付費模型上。
SpicyChat 是一個零設定的角色扮演網站,它的記憶和上下文被關在付費級距後面。UnoRouter 保留了輕鬆的起步,但加上 200+ 個由你挑的模型、深度的 lorebooks,還有一把也能跑編碼代理的金鑰。
Agnai 是一個開源角色扮演前端,它的亮點是真正的多人:好幾個真人和好幾個機器人共處一場聊天。UnoRouter 有託管的單人角色扮演深度,這裡金鑰就是帳號,而且還能跑編碼代理。
Open WebUI 是一個自架、Ollama 優先的聊天 UI,你要自己跑並接上金鑰。UnoRouter 是 200 多個代管模型集於一把金鑰,沒有基礎設施,外加一個真正的角色客戶端,金鑰也能寫程式。