איחדנו יותר מ-190 מודלי בינה מלאכותית חינמיים לנקודת קצה אחת
חיברנו 18 ספקים חינמיים אל UnoRouter: יותר מ-190 שורות מודלים חינמיים, נקודת קצה אחת OpenAI-compatible, $0 per token. הם נושאים מגבלות במעלה הזרם שאיננו יכולים להעלות, בתוספת תקרה קלה של בקשה אחת לדקה שאנחנו מוסיפים כדי לשמור על הוגנות המאגרים המשותפים. הנה הגרסה הכנה.
UnoRouter מאגד מכסות חינמיות מהרבה ספקי מקור ליותר מ-190 מודלים עם שכבה חינמית אמיתית מאחורי מפתח אחד. כל מודל חינמי מאפשר בערך 1 בקשה לדקה למשתמש; הגעה לתקרה מחזירה HTTP 429 עם כותרת Retry-After, ומאגרים שהתרוקנו מחזירים שגיאה מפורשת שכל הספקים עסוקים ומתאוששים אוטומטית. מודלים בתשלום מחויבים לפי צריכה החל מ-$1.
נוף מודלי ה-LLM החינמיים אמיתי אך מפוזר: Groq, Gemini, Cloudflare, NVIDIA, SiliconFlow ועוד תריסר, כל אחד מעניק קיבולת אמיתית בחינם, אך מאחורי תריסר דפי הרשמה, תריסר פורמטים של מפתחות ותריסר ממשקי API לא תואמים. גילינו, בדקנו ומיזגנו אל UnoRouter כל ספק לגיטימי וחינמי לצמיתות שהצלחנו למצוא. התוצאה: יותר מ-190 שורות מודלים חינמיים מ-18 ספקים מאחורי נקודת קצה אחת OpenAI-compatible ומפתח אחד.
מה הוספנו
שמונה עשר ספקים חינמיים, אחד אחד: Groq, Gemini, Cerebras, SambaNova, Mistral, Cloudflare Workers AI (שני חשבונות), GitHub Models, Z.ai, OVHcloud, AI Horde, Pollinations, Cohere, Jina, NVIDIA NIM (הקטלוג הפתוח המלא: Nemotron, Llama, Qwen, gpt-oss, DeepSeek ועוד), SiliconFlow (DeepSeek-V4, GLM-5.1, Qwen3.5/3.6, Kimi-K2.6, MiniMax-M3), נתב HuggingFace ו-LLM7. זה מסתכם ביותר מ-190 שורות מודלים חינמיים: Llama, gpt-oss, Qwen, Mistral, GLM, Nemotron, DeepSeek ועוד, ובנוסף מודלי הטמעה, תמונה ואודיו חינמיים. כל אחד נבדק מקצה לקצה עבור HTTP, הזרמה וקריאות לכלים לפני שהוא עולה לאוויר, אותן בדיקות אותנטיות ובדיקות מסגרת שאנו מריצים על מודלים בתשלום.
חינמיים מסיבה טובה
המודלים האלה חינמיים באמת, ובדיוק בגלל זה יש להם מגבלות. כל ספק במעלה הזרם אוכף את שלו: בקשות לדקה, מכסות טוקנים יומיות, תקציבי נוירונים של Cloudflare, עדיפות בתור המתנדבים. כשמגיעים לתקרה, אותו ספק מחזיר 429 עד לאיפוס. מפתח חינמי שעבד הבוקר עלול להתרוקן עד אחר הצהריים. הדרג החינמי הוא תפוקה במיטב המאמץ, לא הבטחה. אם עומס העבודה שלך זקוק להשהיה צפויה ובלי 429 מפתיעים, השתמש במודל בתשלום.
מגבלת הקצב שלנו, ולמה היא קיימת
מעל לתקרות שבמעלה הזרם אנחנו מוסיפים מגבלה קטנה משלנו: בקשה אחת לדקה לכל מודל חינמי, לכל משתמש. זה מכוון. מודל חינמי בודד הוא לרוב מאגר משותף אחד במעלה הזרם, של אולי מיליון טוקנים ביום לכולם יחד, כך שבלי תקרה קומץ משתמשים כבדים היו מרוקנים אותו תוך דקות וכל השאר לא היו רואים דבר. בקשה אחת לדקה לכל מודל שומרת על המאגר חי ומפזרת אותו על פני כל הקהילה, ואתה יכול לפזר את התעבורה על פני המודלים החינמיים הרבים במקום להלום במודל אחד. כשאתה מגיע לתקרה שלנו אתה מקבל HTTP 429 עם כותרת Retry-After שמציינת בדיוק כמה זמן להמתין. זה נפרד מה-429 שבמעלה הזרם ומה-503 שלמטה. אם אתה רוצה תפוקה גבוהה יותר במודל מסוים, השתמש בדרג בתשלום שלו, שבו המגבלה אינה חלה.
למה בכלל לאגד אותם
כי החלופה היא שמונה עשר חשבונות. לכל ספק יש הרשמה משלו, פורמט מפתח משלו, כתובת בסיס משלו, ומוזרויות משלו: Z.ai מדבר את נתיב Zhipu V4, Cloudflare נושא את מזהה החשבון בכתובת, AI Horde רוצה מפתח אנונימי, GitHub חוסם מודלים מאחורי היקף הרשאה של טוקן. ספגנו את כל זה כדי שתקראו להם כמו שאתם קוראים לכל דבר אחר: נקודת קצה אחת תואמת OpenAI-compatible, מפתח אחד, שם מודל. הכלל הכן שאנחנו מחויבים אליו: חשבון אמיתי אחד לכל ספק, התקרות מתקבלות, שום דבר לא מנוצל לרעה, שום דבר לא מאוגד יחד. אנחנו חושפים את השכבה החינמית כמתנה, לא כמכירה חוזרת של מכסה של מישהו אחר.
איך אנחנו מרככים את המגבלות
רבים מהמודלים האלה מוגשים על ידי יותר מספק חינמי אחד. Llama 3.3 70B לבדו רץ אצל שבעה מהם. כשכמה ספקים מציעים את אותו מודל, אנחנו מאחדים אותם תחת שם מפורסם אחד ומבצעים מעבר אוטומטי: אם ספק במעלה הזרם מחזיר 429 או משתתק, הספק התקין הבא שמגיש את אותו מודל תופס את הבקשה. זה הידית היחידה שאנחנו באמת שולטים בה. אם ברגע נתון כל הספקים של מודל מוגבלים בקצב, הבקשה מחזירה HTTP 503 עם הודעה מפורשת "כל הספקים עסוקים" (לא 404, ולא "המודל לא נמצא"), והערוץ נבדק מחדש ומופעל מחדש תוך דקות על ידי ה-cron הבריאותי שלנו. כך מודל חינמי רב-מקורות ממשיך להשיב זמן רב אחרי שאחד מספקיו התרוקן. למודלים חינמיים בעלי מקור יחיד אין גיבוי, ולכן הם נתקעים כשהספק היחיד שלהם במעלה הזרם מתרוקן.
מה לא עשינו
לא הוספנו פרוקסי הפוכים שמגישים מחדש את מודלי הדגל של OpenAI או Claude ללא רשות. לא הכנסנו מאגדי מפתחות אישיים שהטוקנים שלהם אינם ניתנים להעברה, או שירותי מאגר-של-מאגרים שמנצלים לרעה ומסובבים את המפתחות של אנשים אחרים. אלו קיימים והם מפתים והם בדיוק הבלגן של השוק האפור שהשער הזה נועד להחליף. כל ספק ברשימה מחלק את השכבה החינמית שלו במכוון, בתנאים שלו. אם מקור לא הצליח לעבור את הרף הזה, הוא לא כאן.
נסו את זה
כל יותר מ-190 המודלים החינמיים פעילים מאחורי נקודת קצה אחת OpenAI-compatible. קבל מפתח API או עיין בקטלוג המודלים וסנן לפי חינמי. רק זכור באיזה דרג אתה נמצא כשמופיע 429 או 503.
שאלות נפוצות
כמה מודלים חינמיים יש ל-UnoRouter?
יותר מ-190 בכל רגע, מתוך קטלוג של 200+ מודלים. ההרכב המדויק משתנה כשהמכסות החינמיות אצל הספקים מתרוקנות ומתאוששות, והרשימה החיה נמצאת ב-unorouter.com/models.
מהן מגבלות הקצב של השכבה החינמית?
בערך 1 בקשה לדקה לכל מודל לכל משתמש. התקרה מחזירה HTTP 429 עם כותרת Retry-After. עם 190+ מודלים חינמיים, התשובה המעשית היא להתחלף בין מודלים במקום לחכות.
צריך כרטיס אשראי בשביל המודלים החינמיים?
לא. נרשמים עם Discord או GitHub, יוצרים מפתח ומשתמשים בכל מודל עם הסיומת :free. בונוס אימות Discord חד-פעמי של $1 אפשר להוציא על המודלים בתשלום.
SpicyChat הוא אתר RP בלי הגדרות שהזיכרון וההקשר שלו חסומים מאחורי שכבות בתשלום. UnoRouter שומר על ההתחלה הקלה אבל מוסיף יותר מ-200 מודלים שאתם בוחרים, lorebooks עמוקים, ומפתח שגם מריץ סוכני קוד.
Agnai הוא ממשק RP בקוד פתוח שהבולט בו הוא ריבוי משתתפים אמיתי: כמה בני אדם וכמה בוטים בצ'אט אחד. ל-UnoRouter יש עומק RP למשתמש יחיד, מתארח, שבו המפתח הוא החשבון וגם מריץ את סוכני הקוד שלכם.
Open WebUI הוא ממשק צ'אט בהרצה עצמית שמתמקד ב-Ollama ושאתם מריצים ומזינים במפתחות. UnoRouter הוא יותר מ-200 מודלים מתארחים במפתח אחד, בלי תשתית, ובנוסף לקוח דמויות אמיתי, והמפתח גם כותב קוד.