LLM गेटवे क्या है?
LLM गेटवे एक एंडपॉइंट और कुंजी है जो अनुरोधों को कई मॉडल प्रदाताओं तक रूट करती है. यहाँ है यह क्या करता है, क्यों मदद करता है, और असल में किसे इसकी ज़रूरत है.
LLM गेटवे कई मॉडल प्रोवाइडरों के सामने एक ही API है: एक कुंजी, एक बिल, एक एंडपॉइंट, और रूटिंग व फेलओवर आपके लिए संभाल लिए जाते हैं। UnoRouter एक ओपन सोर्स गेटवे है जो OpenAI-संगत API से 200+ मॉडल देता है, साथ में Anthropic और Gemini के नेटिव एंडपॉइंट, अधिकांश मॉडलों पर फ्री टियर और बाकी पर पे-एज़-यू-गो कीमतें।
LLM गेटवे एक अकेला API एंडपॉइंट है जो कई मॉडल प्रदाताओं के आगे बैठता है और आपके अनुरोध को उस मॉडल तक रूट करता है जो आप माँगते हैं. हर लैब के लिए अलग कुंजी, बेस URL और SDK की विचित्रता रखने के बजाय, आप एक कुंजी और एक OpenAI-संगत एंडपॉइंट रखते हैं, और बाकी गेटवे सँभालता है. यह वही विचार है जो क्लासिक बैकएंड काम में एक API गेटवे का होता है, भाषा मॉडलों पर लागू. यहाँ है यह आपको क्या देता है.
सीधी परिभाषा
गेटवे एक OpenAI-संगत इंटरफ़ेस उजागर करता है, आम तौर पर /v1/chat/completions, और आपके अनुरोध के model फ़ील्ड को परदे के पीछे एक असली प्रदाता से मैप करता है. आप हर बार वही अनुरोध रूप भेजते हैं; गेटवे अपस्ट्रीम चुनता है, सही प्रदाता प्रमाण-पत्र जोड़ता है, किसी भी विचित्रता का अनुवाद करता है, और प्रतिक्रिया को धारा में वापस भेजता है. मॉडल बदलने पर आपका कोड नहीं बदलता, क्योंकि जिस अनुबंध के विरुद्ध आप कोड करते हैं वह स्थिर रहता है.
यह क्यों मदद करता है
तीन फ़ायदे. एक एकीकरण: एक एंडपॉइंट के विरुद्ध कोड करें और आप गेटवे के लाए हर मॉडल का इस्तेमाल कर सकते हैं, बिना प्रति-प्रदाता क्लाइंट के. एक बिल: सभी प्रदाताओं का उपयोग एक दर्जन अलग चालानों के बजाय एक ही शेष पर गिरता है. और आसान बदलाव: मॉडल बदलना एक-लाइन की संपादना है, इसलिए आप अपने ऐप को दोबारा जोड़े बिना प्रति-काम सबसे अच्छी कीमत या गुणवत्ता का पीछा कर सकते हैं. ज़्यादातर निर्माताओं के लिए अकेले एकीकरण पर बचा समय ही पूरी वजह है.
परदे के पीछे यह कैसे काम करता है
जब कोई अनुरोध आता है, गेटवे model में नाम पढ़ता है, मेल खाते अपस्ट्रीम प्रदाता को खोजता है, उस प्रदाता के प्रमाण-पत्र बदलता है, प्रदाता-विशिष्ट बॉडी फ़ील्ड दोबारा लिखता है, और कॉल आगे भेजता है. धारा में टोकन उसी कनेक्शन से वापस आते हैं, इसलिए आपकी ओर से यह एक सामान्य OpenAI कॉल जैसा लगता है. अच्छे गेटवे अस्थायी त्रुटियों पर दोबारा प्रयास, उपयोग व लागत का हिसाब, और एक ताज़ा मॉडल कैटलॉग जोड़ते हैं ताकि नए रिलीज़ आपके कुछ छुए बिना दिखें.
असल में किसे इसकी ज़रूरत है
आपको एक गेटवे चाहिए अगर आप एक से ज्यादा मॉडल इस्तेमाल करते हैं, कीमत और गुणवत्ता बदलने पर मॉडल बदलने की योजना है, या कुछ ऐसा बनाते हैं जो किसी एकल लैब से हार्ड-वायर नहीं होना चाहिए। कोडिंग एजेंट, चैट ऐप, कैरेक्टर चैट फ्रंट-एंड और आंतरिक टूल सभी को लाभ होता है। अगर आप वाकई सिर्फ एक प्रदाता का एक मॉडल कॉल करते हैं और कभी बदलने की उम्मीद नहीं, तो सीधी प्रदाता कुंजी सरल है। बाकी सभी को एक गेटवे से असली मेहनत की बचत होती है।
संक्षेप में
LLM गेटवे कई प्रदाताओं को एक एंडपॉइंट, एक कुंजी और एक बिल में बदल देता है, इसलिए आप एक बार एकीकृत करते हैं और मॉडल आज़ादी से बदलते हैं. UnoRouter ठीक इसी साँचे का एक OpenAI-संगत गेटवे है: एक कुंजी कोड और चैट दोनों के लिए 200 से ज़्यादा मॉडलों तक पहुँचती है, ऐसे जैसे-उपयोग-वैसे-भुगतान क्रेडिट के साथ जो समाप्त नहीं होते. अगर आप एक से ज़्यादा मॉडल छूते हैं, तो गेटवे ज़्यादा साफ़ नींव है.
खुद एक गेटवे आज़माएँ: मुफ़्त खाता बनाएँ या मॉडल देखें.
अक्सर पूछे जाने वाले सवाल
मुझे सीधे प्रोवाइडर कुंजी की जगह LLM गेटवे कब चाहिए?
जब आप एक से अधिक मॉडल परिवार इस्तेमाल करते हैं, किसी प्रोवाइडर के डाउन होने पर फेलओवर चाहते हैं, या एक ही बिल चाहते हैं। गेटवे हर विक्रेता के अलग खाते की जरूरत खत्म करता है और एक स्ट्रिंग बदलकर मॉडल बदलने देता है।
क्या LLM गेटवे लेटेंसी बढ़ाता है?
एक अतिरिक्त हॉप, आम तौर पर कुछ दसियों मिलीसेकंड, जिसे स्ट्रीमिंग व्यवहार में छिपा देती है। धीमे जवाब गेटवे से कहीं ज्यादा खुद मॉडल की वजह से आते हैं।
UnoRouter कौन से एंडपॉइंट देता है?
OpenAI-संगत /v1/chat/completions, /v1/responses और /v1/embeddings, Anthropic नेटिव /v1/messages, और Gemini नेटिव /v1beta, सब एक कुंजी के पीछे।
ai-model-verifier हमारे मॉडल टेस्टर के पीछे का इंजन है, जो AGPL-3.0 लाइसेंस के तहत npm पर प्रकाशित है। इसे एक बेस URL, एक कुंजी और एक मॉडल दें, और यह बताता है कि एंडपॉइंट वही दे रहा है या नहीं जो वह बेचता है, अब थिंकिंग सिग्नेचर और टोकन बिलिंग की जाँच के साथ।
UnoRouter का Discord टैग पहनने से मुफ़्त मॉडलों की दर-सीमा विंडो 25 प्रतिशत घट जाती है: जो मॉडल आप मिनट में एक बार बुला पाते थे, अब हर 45 सेकंड में बुला सकते हैं।
Nevika किसी भी OpenAI-संगत एंडपॉइंट को कस्टम प्रॉक्सी के रूप में स्वीकार करता है। यहाँ एक मिनट का सेटअप है, कौन सा मॉडल चुनें, और वे दो त्रुटियाँ जो सबको मिलती हैं।