Reunimos más de 190 modelos de IA gratuitos en un único endpoint
Conectamos 18 proveedores gratuitos en UnoRouter: 190+ filas de modelos gratuitos, un endpoint OpenAI-compatible, $0 per token. Traen límites de origen que no podemos aumentar, más un pequeño tope de 1 por minuto que añadimos nosotros para mantener justos los grupos compartidos. Esta es la versión honesta.
UnoRouter agrega los cupos gratuitos de muchos proveedores upstream en más de 190 modelos con un nivel gratuito real detrás de una sola clave. Cada modelo gratuito permite aproximadamente 1 solicitud por minuto por usuario; al alcanzar el tope se devuelve HTTP 429 con una cabecera Retry-After, y los pools agotados devuelven un error explícito de que todos los proveedores están ocupados y se recuperan automáticamente. Los modelos de pago cobran por consumo desde $1.
El panorama de los LLM gratuitos es real pero está disperso: Groq, Gemini, Cloudflare, NVIDIA, SiliconFlow y una docena más regalan capacidad genuina, cada uno detrás de una docena de páginas de registro, una docena de formatos de clave y una docena de APIs incompatibles. Descubrimos, probamos y unificamos en UnoRouter todos los proveedores permanentemente gratuitos y legítimos que pudimos encontrar. El resultado: 190+ filas de modelos gratuitos de 18 proveedores detrás de un único endpoint OpenAI-compatible y una sola clave.
Lo que agregamos
Dieciocho proveedores gratuitos, uno a uno: Groq, Gemini, Cerebras, SambaNova, Mistral, Cloudflare Workers AI (dos cuentas), GitHub Models, Z.ai, OVHcloud, AI Horde, Pollinations, Cohere, Jina, NVIDIA NIM (catálogo abierto completo: Nemotron, Llama, Qwen, gpt-oss, DeepSeek y más), SiliconFlow (DeepSeek-V4, GLM-5.1, Qwen3.5/3.6, Kimi-K2.6, MiniMax-M3), el router de HuggingFace y LLM7. Son 190+ filas de modelos gratuitos: Llama, gpt-oss, Qwen, Mistral, GLM, Nemotron, DeepSeek y más, además de modelos gratuitos de embeddings, imagen y audio. Cada uno se prueba de extremo a extremo para HTTP, streaming y llamadas a herramientas antes de entrar en producción, las mismas verificaciones de autenticidad y de arnés que ejecutamos en los modelos de pago.
Gratuitos por una razón
Estos modelos son realmente gratuitos, y por eso mismo tienen límites. Cada origen impone los suyos: solicitudes por minuto, cuotas diarias de tokens, presupuestos de neuronas de Cloudflare, prioridad en la cola de voluntarios. Al alcanzar un tope, ese proveedor devuelve 429 hasta que se restablece. Una clave gratuita que funcionaba esta mañana puede estar agotada por la tarde. El nivel gratuito es rendimiento de mejor esfuerzo, no una garantía. Si tu carga de trabajo necesita latencia predecible y ningún 429 por sorpresa, usa un modelo de pago.
Nuestro propio límite de tasa, y por qué existe
Además de los topes de origen añadimos un pequeño límite propio: una solicitud por minuto por modelo gratuito y por usuario. Es deliberado. Un solo modelo gratuito suele ser un único grupo de origen compartido de quizá un millón de tokens al día para todos en conjunto, así que sin un tope un puñado de usuarios intensivos lo agotaría en minutos y los demás no verían nada. Una por minuto y por modelo mantiene vivo el grupo y lo reparte entre toda la comunidad, y puedes distribuir el tráfico entre los muchos modelos gratuitos en lugar de machacar uno solo. Cuando alcanzas nuestro tope recibes un HTTP 429 con una cabecera Retry-After que te indica exactamente cuánto esperar. Esto es distinto del 429 de origen y del 503 de más abajo. Si quieres mayor rendimiento en un modelo concreto, usa su nivel de pago, donde el límite no se aplica.
Por qué agregarlos siquiera
Porque la alternativa son dieciocho cuentas. Cada proveedor tiene su propio registro, su propio formato de clave, su propia URL base y sus propias rarezas: Z.ai habla la ruta de Zhipu V4, Cloudflare lleva el id de cuenta en la URL, AI Horde quiere una clave anonima, GitHub restringe los modelos detras de un alcance de token. Absorbimos todo eso para que los llames como llamas a todo lo demas: un solo endpoint compatible con OpenAI, una sola clave, un nombre de modelo. La regla honesta que nos exigimos: una cuenta real por proveedor, topes aceptados, nada cultivado, nada agrupado. Exponemos el tier gratuito como un regalo, no como la reventa de la cuota de otro.
Cómo suavizamos los límites
Muchos de estos modelos los sirve más de un proveedor gratuito. Solo Llama 3.3 70B corre en siete de ellos. Cuando varios proveedores ofrecen el mismo modelo, los unificamos bajo un único nombre publicado y conmutamos automáticamente: si un origen devuelve un 429 o se queda en silencio, el siguiente proveedor sano que sirve ese modelo se hace cargo de la solicitud. Esa es la única palanca que sí controlamos. Si en un momento dado todos los proveedores de un modelo están limitados por tasa, la solicitud devuelve un HTTP 503 con un mensaje explícito de "todos los proveedores ocupados" (no un 404, ni un "modelo no encontrado"), y nuestro cron de salud vuelve a probar y reactivar el canal en cuestión de minutos. Así, un modelo gratuito con varias fuentes sigue respondiendo mucho después de que cualquiera de sus proveedores se agote. Los modelos gratuitos de una sola fuente no tienen respaldo, así que se paran cuando su único origen se agota.
Lo que no hicimos
No agregamos proxies inversos que revenden los modelos insignia de OpenAI o Claude sin permiso. No incorporamos agregadores de claves personales cuyos tokens son intransferibles, ni servicios de pool de pools que cultivan y rotan las claves de otras personas. Esos existen, son tentadores y son exactamente el desorden de mercado gris que este gateway viene a reemplazar. Cada proveedor de la lista regala su tier gratuito a proposito, bajo sus propios terminos. Si una fuente no podia superar ese liston, no está aquí.
Pruebalo
Los más de 190 modelos gratuitos están en producción detrás de un único endpoint OpenAI-compatible. Consigue una clave de API o explora el catálogo de modelos y filtra por gratuitos. Solo recuerda en qué nivel estás cuando aparezca un 429 o un 503.
Preguntas frecuentes
¿Cuántos modelos gratuitos tiene UnoRouter?
Más de 190 en cualquier momento, de un catálogo de 200+ modelos. El conjunto exacto cambia a medida que los pools gratuitos upstream se agotan y se recuperan, y la lista en vivo está en unorouter.com/models.
¿Cuáles son los límites de uso del nivel gratuito?
Aproximadamente 1 solicitud por minuto por modelo por usuario. Al llegar al tope se devuelve HTTP 429 con una cabecera Retry-After. Con 190+ modelos gratuitos, la respuesta práctica es rotar de modelo en lugar de esperar.
¿Necesito tarjeta de crédito para los modelos gratuitos?
No. Regístrate con Discord o GitHub, crea una clave y usa cualquier modelo con el sufijo :free. Un bono único de verificación de Discord de $1 se puede gastar en los modelos de pago.
SpicyChat es un sitio de rol sin configuración cuya memoria y contexto quedan tras niveles de pago. UnoRouter mantiene el arranque fácil pero añade más de 200 modelos que eliges, lorebooks profundos, y una clave que además ejecuta agentes de programación.
Agnai es un front-end de rol de código abierto cuyo rasgo distintivo es el multijugador real: varios humanos y varios bots en un mismo chat. UnoRouter tiene profundidad de rol para un solo usuario, alojada, donde la clave es la cuenta y además ejecuta agentes de programación.
Open WebUI es una interfaz de chat autoalojada, centrada en Ollama, que ejecutas y configuras con claves. UnoRouter son más de 200 modelos alojados en una sola clave, sin infraestructura, más un cliente de personajes de verdad, y la clave también programa.