Envía cada prompt al modelo correcto — automáticamente
Conecta varios LLM — asequibles y premium — y nuestra API enruta cada prompt según el tipo de tarea y la complejidad. Impulsa tus apps y agentes de IA mientras reduces el gasto en LLM un 50–90% sin perder calidad.
Obtén tu clave Starter por 1 $
Introduce tu código promocional y tu correo. Creamos una clave, te la enviamos — y la mostramos aquí una sola vez.
¿Por qué enrutar?
Un solo endpoint decide qué necesita cada prompt. Tú controlas qué modelos usas.
50–90 % más barato
La mayoría de los prompts son fáciles. Deja de pagar precio premium por «hola» y preguntas simples — envíalos a un modelo barato o local y reserva el caro para lo verdaderamente difícil.
Instantáneo y privado
El enrutamiento es instantáneo y no añade latencia perceptible — incluso con agentes que lanzan cientos de llamadas. El texto del prompt nunca se almacena, y nada sale de tu stack sin tu consentimiento.
Sin dependencia
Devolvemos el tipo de tarea y un nivel de complejidad — tú los asocias a los modelos que ya usas (OpenAI, Claude, llama.cpp, vLLM, Ollama…). Cambia de modelo cuando quieras.
Precisión con patente en trámite
Nuestro router no solo adivina el tipo de tarea — distingue categorías cercanas como negocios y finanzas con un 94% de precisión, para que cada prompt llegue al modelo adecuado.
precisión separando tipos de tarea cercanos — p. ej. negocios y finanzas
Cómo funciona
1 · Envía un prompt
Haz POST del texto (o tu propio embedding) a /v1/route con tu clave.
2 · Recibe una decisión
Obtienes el tipo de tarea, una confianza calibrada y un nivel low / medium / high — en un JSON diminuto.
3 · Elige tu modelo
Asocia el nivel a tus modelos: fácil → barato/local, difícil → estrella. Listo.
# one routing decision { "decision": { "task_label": "math", "confidence": 0.93, "complexity": { "tier": "low", "score": 0.27 } }, "scores": [ { "task_label": "math", "probability": 0.93 }, … ] }
Hecho para agentes de IA y orquestadores
Los agentes autónomos lanzan cientos de llamadas a LLM por tarea — la mayoría simples. Enruta cada llamada al modelo del tamaño adecuado y reduce el coste del agente un 50–90% sin perder calidad.
Muchos modelos, un endpoint
Conecta varios LLM detrás de una sola decisión de enrutamiento — barato/local para pasos fáciles, estrella para razonamiento difícil. Sin lógica de selección de modelo en tu agente.
Ajustado por tarea y complejidad
Cada llamada se clasifica por tipo de tarea y complejidad, así controlas exactamente qué modelo maneja qué — y lo cambias cuando quieras sin tocar el código del agente.
Encaja en tu framework
crewAI, AutoGPT, LangGraph, orquestadores MCP (Hermes) — cualquier cosa que llame a un LLM. Un endpoint, control total de tu pool de modelos.
Precios simples y honestos
Empieza por 1 $ y escala a tu ritmo. Cada plan se amortiza con creces — el ahorro en tus facturas de modelos supera de largo su precio.
- 100k decisiones incluidas
- 120/min límite
- $0.10 por 1k excedente
- 1M decisiones incluidas
- 600/min límite
- $0.05 por 1k excedente
- 10M decisiones incluidas
- 3000/min límite
- $0.02 por 1k excedente
Todos los planes incluyen enrutamiento por tipo de tarea y complejidad. Las escaladas opcionales al oráculo (un LLM avanzado resuelve prompts nuevos) se cobran a coste. Empresa / on-premise: contáctanos.
Solicitar un plan de pago
Cuéntanos un poco sobre tu caso de uso y lo configuramos todo.