Reduce tus costes de LLM un 50–90% · Privado por diseño · Cualquier modelo o agente

Envía cada prompt al modelo correcto — automáticamente

Conecta varios LLM — asequibles y premium — y nuestra API enruta cada prompt según el tipo de tarea y la complejidad. Impulsa tus apps y agentes de IA mientras reduces el gasto en LLM un 50–90% sin perder calidad.

Obtén tu clave Starter por 1 $

Introduce tu código promocional y tu correo. Creamos una clave, te la enviamos — y la mostramos aquí una sola vez.

🎁 Oferta de lanzamiento LAUNCH1 984 activaciones restantes
Inicio

¿Por qué enrutar?

Un solo endpoint decide qué necesita cada prompt. Tú controlas qué modelos usas.

💸

50–90 % más barato

La mayoría de los prompts son fáciles. Deja de pagar precio premium por «hola» y preguntas simples — envíalos a un modelo barato o local y reserva el caro para lo verdaderamente difícil.

Instantáneo y privado

El enrutamiento es instantáneo y no añade latencia perceptible — incluso con agentes que lanzan cientos de llamadas. El texto del prompt nunca se almacena, y nada sale de tu stack sin tu consentimiento.

🔓

Sin dependencia

Devolvemos el tipo de tarea y un nivel de complejidad — tú los asocias a los modelos que ya usas (OpenAI, Claude, llama.cpp, vLLM, Ollama…). Cambia de modelo cuando quieras.

Tecnología probada

Precisión con patente en trámite

Nuestro router no solo adivina el tipo de tarea — distingue categorías cercanas como negocios y finanzas con un 94% de precisión, para que cada prompt llegue al modelo adecuado.

⚖ Patente en trámite — Solicitud USPTO n.º 19/452,440 (presentada el 19 de enero de 2026)
94%

precisión separando tipos de tarea cercanos — p. ej. negocios y finanzas

Cómo funciona

1 · Envía un prompt

Haz POST del texto (o tu propio embedding) a /v1/route con tu clave.

2 · Recibe una decisión

Obtienes el tipo de tarea, una confianza calibrada y un nivel low / medium / high — en un JSON diminuto.

3 · Elige tu modelo

Asocia el nivel a tus modelos: fácil → barato/local, difícil → estrella. Listo.

# one routing decision
{
  "decision": { "task_label": "math", "confidence": 0.93,
                "complexity": { "tier": "low", "score": 0.27 } },
  "scores": [ { "task_label": "math", "probability": 0.93 }, … ]
}
Para agentes de IA

Hecho para agentes de IA y orquestadores

Los agentes autónomos lanzan cientos de llamadas a LLM por tarea — la mayoría simples. Enruta cada llamada al modelo del tamaño adecuado y reduce el coste del agente un 50–90% sin perder calidad.

🧩

Muchos modelos, un endpoint

Conecta varios LLM detrás de una sola decisión de enrutamiento — barato/local para pasos fáciles, estrella para razonamiento difícil. Sin lógica de selección de modelo en tu agente.

🎚️

Ajustado por tarea y complejidad

Cada llamada se clasifica por tipo de tarea y complejidad, así controlas exactamente qué modelo maneja qué — y lo cambias cuando quieras sin tocar el código del agente.

🤖

Encaja en tu framework

crewAI, AutoGPT, LangGraph, orquestadores MCP (Hermes) — cualquier cosa que llame a un LLM. Un endpoint, control total de tu pool de modelos.

Precios

Precios simples y honestos

Empieza por 1 $ y escala a tu ritmo. Cada plan se amortiza con creces — el ahorro en tus facturas de modelos supera de largo su precio.

Starter
Para probar
$1/mes
  • Ilimitado decisiones incluidas
  • 60/min límite
Clave por 1 $
Pro
Tráfico en producción
$49/mes
  • 1M decisiones incluidas
  • 600/min límite
  • $0.05 por 1k excedente
Solicitar acceso
Scale
Gran volumen y SLA
$299/mes
  • 10M decisiones incluidas
  • 3000/min límite
  • $0.02 por 1k excedente
Solicitar acceso

Todos los planes incluyen enrutamiento por tipo de tarea y complejidad. Las escaladas opcionales al oráculo (un LLM avanzado resuelve prompts nuevos) se cobran a coste. Empresa / on-premise: contáctanos.

Solicitar un plan de pago

Cuéntanos un poco sobre tu caso de uso y lo configuramos todo.