Envoyez chaque prompt au bon modèle — automatiquement
Connectez plusieurs LLM — abordables et premium — et notre API route chaque prompt selon le type de tâche et la complexité. Alimentez vos applis et agents IA tout en réduisant vos coûts LLM de 50 à 90% sans perte de qualité.
Obtenez votre clé Starter à 1 $
Saisissez votre code promo et votre e-mail. Nous créons une clé, vous l’envoyons — et l’affichons ici une seule fois.
Pourquoi router ?
Un seul endpoint décide ce dont chaque prompt a besoin. Vous gardez le contrôle des modèles que vous utilisez.
50 à 90 % moins cher
La plupart des prompts sont simples. Cessez de payer le prix fort pour « bonjour » et les questions basiques — routez-les vers un modèle bon marché ou local, et gardez le modèle coûteux pour le vrai travail difficile.
Instantané et privé
Le routage est instantané et n’ajoute aucune latence notable — même pour des agents lançant des centaines d’appels. Le texte du prompt n’est jamais stocké, et rien ne quitte votre stack sans votre accord.
Aucun verrouillage
Nous renvoyons le type de tâche et un niveau de complexité — vous les associez aux modèles que vous utilisez déjà (OpenAI, Claude, llama.cpp, vLLM, Ollama…). Changez de modèle quand vous voulez.
Précision en instance de brevet
Notre routeur ne se contente pas de deviner le type de tâche — il distingue des catégories proches comme business et finance avec 94% de précision, pour que chaque prompt atteigne le bon modèle.
précision pour séparer des types de tâches proches — p. ex. business et finance
Comment ça marche
1 · Envoyez un prompt
POST du texte (ou de votre propre embedding) vers /v1/route avec votre clé.
2 · Recevez une décision
Vous obtenez le type de tâche, une confiance calibrée et un niveau low / medium / high — dans un petit JSON.
3 · Choisissez votre modèle
Associez le niveau à vos modèles : simple → bon marché/local, difficile → modèle phare. Terminé.
# one routing decision { "decision": { "task_label": "math", "confidence": 0.93, "complexity": { "tier": "low", "score": 0.27 } }, "scores": [ { "task_label": "math", "probability": 0.93 }, … ] }
Conçu pour les agents IA et les orchestrateurs
Les agents autonomes déclenchent des centaines d’appels LLM par tâche — la plupart simples. Routez chaque appel vers le modèle adapté et réduisez le coût de l’agent de 50 à 90% sans perte de qualité.
Plusieurs modèles, un seul endpoint
Branchez plusieurs LLM derrière une seule décision de routage — bon marché/local pour les étapes simples, modèle phare pour le raisonnement difficile. Aucune logique de choix de modèle dans votre agent.
Ajusté par tâche et complexité
Chaque appel est classé par type de tâche et complexité : vous contrôlez exactement quel modèle traite quoi, et vous le changez quand vous voulez sans toucher au code de l’agent.
S’intègre à votre framework
crewAI, AutoGPT, LangGraph, orchestrateurs MCP (Hermes) — tout ce qui appelle un LLM. Un endpoint, contrôle total de votre pool de modèles.
Des tarifs simples et honnêtes
Commencez à 1 $ et évoluez avec votre usage. Chaque plan se rentabilise largement — les économies sur vos factures de modèles dépassent de loin son prix.
- 100k décisions incluses
- 120/min limite
- $0.10 par 1k dépassement
- 1M décisions incluses
- 600/min limite
- $0.05 par 1k dépassement
- 10M décisions incluses
- 3000/min limite
- $0.02 par 1k dépassement
Tous les plans incluent le routage par type de tâche et complexité. Les escalades oracle optionnelles (un LLM avancé résout les prompts inédits) sont facturées au coût. Entreprise / on-premise : contactez-nous.
Demander un plan payant
Parlez-nous un peu de votre cas d’usage et nous vous configurons tout.