Schicke jeden Prompt automatisch zum richtigen Modell
Binde mehrere LLMs ein — günstige und premium — und unsere API routet jeden Prompt nach Aufgabentyp und Komplexität. Treibe deine Apps und KI-Agenten an und spare 50–90% LLM-Kosten ohne Qualitätsverlust.
Hol dir deinen Starter-Schlüssel für 1 $
Gib Promo-Code und E-Mail ein. Wir erstellen einen Schlüssel, senden ihn dir — und zeigen ihn hier einmalig.
Warum überhaupt routen?
Ein Endpoint entscheidet, was jeder Prompt braucht. Welche Modelle du betreibst, bestimmst du.
50–90 % günstiger
Die meisten Prompts sind einfach. Zahle nicht länger Flaggschiff-Preise für „Hallo“ und simple Fragen — route sie an ein günstiges oder lokales Modell und spare das teure für wirklich Schweres.
Sofort & privat
Das Routing ist sofort und fügt keine spürbare Latenz hinzu — selbst wenn Agenten Hunderte Aufrufe machen. Dein Prompt-Text wird nie gespeichert, und nichts verlässt deinen Stack ohne deine Zustimmung.
Kein Lock-in
Wir liefern Aufgabentyp und Komplexitätsstufe — du verknüpfst sie mit deinen Modellen (OpenAI, Claude, llama.cpp, vLLM, Ollama…). Modelle jederzeit austauschbar.
Patentangemeldete Genauigkeit
Unser Router rät den Aufgabentyp nicht nur — er unterscheidet feine, benachbarte Kategorien wie Business und Finanzen mit 94% Genauigkeit, damit jeder Prompt das richtige Modell erreicht.
Genauigkeit bei der Trennung ähnlicher Aufgabentypen — z. B. Business vs. Finanzen
So funktioniert es
1 · Prompt senden
Sende den Text (oder dein eigenes Embedding) per POST an /v1/route mit deinem Schlüssel.
2 · Entscheidung erhalten
Du erhältst Aufgabentyp, kalibrierte Konfidenz und eine Stufe low / medium / high — in einem winzigen JSON.
3 · Modell wählen
Verknüpfe die Stufe mit deinen Modellen: einfach → günstig/lokal, schwer → Flaggschiff. Fertig.
# one routing decision { "decision": { "task_label": "math", "confidence": 0.93, "complexity": { "tier": "low", "score": 0.27 } }, "scores": [ { "task_label": "math", "probability": 0.93 }, … ] }
Gebaut für KI-Agenten & Orchestratoren
Autonome Agenten lösen pro Aufgabe Hunderte LLM-Aufrufe aus — die meisten einfach. Route jeden Aufruf zum passenden Modell und senke die Agentenkosten um 50–90% ohne Qualitätsverlust.
Viele Modelle, ein Endpoint
Binde mehrere LLMs hinter einer Routing-Entscheidung ein — günstig/lokal für einfache Schritte, Flaggschiff für schweres Reasoning. Keine Modellauswahl-Logik im Agenten.
Pro Aufgabe & Komplexität abgestimmt
Jeder Aufruf wird nach Aufgabentyp und Komplexität eingeordnet — du steuerst genau, welches Modell was bearbeitet, und änderst es jederzeit ohne den Agent-Code anzufassen.
Passt in dein Framework
crewAI, AutoGPT, LangGraph, MCP-Orchestratoren (Hermes) — alles, was ein LLM aufruft. Ein Endpoint, volle Kontrolle über deinen Modell-Pool.
Einfache, ehrliche Preise
Starte für 1 $ und skaliere mit. Jeder Plan rechnet sich um ein Vielfaches — die Ersparnis bei deinen Modellrechnungen übertrifft den Preis bei Weitem.
- 100k inkl. Entscheidungen
- 120/min Limit
- $0.10 pro 1k Mehrverbrauch
- 1M inkl. Entscheidungen
- 600/min Limit
- $0.05 pro 1k Mehrverbrauch
- 10M inkl. Entscheidungen
- 3000/min Limit
- $0.02 pro 1k Mehrverbrauch
Alle Pläne enthalten Routing nach Aufgabentyp und Komplexität. Optionale Oracle-Eskalationen (ein starkes LLM löst neue Prompts) werden zum Selbstkostenpreis berechnet. Enterprise / On-Prem: kontaktiere uns.
Bezahlten Plan anfragen
Erzähl uns kurz von deinem Anwendungsfall — wir richten alles ein.