LLM Gateway: Turnstile auf alle LLM-Aufrufe
Rund 44 Stellen im Code riefen LLMs direkt auf (spawn claude, new OpenAI), und der OAuth-Token lag in der Umgebung jedes Prozesses – jeder Bot oder Loop konnte das Limit ungebremst verbrennen, ohne Budget-, Modell- oder Hänger-Kontrolle. Wir haben einen einzigen Checkpoint vor alle LLM-Aufrufe gesetzt. Statt ein Modell zu verlangen, fragt ein Verbraucher nach einer Aufgabe (task_kind); das Gateway wählt das Modell selbst über eine Capability-Matrix. Das Prinzip ist default-deny: ein nicht registrierter Verbraucher bekommt nichts. Der Anfrage-Pfad läuft über Auth (Consumer-Key), Task-Profil, Routing (Capability-Filter ∩ erlaubte Tiers, Ranking nach Tier/Kosten, Budget-Walk mit Downgrade oder 429), Concurrency-Gate (pro Verbraucher und global), Account-Wahl (LRU plus Cooldown) und Ausführung mit Hard-Timeout, der hängende Child-Prozesse killt. Budgets greifen pro Verbraucher und als globaler Tages-Cap in Dollar; reicht das Budget nicht, wird zunächst das Modell heruntergestuft, dann abgelehnt. Jeder Aufruf wird mit Tokens und Kosten in einem Usage-Log verbucht.
Was wir erreicht haben
Phase 0 (Skeleton) implementiert und produktiv mit Live-Board llm.seodach.com; CI-Guard wirft Umgehungen des Gateways.
LLM Gateway
Interne Tools / KI
Web-Entwicklung, Produkte
Sie haben ein ähnliches Projekt?
Erzählen Sie uns von Ihrem Vorhaben — wir zeigen Ihnen, wie wir ähnliche Ergebnisse für Ihr Unternehmen erzielen können.