🔥 Neu: PultOS — Ihr Unternehmen auf einem Bildschirm • 71 fertige Integrationen • Server in Deutschland
Interne Tools / KI

LLM Gateway: Turnstile auf alle LLM-Aufrufe

Rund 44 Stellen im Code riefen LLMs direkt auf (spawn claude, new OpenAI), und der OAuth-Token lag in der Umgebung jedes Prozesses – jeder Bot oder Loop konnte das Limit ungebremst verbrennen, ohne Budget-, Modell- oder Hänger-Kontrolle. Wir haben einen einzigen Checkpoint vor alle LLM-Aufrufe gesetzt. Statt ein Modell zu verlangen, fragt ein Verbraucher nach einer Aufgabe (task_kind); das Gateway wählt das Modell selbst über eine Capability-Matrix. Das Prinzip ist default-deny: ein nicht registrierter Verbraucher bekommt nichts. Der Anfrage-Pfad läuft über Auth (Consumer-Key), Task-Profil, Routing (Capability-Filter ∩ erlaubte Tiers, Ranking nach Tier/Kosten, Budget-Walk mit Downgrade oder 429), Concurrency-Gate (pro Verbraucher und global), Account-Wahl (LRU plus Cooldown) und Ausführung mit Hard-Timeout, der hängende Child-Prozesse killt. Budgets greifen pro Verbraucher und als globaler Tages-Cap in Dollar; reicht das Budget nicht, wird zunächst das Modell heruntergestuft, dann abgelehnt. Jeder Aufruf wird mit Tokens und Kosten in einem Usage-Log verbucht.

München, Deutschland
Web-EntwicklungProdukte
Hard-Cap auf alle LLM-Kosten
Ergebnisse

Was wir erreicht haben

Phase 0 (Skeleton) implementiert und produktiv mit Live-Board llm.seodach.com; CI-Guard wirft Umgehungen des Gateways.

Kunde

LLM Gateway

Branche

Interne Tools / KI

Leistungen

Web-Entwicklung, Produkte

Sie haben ein ähnliches Projekt?

Erzählen Sie uns von Ihrem Vorhaben — wir zeigen Ihnen, wie wir ähnliche Ergebnisse für Ihr Unternehmen erzielen können.