Leistung · monatlicher Retainer
Agenten, die auch sechs Monate nach dem Start noch funktionieren.
Ein Agent, der im März gut lief, kann bis Juni leise nachlassen: Der Anbieter hat das Modell aktualisiert, jemand hat einen Prompt geändert, eine Datenquelle sieht plötzlich anders aus. Managed AI Operations heißt, das zu bemerken, bevor Ihre Kunden es tun. Wir überwachen, evaluieren, aktualisieren, kontrollieren Kosten und behandeln Störungen für Ihre Agenten und LLM-Anwendungen – und besprechen die Ergebnisse jeden Monat mit Ihnen.
Warum der Betrieb der schwierige Teil ist
Einen Agenten live zu bringen ist ein Projekt. Ihn präzise, sicher und bezahlbar zu halten ist eine Aufgabe – und die meisten Unternehmen haben sie niemandem übertragen.
Klassische Software verhält sich morgen wie heute, solange niemand den Code ändert. KI-Systeme nicht. Modellanbieter stellen Modelle kurzfristig ein und ersetzen sie, aktualisieren sie im laufenden Betrieb, ändern Preise und Ratenlimits und passen das Sicherheitsverhalten an. Auch Ihre Prompts, Datenquellen und Werkzeuge ändern sich. Jede dieser Änderungen kann die Ausgabequalität verschieben, ohne dass ein einziger Fehler im Log erscheint.
Die Folgen sind anfangs selten dramatisch. Antworten werden etwas länger, eine Klassifikation driftet, ein Werkzeugaufruf scheitert stillschweigend und der Agent arbeitet darum herum. Niemand merkt es, bis sich ein Kunde beschwert, eine Monatsrechnung sich verdoppelt oder ein Prüfer Belege dafür verlangt, wie Entscheidungen zustande kamen.
AgentOps, wie wir es betreiben, übernimmt, was Site Reliability Engineering für Web-Systeme geleistet hat: alles beobachten, jede Änderung testen, definieren, was „gut“ heißt, auf Störungen mit einem Plan reagieren und regelmäßig überprüfen. Der Unterschied: Beobachtet wird Sprache, nicht Latenz – und das macht die Evaluation zum Kern der Arbeit.
- FormatMonatlicher Retainer, je System zugeschnitten
- Service-LevelVertraglich festgelegt
- FürUnternehmen mit Agenten oder LLM-Anwendungen im Produktivbetrieb
- ErgebnisStabile Qualität, kontrollierte Kosten, prüfungsfähige Dokumentation
Was enthalten ist
Zu Beginn je System abgegrenzt, danach als monatlicher Service betrieben. Was Sie intern bereits abdecken, lassen wir schlicht weg.
Monitoring und Tracing
Jede Anfrage, jeder Werkzeugaufruf, jede Recherche und jede Modellantwort wird durchgängig nachverfolgt, mit Dashboards für Qualitätssignale, Latenz, Fehlerraten und Kosten. Wir arbeiten mit Werkzeugen wie Langfuse, LangSmith und OpenTelemetry-basierten Stacks – und mit dem, was Sie bereits betreiben.
Evaluationssuiten und Regressionstests
Ein kuratierter Satz echter Fälle mit erwarteten Ergebnissen je Agent, der automatisch läuft, sobald sich Prompt, Modell, Werkzeug oder Datenquelle ändern. Nichts geht in Produktion, ohne dieselben Tests zu bestehen wie beim Start.
Modell- und Versions-Upgrades
Stellt ein Anbieter ein Modell ein oder veröffentlicht ein besseres, testen wir den Kandidaten gegen Ihre Evaluationssuite, vergleichen Kosten und Qualität, migrieren in einem kontrollierten Zeitfenster und halten einen Rückweg offen.
Kosten- und Token-Budgetkontrolle
Budgets je Agent und je Team, Warnungen, bevor sie überschritten werden, und regelmäßige Optimierung: Caching, einfachere Anfragen an günstigere Modelle leiten, Kontext kürzen. Kostenberichte sind Teil des monatlichen Reviews.
Incident-Handling und Fallbacks
Definierte Schweregrade, Reaktion innerhalb der vertraglich vereinbarten Zeiten, Ausweichpfade, die den Prozess am Laufen halten, wenn ein Modell oder Werkzeug ausfällt, und eine schriftliche Nachbetrachtung für alles, was Nutzer betroffen hat.
Missbrauchserkennung und Audit-Dokumentation
Erkennung von Prompt-Injection-Versuchen, Missbrauch und ungewöhnlichen Mustern, plus die Protokolle, Änderungsnachweise und Evaluationsergebnisse, die eine Prüfung nach DSGVO oder EU AI Act verlangen wird. Siehe KI-Governance.
So läuft es ab
Onboarding und Ausgangsbasis
Wir erfassen die Systeme im Scope, schließen das Tracing an, bauen die Evaluationssuite aus echtem Verkehr auf oder erweitern sie und halten eine Qualitäts- und Kostenbasis fest. Bestehende Agenten bekommen einen Gesundheitscheck; gefundene Probleme werden behoben oder dokumentiert.
Runbooks und Service-Level
Gemeinsam definieren wir Schweregrade, Reaktionszeiten, Eskalationswege, Ausweichverhalten und wer eine Modelländerung freigeben darf. Service-Level werden vertraglich vereinbart und schriftlich festgehalten.
Regelbetrieb
Laufendes Monitoring, wöchentliche Qualitäts- und Drift-Prüfung, automatische Regressionstests bei jeder Änderung, Kostenverfolgung und Störungsbehandlung. Änderungen an Prompts und Modellen durchlaufen jedes Mal denselben kontrollierten Prozess.
Monatliches Review mit der Fachverantwortung
Eine Stunde mit der Person, die den Prozess verantwortet: Qualitätsverlauf, Störungen, Kosten, anstehende Modelländerungen, Verbesserungsliste. Entscheidungen werden festgehalten, und der Bericht dient zugleich als Audit-Dokumentation.
Vierteljährliche Tiefenprüfung
Ein weiterer Blick auf jeden Agenten: Löst er noch das richtige Problem, hat sich der Prozess um ihn herum verändert, sollte sein Umfang wachsen oder schrumpfen, was würde ein neueres Modell ermöglichen. Empfehlungen fließen in die Roadmap.
Für wen das gedacht ist
Unternehmen, deren Agenten wir gebaut haben
Die meisten Kunden unserer Leistungen KI-Agenten-Entwicklung und Workflow-Automatisierung gehen direkt in den Managed-Betrieb über. Die Evaluationssuite existiert bereits; wir halten sie am Laufen.
Unternehmen mit Agenten von anderen
Intern gebaut oder von einem früheren Partner – und die Person, die es gebaut hat, ist inzwischen weg. Wir beginnen mit einem Gesundheitscheck, ergänzen Tracing und Evaluation und übernehmen den Betrieb ohne Neubau.
Regulierte Unternehmen, die Belege brauchen
Wenn Prüfer, Aufsicht oder Unternehmenskunden fragen, wie sich Ihre KI verhält und woher Sie das wissen, sind Protokolle, Tests und Änderungsnachweise aus dem Betrieb die Antwort. Mehr unter Finanzdienstleister.
Softwareunternehmen mit KI-Funktionen im Produkt
Produktteams, die Qualität und Kosten im Griff haben wollen, ohne zuerst ein internes Plattformteam aufzubauen. Mehr unter Software & SaaS.
Wie wir den Betrieb führen
Erst evaluieren, dann ändern
Kein Modellwechsel, keine Prompt-Änderung und kein neues Werkzeug geht live, ohne die Regressionssuite zu bestehen. Bewusst unspektakulär.
Menschen sehen, was zählt
Warnungen sind auf die Signale abgestimmt, die Auswirkungen auf Nutzer vorhersagen, nicht auf alles, was sich messen lässt. Das monatliche Review findet mit der Fachverantwortung statt, nicht nur mit der IT.
Herstellerneutraler Betrieb
Wir betreiben Agenten auf OpenAI, Anthropic, Google, Mistral, Azure, AWS Bedrock, Vertex AI oder in der EU gehosteten offenen Modellen. Wenn ein Anbieterwechsel sinnvoll ist, empfehlen wir ihn, migrieren und bleiben neutral, wohin es geht.
Dokumentation als Nebenprodukt, nicht als Projekt
Traces, Testergebnisse und Änderungsnachweise entstehen aus dem Prozess selbst. Wenn eine Prüfung ansteht, muss nichts nachträglich rekonstruiert werden.
Werkzeuge und Plattformen im Betrieb
Wir nennen diese Werkzeuge, weil wir mit ihnen arbeiten. Partnerschaften oder Reseller-Verträge haben wir nicht; wir wählen die Werkzeuge je System.
Häufige Fragen
Welche Reaktionszeiten bieten Sie an?
Sie werden vertraglich je Schweregrad festgelegt, weil ein kundenseitiger Agent und ein internes Zusammenfassungswerkzeug unterschiedliche Anforderungen haben. Üblicherweise hat der höchste Schweregrad ein kurzes Reaktionsfenster mit Bereitschaftspfad, niedrigere Schweregrade werden innerhalb der Geschäftszeiten bearbeitet. Die Stufen werden beim Onboarding schriftlich festgehalten und monatlich berichtet.
Brauchen Sie Zugriff auf unsere Produktivsysteme?
Ja, aber eng begrenzt: Tracing-Endpunkte, Dashboards der Modellanbieter, die Deployment-Pipeline und, wo vereinbart, die relevanten Protokolle. Der Zugriff folgt dem Prinzip der minimalen Rechte, ist dokumentiert und jederzeit widerrufbar. Ein Auftragsverarbeitungsvertrag nach DSGVO ist Standard, und wenn Sie in der EU hosten, verlässt nichts Ihre Umgebung.
Können Sie Agenten betreiben, die wir selbst oder mit einem anderen Partner gebaut haben?
Ja. Wir beginnen mit einem Gesundheitscheck des Systems, seiner Prompts, Werkzeuge und Datenquellen und ergänzen Tracing und eine Evaluationssuite, falls sie fehlen. Framework und Plattform spielen kaum eine Rolle. Manchmal empfehlen wir Änderungen, aber die Übernahme des Betriebs setzt keinen Neubau voraus.
Was umfasst das monatliche Review?
Qualitätsverlauf gegenüber der Ausgangsbasis, Störungen und was daraus gelernt wurde, Kosten je Agent und je Team gegenüber dem Budget, anstehende Modellabkündigungen mit Migrationsplan und eine priorisierte Liste von Verbesserungen. Etwa eine Stunde mit der Fachverantwortung; die schriftliche Fassung dient als Audit-Dokumentation.
Wie gehen Sie mit der Abkündigung eines Modells um?
Wir verfolgen die Ankündigungen der Anbieter, sodass eine Abkündigung selten überrascht. Das Kandidatenmodell läuft gegen Ihre Evaluationssuite, Kosten und Qualität werden verglichen, und wenn die Ergebnisse tragen, migrieren wir in einem vereinbarten Zeitfenster mit Rückweg – in der Regel deutlich vor der Frist des Anbieters.
Ist das dasselbe wie MLOps?
Es gibt Überschneidungen, aber es ist nicht dasselbe. MLOps dreht sich um Training, Bereitstellung und Überwachung eigener Modelle. AgentOps dreht sich um LLM-basierte Systeme, die externe Modelle und Werkzeuge aufrufen – dort zählen Evaluation, Prompt-Versionierung, Zuverlässigkeit der Werkzeuge und Kostenkontrolle mehr als Trainingspipelines. Wenn Sie eigene Modelle trainieren, ist Datenbasis für KI der richtige Einstieg.
Passende Leistungen
Entwicklung individueller KI-Agenten
Single- und Multi-Agenten-Systeme, entworfen und gebaut für den Produktivbetrieb: Tool-Nutzung, Gedächtnis, MCP-Server, Evaluierungs-Suiten, Guardrails und EU-Betrieb.
Agentische Workflow-Automatisierung
Mehrstufige Geschäftsprozesse, Ende zu Ende automatisiert durch KI-Agenten über ERP, CRM, Ticketsystem und E-Mail – mit eingebauten Freigabeschritten für Menschen.
KI-Governance, EU AI Act & DSGVO
Ein KI-Register, eine Risikoeinstufung nach EU AI Act, DSGVO-konforme Prozesse und eine Nutzungsrichtlinie, die Ihre Teams tatsächlich befolgen – erarbeitet gemeinsam mit Ihren Juristen und Ihrem Datenschutzbeauftragten.
Guardrails für KI-Agenten
Acht Kontrollebenen, mit denen ein Agent in Ihren Systemen handeln darf, eine Zuordnung von Risikostufen zu Guardrails und ein Beispiel aus der Kreditorenbuchhaltung.
Finden wir den ersten Workflow, der sich wirklich lohnt.
Ein 30-minütiges Erstgespräch, ohne Folien und ohne Verpflichtung. Wir hören zu, fragen nach Ihren Prozessen und sagen Ihnen ehrlich, wo KI-Agenten sich rechnen – und wo nicht.