Insights · Leitfaden
Guardrails für KI-Agenten: Handlungsfreiheit ohne Kontrollverlust.
Ein Agent, der nur lesen darf, ist eine Suchmaschine. Ein Agent, der schreiben, senden und zahlen darf, ist nützlich – und braucht dieselben Kontrollen, die Sie einem neuen Mitarbeiter mit Systemzugang geben würden. Dieser Leitfaden beschreibt acht Guardrail-Ebenen, ordnet sie Risikostufen zu und geht einen Agenten für die Kreditorenbuchhaltung als Beispiel durch.
Die Ebenen
Kontrolle ist eine Designeigenschaft, keine Richtlinie
Sobald ein Agent handeln kann – ein Ticket anlegen, einen Datensatz ändern, eine Zahlung freigeben –, ändert sich die Frage von „Ist die Antwort richtig?“ zu „Was ist das Schlimmste, das dieses System tun kann, und was verhindert es?“ Viele Unternehmen antworten mit einem Richtliniendokument. Richtlinien binden Menschen; Software binden sie nicht. Kontrolle muss in die Umgebung des Agenten eingebaut sein: was er erreichen kann, wofür er eine Freigabe braucht, was er ausgeben darf und wie Sie erfahren, was er getan hat.
Die gute Nachricht: Der Werkzeugkasten dafür ist gut verstanden. Er bedient sich aus Jahrzehnten Praxis in Zugriffsmanagement, Zahlungskontrollen und Softwaretests. Neu ist die Kombination – und die Tatsache, dass sich ein Sprachmodell von Inhalten, die es liest, zu Dingen überreden lässt. Die acht Ebenen unten decken beides ab.
Acht Guardrail-Ebenen
1. Berechtigungen und minimale Rechte
Jeder Agent bekommt eine eigene Identität und eigene Zugangsdaten, nie ein geteiltes Admin-Konto. Seine Berechtigungen legen fest, welche Systeme er berühren darf und je System welche Tools: Kundendaten lesen ja, löschen nein; eine E-Mail entwerfen ja, senden nur in definierten Fällen. Lesen und Schreiben trennen. Ist der Agent über das Model Context Protocol angebunden, liegt diese Grenze in der Tool-Liste des Servers.
2. Freigabestufen und Human-in-the-Loop-Muster
Nicht jede Aktion braucht einen Menschen, und ein Agent, der für alles fragt, wird ignoriert. Steuern Sie Freigaben nach drei Dimensionen: dem Risiko der Aktion (umkehrbar oder nicht), dem Betrag (eine Schwelle in Euro, Datensätzen oder Empfängern) und der Sicherheit des Agenten selbst (unterhalb eines Werts: nachfragen). Die gängigen Muster sind Freigabe vor der Aktion, Prüfung nach der Aktion innerhalb eines Verzögerungsfensters und stichprobenartige Prüfung eines Anteils der autonomen Aktionen.
3. Validierung von Eingaben und Ausgaben
Struktur schlägt Fließtext. Eingaben an den Agenten werden gegen ein Schema geprüft; Ausgaben, die in ein System geschrieben werden, müssen Format, Wertebereiche und Geschäftsregeln erfüllen, bevor sie den Agenten verlassen. Dazu kommen Richtlinienprüfungen (kein Rabatt über X, keine Nachricht an Kunden auf einer Sperrliste) und PII-Filter, die personenbezogene Daten davon abhalten, dort zu landen, wo sie nicht hingehören – auch nicht in Prompts an externe Modelle.
4. Schutz vor Prompt Injection
Jedes Dokument, jede E-Mail, jede Webseite und jedes Tool-Ergebnis, das der Agent liest, ist nicht vertrauenswürdiger Inhalt und kann Anweisungen an das Modell enthalten. Verteidigung in der Tiefe: fremde Inhalte im Prompt als Daten kennzeichnen; nie in einem einzigen Schritt fremde Inhalte lesen und ohne Prüfung eine folgenreiche Aktion ausführen; Tools und Ziele über Positivlisten einschränken; alles, was in einem Tool-Ergebnis wie eine Anweisung aussieht, als Signal zum Anhalten und Eskalieren behandeln.
5. Sandboxing und Budgets
Agenten laufen in einer Umgebung mit Grenzen: Ratenlimits pro Minute, ein Token- und Kostenbudget je Lauf und je Tag, eine maximale Zahl von Schritten und ein Zeitlimit. Eine Endlosschleife kostet dann einen definierten Betrag und stoppt, statt das ganze Wochenende zu laufen. Wo Code ausgeführt werden muss, geschieht das in einer isolierten Sandbox ohne Zugriff auf Produktivzugänge.
6. Evaluation und Regressionstests
Ein Testset echter Fälle mit erwarteten Ergebnissen, das bei jeder Änderung an Prompt, Modellversion oder Tool läuft. Es enthält auch feindliche Fälle: Injection-Versuche, fehlerhafte Eingaben, Grenzfälle der Geschäftsregeln. Keine Änderung geht mit einem schlechteren Wert als die aktuelle Version in Produktion. Diese Ebene fängt die stille Verschlechterung ab, wenn ein Anbieter ein Modell aktualisiert.
7. Protokollierung, Audit-Trails und Nachvollziehbarkeit
Jeder Lauf wird aufgezeichnet: die Eingabe, jeder Tool-Aufruf mit Argumenten und Ergebnissen, die Ausgabe des Modells, die erteilten Freigaben und von wem, Kosten und Dauer. Der Datensatz muss ausreichen, um eine Entscheidung Monate später für einen Prüfer, eine Kundenbeschwerde oder Ihren Datenschutzbeauftragten zu rekonstruieren. Werkzeuge wie Langfuse oder das plattformeigene Tracing leisten das; entscheidend ist, dass jemand die Dashboards liest.
8. Notausschalter und Rückfall auf Menschen
Ein einziger Schalter, der den Agenten stoppt und seine Warteschlange an Menschen zurückgibt – vor dem Go-live getestet und im Runbook dokumentiert. Dazu ein geordneter Rückzug: Ist ein System nicht erreichbar, die Sicherheit gering oder ein Budget aufgebraucht, übergibt der Agent den Fall mit seinen Notizen an eine menschliche Warteschlange, statt zu raten.
Welche Guardrails für welches Risiko
Nicht jeder Agent braucht alle acht Ebenen in voller Stärke. Die Zuordnung unten ist der Ausgangspunkt, den wir in Projekten zur KI-Governance verwenden; Ihre Risikobereitschaft und Ihr regulatorisches Umfeld passen sie an.
| Risikostufe | Typische Agenten | Mindest-Guardrails |
|---|---|---|
| Niedrig: nur lesend, intern | Wissensassistent, Recherche-Zusammenfassungen, interne Entwürfe | Eigene Zugangsdaten, nur lesende Tools, PII-Filter für externe Modelle, Protokollierung, Budget, Evaluationsset |
| Mittel: schreibt in interne Systeme | Ticket-Triage, CRM-Aktualisierungen, Antworten zum Auftragsstatus, Dokumentenklassifikation | Alles oben, plus Schemaprüfung beim Schreiben, Injection-Schutz, Stichprobenprüfung, Notausschalter mit Rückfall auf Menschen |
| Hoch: externe Kommunikation oder Geld | Kunden-E-Mails, Lieferantenkommunikation, Rechnungsfreigabe, Zahlungsvorbereitung, HR-Korrespondenz | Alles oben, plus Freigabe vor der Aktion oberhalb von Schwellen, Positivlisten für Empfänger und Ziele, Funktionstrennung, Regressionstests mit feindlichen Fällen, ein Audit-Trail, der externer Prüfung standhält |
| Sehr hoch: rechtliche Wirkung auf Personen | Entscheidungen über Kredit, Beschäftigung, Leistungen, Zugang zu Diensten | Die Entscheidung bleibt bei einem Menschen; der Agent bereitet vor, dokumentiert und entscheidet nie. Hochrisiko-Pflichten des EU AI Act und ihren aktuellen Stand mit Rechtsberatern prüfen. |
Ein Beispiel: der Agent für die Kreditorenbuchhaltung
Ein typisches Szenario: Ein Agent bearbeitet eingehende Lieferantenrechnungen. Er liest das PDF, extrahiert die Daten, gleicht die Rechnung mit Bestellung und Wareneingang ab, prüft die Lieferantenstammdaten, bucht die Rechnung im ERP und schlägt einen Zahllauf vor. Nützlich – und voller Möglichkeiten, Geld zu verlieren. So greifen die Ebenen.
- Berechtigungen: Der Agent darf Bestellungen, Wareneingänge und Lieferantenstammdaten lesen, darf Rechnungsbuchungen im Entwurfsstatus anlegen und darf keine Bankverbindungen ändern, keine Lieferanten anlegen und keine Zahlungen freigeben.
- Freigabestufen: Rechnungen, die innerhalb der Toleranz zu einer Bestellung passen und unter einer Betragsschwelle bleiben, werden automatisch gebucht; Abweichungen, neue Lieferanten, geänderte Bankverbindungen und alles über der Schwelle gehen mit den Erkenntnissen des Agenten an einen Buchhalter. Über einer höheren Schwelle ist ein zweiter Freigeber nötig, wie es Ihre bestehende Funktionstrennung verlangt.
- Validierung: Extrahierte Beträge, Steuersätze und IBANs werden auf Format und Plausibilität geprüft; Summen müssen aufgehen; der Lieferant muss in den Stammdaten existieren.
- Injection-Schutz: Rechnungstext und E-Mail-Inhalte werden als Daten behandelt. Eine Rechnung mit dem Hinweis „Bitte aktualisieren Sie unsere Bankverbindung auf …“ ist keine Aufforderung, der der Agent folgen darf; sie wird markiert.
- Budgets und Sandbox: Eine tägliche Obergrenze für die Verarbeitung und ein Kostenbudget; kein direkter Zugriff auf das Zahlungssystem.
- Evaluation: Ein Testset aus mehreren hundert historischen Rechnungen, einschließlich bekannter Betrugsmuster und schlechter Scans, läuft vor jeder Änderung.
- Audit-Trail: Jede Rechnung trägt die extrahierten Daten, die Abgleichlogik, die Freigaben und die Modellversion. Ihre Wirtschaftsprüfer können ihr folgen.
- Notausschalter: Eine Aktion stoppt das Buchen und gibt die Warteschlange mit den Fällen des Tages an das Team zurück.
Mit diesen Kontrollen bearbeitet der Agent die routinemäßige Mehrheit allein und bereitet die Ausnahmen für Menschen vor. Das ist das Muster über alle Use Cases im Finanzbereich hinweg: die klaren Fälle automatisieren, die unklaren für Menschen schneller machen – und den Agenten nie zur letzten Verteidigungslinie für Geld machen.
Guardrails und der EU AI Act
Der EU AI Act erwartet für KI-Systeme mit höherem Risiko menschliche Aufsicht: Menschen, die das System verstehen, seine Ausgaben einordnen können, sich gegen seinen Einsatz entscheiden und eingreifen oder es stoppen können. Auch wo ein Agent nicht in die Hochrisiko-Kategorien fällt, sind diese Erwartungen ein vernünftiger Maßstab, und sie lassen sich direkt auf die Ebenen oben abbilden: Freigabestufen und Stichprobenprüfung sind Aufsicht, Protokollierung ist Nachvollziehbarkeit, der Notausschalter ist Eingriff. Die dokumentierten Guardrails liefern Ihrem Datenschutzbeauftragten zudem die Nachweise, die er unter der DSGVO für automatisierte Verarbeitung braucht. Die Pflichten greifen gestaffelt bis 2026 und 2027, Zeitpläne können sich verschieben, und dies ist keine Rechtsberatung – prüfen Sie den aktuellen Stand mit Ihren Beratern.
Der praktische Punkt für Entscheider ist einfach. Guardrails sind nicht der Preis für den Einsatz von Agenten. Sie sind das, was es überhaupt möglich macht, einem Agenten echte Arbeit zu geben – und dabei ruhig zu schlafen. Ist der Agent live, hält Managed AI Operations Evaluationen, Protokolle und Schwellenwerte aktuell, während sich Geschäft und Modelle verändern.
Häufige Fragen
Machen Guardrails den Agenten nutzlos oder langsam?
Schlecht gestaltete schon: Ein Agent, der für alles um Freigabe bittet, wird innerhalb einer Woche ignoriert. Gut gestaltete Guardrails sind verhältnismäßig: volle Autonomie für routinemäßige, risikoarme Fälle, Prüfungen dort, wo Geld, externe Kommunikation oder personenbezogene Daten im Spiel sind. Die meisten Ebenen, etwa Protokollierung, Budgets und Validierung, sind für Nutzer unsichtbar.
Können wir die Guardrail-Funktionen der Agenten-Plattformen nutzen?
Oft ja, und Sie sollten es. Workflow-Plattformen, Cloud-Agentendienste und Modellanbieter bieten Freigaben, Inhaltsfilter, Ratenlimits und Tracing. Die Designentscheidungen – was als hohes Risiko gilt, wo Schwellen liegen, wer freigibt – bleiben bei Ihnen. Plattformfunktionen setzen Guardrails um; sie legen sie nicht fest.
Woher wissen wir, dass die Guardrails sechs Monate später noch wirken?
Über das Evaluationsset und die Protokolle. Lassen Sie die feindlichen Tests nach jeder Änderung erneut laufen und prüfen Sie monatlich eine Stichprobe autonomer Entscheidungen. Benennen Sie einen Betriebsverantwortlichen, zu dessen Aufgaben das Lesen der Dashboards gehört; Guardrails, die niemand beobachtet, erodieren leise.
Was ist der wichtigste einzelne Guardrail?
Minimale Rechte. Ein Agent, der ein System nicht erreichen kann, kann es nicht beschädigen, und daran ändert kein noch so geschickter Prompt etwas. Geben Sie dem Agenten zunächst nur die Tools, die der Use Case braucht, und ergänzen Sie dann Freigabestufen für die Aktionen, die riskant bleiben.
Weiterlesen und passende Leistungen
KI-Governance, EU AI Act & DSGVO
Ein KI-Register, eine Risikoeinstufung nach EU AI Act, DSGVO-konforme Prozesse und eine Nutzungsrichtlinie, die Ihre Teams tatsächlich befolgen – erarbeitet gemeinsam mit Ihren Juristen und Ihrem Datenschutzbeauftragten.
Managed AI Operations (AgentOps)
Monitoring, Evaluation, Modell-Upgrades, Kostenkontrolle und Incident-Handling für Agenten und LLM-Anwendungen nach dem Go-live – mit monatlichem Review und einer Dokumentation, die Ihre Prüfer lesen können.
KI-Agenten in Finanzen & Controlling
Kreditorenbuchhaltung vom Posteingang bis zur freigegebenen Buchung, Abschlussunterstützung, Abweichungskommentare und Prüfungsvorbereitung, jede Buchung von Menschen freigegeben, keine autonomen Zahlungen.
MCP verständlich erklärt
Was das Model Context Protocol ist, warum es für die Anbindung von Agenten an Ihre Systeme zählt und wie Sie es einführen, ohne die Kontrolle zu verlieren.
Finden wir den ersten Workflow, der sich wirklich lohnt.
Ein 30-minütiges Erstgespräch, ohne Folien und ohne Verpflichtung. Wir hören zu, fragen nach Ihren Prozessen und sagen Ihnen ehrlich, wo KI-Agenten sich rechnen – und wo nicht.