Insights · Leitfaden
Warum KI-Pilotprojekte scheitern – und wie ein Agent in den Produktivbetrieb kommt.
Die meisten KI-Piloten erreichen nie den täglichen Betrieb, und die Gründe sind selten technisch. Dieser Leitfaden benennt die zehn häufigsten Ursachen, definiert, was Produktionsreife tatsächlich bedeutet, und beschreibt einen Phasenplan vom Piloten zu einem laufenden Agenten mit klarer Verantwortung.
Das Muster
Der Pilot, der nie endet
Den meisten Unternehmen fehlt es nicht an KI-Piloten. Ihnen fehlen KI-Systeme, die jeden Tag echte Arbeit erledigen. Das Muster ist vertraut: Eine Demo beeindruckt die Geschäftsführung, ein Pilot wird genehmigt, ein kleines Team baut etwas, das mit den Beispielen aus dem Foliensatz funktioniert – und dann tritt das Projekt in eine lange Dämmerphase des „fast fertig“ ein. Sechs Monate später ist das Budget aufgebraucht, der Sponsor hat gewechselt, und der Pilot wird still beerdigt, mit einem Lessons-Learned-Dokument, das niemand liest.
Das ist kein Technologieproblem. Die heutigen Modelle sind für eine breite Palette von Geschäftsaufgaben gut genug. Piloten scheitern aus organisatorischen und technischen Gründen, die in den ersten zwei Wochen sichtbar sind, wenn man weiß, wo man hinsehen muss. Dieser Beitrag benennt sie, definiert, was Produktionsreife tatsächlich bedeutet, und beschreibt einen Weg, der einen Agenten mit klarer Verantwortung in den täglichen Betrieb bringt.
Zehn Gründe, warum Piloten steckenbleiben
Nach unserer Erfahrung teilen scheiternde Piloten dieselbe Handvoll Ursachen. Sie gruppieren sich um drei Momente: vor dem Start, während des Aufbaus und rund um den Piloten in der Organisation.
Vor dem Start
Kein Verantwortlicher aus dem Fachbereich. Der Pilot gehört der IT, einem Innovationsteam oder einem externen Dienstleister, aber keine Bereichsleitung hat ihren Namen unter das Ergebnis gesetzt. Niemand kämpft für den Agenten, wenn er den Prozess stört, den er verändert.
Keine Ausgangsbasis und keine Erfolgskennzahl. Niemand hat gemessen, wie lange die Aufgabe vorher dauerte, wie viele Fälle pro Woche anfallen oder was ein Fehler kostet. Ohne Ausgangsbasis kann der Pilot nicht erfolgreich sein, weil Erfolg nie definiert wurde.
Der falsche erste Use Case. Teams wählen das eindrucksvollste Szenario statt des Falls mit hohem Volumen, klaren Regeln und verkraftbaren Fehlerkosten. Die Demo ist spektakulär, der Weg in den Produktivbetrieb unmöglich. Unser Leitfaden zur Auswahl des ersten Agenten-Use-Case behandelt die Auswahl im Detail.
Während des Aufbaus
Eine Demo auf handverlesenen Daten. Der Pilot funktioniert mit zwanzig sauberen Beispielen. Echte Postfächer enthalten gescannte PDFs, fehlende Felder, zwei Sprachen und einen Kunden, der in Großbuchstaben schreibt. Der erste Kontakt mit ungefilterten Daten ist oft das Ende des Piloten.
Keine Evaluationssuite. Jede Prompt-Änderung wird beurteilt, indem jemand ein paar Ausgaben ansieht. Niemand kann sagen, ob Version vier besser ist als Version drei, also streitet das Team, statt zu messen.
Integration und Berechtigungen auf später verschoben. Der Agent liest aus einer Exportdatei statt aus dem ERP und schreibt in eine Tabelle statt ins Ticketsystem. Ihn sauber anzubinden – mit Zugangsdaten, Rollen und Prüfpfaden – entpuppt sich als das eigentliche Projekt.
Kein Plan für Ausnahmen und Fehler. Was passiert, wenn der Agent unsicher ist, ein System ausfällt oder die Eingabe fehlerhaft ist? Lautet die Antwort „das merkt dann schon jemand“, kann der Agent nicht allein gelassen werden.
Rund um den Piloten
Governance und Betriebsrat zu spät eingebunden. Datenschutz, EU AI Act und Mitbestimmungsfragen tauchen in Woche zehn als Blocker auf statt in Woche eins als Gestaltungsvorgaben. Allein das kann einen Start um ein Quartal verzögern.
Kein Betriebsverantwortlicher nach dem Go-live. Die Berater gehen, die Prompts driften, ein Anbieter ändert eine Modellversion, und niemand hat die Aufgabe, das zu bemerken.
Change Management ignoriert. Die Menschen, deren Arbeit sich ändert, wurden informiert, nicht beteiligt. Sie arbeiten am Agenten vorbei, und die Nutzungszahlen belegen anschließend, dass er „nicht funktioniert hat“.
Was Produktionsreife tatsächlich bedeutet
„Produktionsreif“ wird lose verwendet, deshalb hilft eine Checkliste. Ein Agent ist bereit, wenn jede Zeile der folgenden Tabelle zutrifft – und ein Pilot ist ein Projekt, dessen Zweck es ist, sie zutreffen zu lassen.
| Bereich | Produktionsreif heißt | Was ein steckengebliebener Pilot meist hat |
|---|---|---|
| Evaluation | Ein Testset echter Fälle mit erwarteten Ergebnissen, das bei jeder Änderung automatisch läuft, mit vereinbarter Genauigkeitsschwelle | Ein paar per Augenschein geprüfte Beispiele |
| Beobachtbarkeit | Jeder Lauf wird nachvollziehbar erfasst: Eingaben, Tool-Aufrufe, Ausgaben, Kosten und Laufzeit, mit Alarmen bei Fehlerquoten | Konsolenausgaben auf dem Laptop eines Entwicklers |
| Berechtigungen | Eigene Zugangsdaten, minimale Rechte je System, schreibende Aktionen nach Risiko abgesichert | Ein geteiltes Admin-Konto |
| Rückfallebenen | Definiertes Verhalten bei geringer Sicherheit, Ausfällen und fehlerhaften Eingaben, mit einer Warteschlange für Menschen | Der Agent rät oder bricht ab |
| Kostenkontrolle | Budgets je Lauf und je Tag, Ratenbegrenzung, bekannte Kosten je bearbeitetem Fall | Niemand hat auf die Rechnung geschaut |
| Dokumentation | Was der Agent tut, was er nicht darf, wie man ihn ändert und wie man ihn abschaltet | Der Prompt ist die Dokumentation |
| Verantwortung | Ein benannter Fachverantwortlicher für das Ergebnis und ein benannter Betriebsverantwortlicher für das System | Das Projektteam |
| Schulung | Das betroffene Team weiß, wie es mit dem Agenten arbeitet, eskaliert und Feedback gibt | Eine Ankündigungs-E-Mail |
Vom Piloten in den Produktivbetrieb in vier Phasen
Der folgende Weg ist der, den wir in unseren Agenten-Piloten nutzen; sie erreichen in der Regel in sechs bis acht Wochen einen produktionsreifen Stand. Die Phasen zählen mehr als der Kalender.
Phase 1: Den Fall rahmen
Ein bis zwei Wochen. Den Fachverantwortlichen bestätigen, die Ausgangsbasis messen, Erfolgskennzahl und Fehlerbudget festlegen und die Ausnahmeregeln aufschreiben: welche Fälle der Agent allein bearbeitet, welche er für einen Menschen vorbereitet, welche er nicht anfassen darf. Datenschutz und, wo relevant, den Betriebsrat jetzt einbinden – mit einer einseitigen Beschreibung von Daten, Zweck und menschlicher Aufsicht.
Phase 2: Auf echten Daten bauen
Zwei bis drei Wochen. Die echten Systeme vom ersten Tag an anbinden, und sei es zunächst nur lesend. Das Evaluationsset aus echten historischen Fällen zusammenstellen, einschließlich der hässlichen. Den Agenten gegen dieses Set entwickeln und die Evaluation, nicht die Meinung, zwischen Versionen entscheiden lassen.
Phase 3: Schatten- und überwachter Betrieb
Zwei bis drei Wochen. Der Agent läuft auf echter Arbeit, aber ein Mensch prüft jede Ausgabe, bevor sie wirksam wird. Das liefert die Genauigkeitswerte, die Ausnahmequote und die Kosten je Fall, die Sie für die Go-live-Entscheidung brauchen – und es trainiert das Team im Umgang mit dem Verhalten des Agenten.
Phase 4: Go-live und Übergabe
Den Agenten zuerst für die risikoarmen Falltypen in den autonomen Betrieb schalten, Freigabeschritte für den Rest beibehalten und das System mit Monitoring, Runbook und Änderungsprozess an einen Betriebsverantwortlichen übergeben. Fehlt dieser intern, stellt Managed AI Operations ihn. Wie sich diese Phasen in ein größeres Programm einfügen, beschreibt unsere Seite So arbeiten wir.
Wie Sie mit der Geschäftsführung darüber sprechen
Geschäftsführungen lehnen keine Agenten ab. Sie lehnen Unsicherheit ab. Ein Pilotbericht, der eine Go-live-Entscheidung verdient, passt auf eine Seite und beantwortet fünf Fragen:
- Was hat die Aufgabe vorher gekostet, und was kostet sie jetzt je Fall, einschließlich Modell- und Plattformkosten?
- Wie genau arbeitet der Agent auf echter Arbeit, gemessen am Evaluationsset, und was passiert mit den Fällen, die er nicht bearbeiten kann?
- Was kann schiefgehen, wie wahrscheinlich ist es, und welche Kontrolle fängt es ab? Ein kurzes Risikoregister ist mehr wert als eine Beruhigung.
- Wer verantwortet das Ergebnis, und wer betreibt das System nach dem Go-live?
- Welche Entscheidung erbitten Sie: den Piloten verlängern, für bestimmte Falltypen live gehen oder stoppen?
Nehmen Sie die Stopp-Option ernst. Eine Geschäftsführung, die sieht, dass Sie einen schwachen Piloten beenden würden, vertraut Ihrer Empfehlung, einen starken zu skalieren. Und bleiben Sie ehrlich bei der Zahl, die am meisten zählt: nicht, was die Demo konnte, sondern was der Agent mit den echten Fällen des letzten Monats gemacht hat.
Häufige Fragen
Wie lange sollte ein KI-Pilot dauern?
Lang genug, um mehrere Wochen unter Aufsicht auf echter, ungefilterter Arbeit zu laufen, und kurz genug, dass der Sponsor noch im Raum ist. Für die meisten Agenten-Use-Cases sind das sechs bis acht Wochen von der Rahmung bis zu einem produktionsreifen Stand. Ein Pilot, der nach einem Monat noch keine echten Daten berührt hat, ist ein Prototyp, kein Pilot.
Sollten wir mit einem Piloten oder mit einer Strategie beginnen?
Haben Sie bereits einen Use-Case-Kandidaten mit Fachverantwortlichem und messbarem Ergebnis, lehrt Sie ein Pilot mehr als jedes Dokument. Haben Sie zwanzig Ideen und keinen Verantwortlichen, bewahrt Sie ein kurzes Readiness-Assessment oder ein Strategie-Sprint davor, das Falsche zu pilotieren.
Was, wenn der Pilot zeigt, dass der Agent nicht genau genug ist?
Dann war der Pilot erfolgreich: Er hat die Frage früh und günstig beantwortet. Oft liegt die Lösung in einem engeren Zuschnitt, besseren Daten oder einem menschlichen Kontrollpunkt für einen Falltyp. Manchmal lautet die ehrliche Antwort: aufhören. Das Evaluationsset sagt Ihnen, was zutrifft – deshalb lohnt es sich, es in Woche zwei aufzubauen.
Wer sollte den Agenten nach dem Go-live verantworten?
Zwei Personen. Der Fachverantwortliche trägt Ergebnis und Prozess; der Betriebsverantwortliche hält das System gesund, überwacht die Qualität und steuert Änderungen. Kleinere Unternehmen bündeln beide Rollen bei einer Bereichsleitung, mit externer Unterstützung für die technische Seite.
Weiterlesen und passende Leistungen
Entwicklung individueller KI-Agenten
Single- und Multi-Agenten-Systeme, entworfen und gebaut für den Produktivbetrieb: Tool-Nutzung, Gedächtnis, MCP-Server, Evaluierungs-Suiten, Guardrails und EU-Betrieb.
Managed AI Operations (AgentOps)
Monitoring, Evaluation, Modell-Upgrades, Kostenkontrolle und Incident-Handling für Agenten und LLM-Anwendungen nach dem Go-live – mit monatlichem Review und einer Dokumentation, die Ihre Prüfer lesen können.
So arbeiten wir
Fünf Phasen vom Assessment bis zum Betrieb, sechs Prinzipien, von denen wir nicht abweichen, und unsere Formate der Zusammenarbeit mit typischer Dauer.
Den ersten KI-Agenten-Use-Case wählen
Ein Bewertungsraster, die Merkmale guter und schlechter erster Use Cases, acht konkrete Kandidaten und ein Pilotdesign, das etwas beweist.
Finden wir den ersten Workflow, der sich wirklich lohnt.
Ein 30-minütiges Erstgespräch, ohne Folien und ohne Verpflichtung. Wir hören zu, fragen nach Ihren Prozessen und sagen Ihnen ehrlich, wo KI-Agenten sich rechnen – und wo nicht.